核聚变研究正朝着实现人类终极能源梦想大步迈进,位于法国南部的国际热核实验堆(ITER)项目耗资约220亿美元,其核心目标是在人类历史上首次达成核聚变的净能量增益。然而,在通往这一目标的道路上,存在一个亟待攻克的重大难题——等离子体破裂现象。
托卡马克装置作为当前最成功的磁约束聚变技术载体,其工作原理是将氢的同位素加热至超过1亿摄氏度,使其转变为等离子体状态,再利用精心设计的磁场将这团炽热的等离子体悬浮于半空,避免与任何材料接触。但一旦磁场约束失效,等离子体会在几毫秒内将储存的巨大热能和磁能瞬间释放到反应堆壁上,造成灾难性后果。剑桥大学的研究表明,即便等离子体破裂率处于中等水平,也会使聚变电厂的发电成本大幅攀升,难以实现商业化。因此,提前50到100毫秒精准预测等离子体破裂,让控制系统能够及时优雅地终止放电,成为任何反应堆级装置确保安全运行的底线要求。
为实现对等离子体破裂的精准预测,人工智能和机器学习技术近年来被大量引入等离子体诊断领域。从深度循环神经网络到卷积神经网络,各类算法在完整无缺的传感器数据上展现出越来越出色的性能。然而,这些模型几乎都基于一个隐性假设——传感器提供的数据完整且可靠。但在现实场景中,这一假设往往难以成立。
实际情况是,采集系统时常启动延迟,导致前端信号缺失;单个传感器可能因热损伤或电磁干扰而中途失效。更为棘手的是,这些故障并非随机分布,而是集中在等离子体最不稳定、预测最为关键的破裂临近时刻。此时,强烈的热冲击和电磁瞬变会主动破坏传感器性能,使数据采集面临巨大挑战。
一位独立研究者关注到这一关键问题。尽管目前最权威的托卡马克等离子体AI基准测试框架TokaMark已将“对不完整状态信息的鲁棒性”列为四大核心评估维度之一,但在其相关论文中却未对该维度进行实际测量。于是,这位研究者决定填补这一空白,开展了一项针对等离子体诊断机器学习模型抗干扰能力的系统全面评测。
在MAST数据集基础上,TokaMark框架定义了14个预测任务,并按照8:1:1的比例将放电数据划分为训练集(9270次)、验证集(1157次)和测试集(1146次)。研究者选取其中第4 - 4号任务作为核心测试场景,该任务要求根据150毫秒的诊断历史数据,预测100毫秒之后的等离子体电流值。这一任务不仅与破裂安全直接相关,而且等离子体电流骤降是全面破裂的清晰前兆之一。
该任务的输入涵盖18路信号,包括14路诊断信号和4路执行器信号,这些信号覆盖了MAST诊断系统的全谱,如磁通量环、拾波线圈、鞍形线圈等磁场诊断,干涉仪和D - alpha光谱仪等动力学诊断,软X射线相机等辐射诊断,主动线圈电流以及记录等离子体电流本身的信号。研究者将这些信号统一重采样为600个时间步的时间序列,形成一个(600, 18)的张量,作为深度学习模型的输入。
在正式开展“压力测试”前,研究者搭建了四种具有代表性的架构模型,每种模型都体现了独特的信号处理方式。第一种是XGBoost,这是一种基于决策树集成的经典机器学习模型。它不直接处理时间序列,而是先将每路信号压缩成142个统计摘要特征,如均值、标准差、最小值、最大值等,然后使用500棵决策树(约50万个决策节点)进行预测。第二种是LSTM(长短期记忆网络),作为专门处理序列数据的循环神经网络,它按时间顺序逐步读取输入序列,利用两层隐藏层(每层128个单元)处理整条时间序列,并根据最后时刻的隐藏状态进行预测,天然地对靠近末端的信息赋予更高权重。第三种是Transformer,近年来在自然语言处理和计算机视觉领域表现卓越。它通过“自注意力”机制同时审视序列中所有时间步,计算任意两个时间点之间的关联强度,综合全局信息做出预测。第四种是TokaMark官方CNN基线模型,基于多分支卷积神经网络结构,为18路输入信号分别配备独立的一维卷积编码器,学习各信号的时序模式,然后将18路编码结果拼接,通过共享的全连接层输出预测值。这四种模型的参数数量大致在30万到50万之间,均在200次放电的训练数据(提取约9950个预测窗口)上进行训练,在50次放电的测试数据(约2420个窗口)上进行评估,训练过程中采用早停机制防止过拟合。
为设计合理的“压力测试”场景,研究者首先对真实数据中的缺损情况进行了详细测量。从FAIR - MAST上随机抽取300次放电,测量各类诊断信号的自然缺损情况。测量结果显示,不同诊断类别的缺损率差异显著。等离子体电流信号和线圈电流信号在所有300次放电中都完整无缺,这体现了工程上对控制系统依赖信号的重点保护。磁通量环和软X射线信号偶有缺损,平均约2%到4%。而动力学诊断中的干涉仪和D - alpha光谱仪平均缺损14%到15%,且通常以“前段缺失”形式出现,即每次放电开始时有一段信号空白,原因是采集系统启动较晚。更有趣的是,干涉仪和D - alpha光谱仪的缺损率在每次放电中完全相同,相关系数高达r = 1.000,这是由于这两个诊断共用同一个采集触发器,触发器延迟启动导致两个信号同时缺失。基于这些发现,研究者设计了六种符合物理实际的故障场景。
这六种“压力测试”场景从温和到极端依次展开。第一种是随机点状缺失,模拟数字化采集系统的随机毛刺或传感器瞬时噪声,将信号矩阵中随机选取的10%、25%或50%的数值点清零,且仅对原本有值的位置操作。第二种是整通道剔除,模拟传感器物理损坏或断开连接,随机选取1、3或6个完整的诊断通道,在整个150毫秒窗口内将其全部清零。第三种是按诊断类别逐一剔除,按照TokaMark信号分类体系,将磁通量环、拾波线圈、鞍形线圈等八大类别信号各自单独清零,进行“灵敏度分析”,判断每个架构对哪些信号最为依赖。第四种是时间段缺失,连续清零整个窗口中某一段时间内所有通道的数据,缺失段长度为窗口的20%、40%或60%,同时测试前段缺失(模拟采集延迟)、随机位置缺失(模拟放电中途偶发故障)和末端缺失(接近预测时刻的故障,即“临近事件前缺失”)三种缺失位置。第五种是相关诊断组同时失效,基于前面发现的共用触发器现象,将动力学组(干涉仪加D - alpha)、主动磁性组(所有拾波线圈)、辐射组(两路软X射线相机)或Mirnov频谱仪组中的所有信号同时清零。第六种是“破裂临近时刻的传感器失效”,在预测窗口的最末端(占窗口10%、25%或50%的尾部时间段)注入缺失,这是六种场景中最具安全意义的一种,因为破裂临近时等离子体最不稳定,传感器面临最强烈的热冲击和电磁瞬变,信号最易丢失,而此时恰恰是预测系统最需要准确工作的时刻。
为在四种架构之间进行横向比较,研究者引入了鲁棒性评分(Robustness Score,RS)这一新指标。其计算方法是将模型在干净数据上的误差除以在受损数据上的误差,再对所有零值填充场景取平均。RS等于1.0表示信号损坏对模型无影响;RS低于1.0表示模型性能下降,数值越低下降越严重。预测误差采用归一化均方根误差(NRMSE)衡量,该指标将预测误差除以目标变量的标准差进行归一化,NRMSE等于1.0表示模型预测能力与直接猜测均值相当,低于1.0才具有实际预测价值。研究者还引入了面向实际部署的“放电级别报警指标”,利用FAIR - MAST中精确记录的破裂时刻t_cut,测试每个模型能否在破裂前发出有效报警,并统计真正报警率(TPR,多大比例的破裂放电在破裂前收到报警)和平均预警时间(MWT,报警与破裂之间的平均时间间隔)。由于所有50个测试放电均发生破裂,无法计算误报率,但TPR和MWT足以揭示关键问题。
在干净数据环境下,四位“选手”表现各有不同。Transformer以NRMSE 0.470获得最佳预测精度,但其鲁棒性评分RS仅为0.765,是四者中最低之一。XGBoost预测精度略逊一筹(NRMSE 0.494),却获得最高的鲁棒性评分(RS 0.841)。LSTM居中(NRMSE 0.496,RS 0.808)。CNN基线模型预测精度稍差(NRMSE 0.528),鲁棒性评分与Transformer几乎相同(RS 0.764)。需说明的是,为控制实验规模,研究者仅使用200次放电训练模型,而TokaMark官方训练集是9270次放电,因此绝对NRMSE数值高于官方基线(0.429),但这不影响鲁棒性比较的有效性,因为相对降幅由架构决定,与训练集大小无关。在放电级别报警指标上,干净数据下CNN以TPR = 0.60领先,即50次破裂放电中30次在破裂前收到报警。LSTM为0.52,Transformer为0.48,XGBoost为0.40。然而,所有模型的平均预警时间都只有12到15毫秒,远低于ITER要求的50到100毫秒,表明Task 4 - 4的100毫秒预测窗口本身不足以支撑反应堆级别的破裂预防操作。
随机点状缺失实验揭示了各架构的差异。当50%的数值被随机清零时,CNN性能下降最为剧烈,NRMSE升高201%,几乎是干净状态的三倍误差。XGBoost也损失惨重,升高145%。LSTM升高57%,Transformer升高85%,相对影响较小。当引入“前向填充”修复策略(用每个缺失点前最近的有效值填补空缺)后,情况发生戏剧性变化。对于LSTM,50%随机缺失加前向填充后,NRMSE几乎回到零降幅;Transformer的降幅也接近于零。这是因为前向填充将随机破损的信号变成分段常数信号,而模型在训练中已见过类似形态的信号。CNN和XGBoost通过均值填充也有部分恢复,但效果不如序列模型使用前向填充明显。
按诊断类别逐一剔除实验揭示了信号的重要性层级。等离子体电流(summary - ip)是核心“命脉”,切掉它之后,LSTM的NRMSE上升139.8%,Transformer上升89.1%,XGBoost上升72.7%,CNN上升27.7%。主动线圈电流位居第二重要,切掉它之后,Transformer降幅36.0%,XGBoost降幅28.5%,CNN降幅46.9%。CNN对主动线圈电流信号缺失格外敏感,原因是其架构中每个通道有独立卷积编码器,一旦某编码器输入被切断就完全失效,而其他通道编码器无法弥补。Transformer的全局注意力机制则允许不同通道信息相互补偿。有趣的是,自然缺损率最高的干涉仪和D - alpha这两类动力学信号,切掉之后对所有模型的影响都在正负20%以内,有时甚至出现小幅改善。这表明模型在训练过程中已见过大量这两类信号缺失的样本,学会了在没有它们的情况下工作,即被训练数据“免疫”。Mirnov频谱仪信号缺失对所有模型影响都不超过1%,可能是因为在150毫秒预测窗口内,该信号反映的磁流体动力学不稳定性特征不稳定持续出现。
时间段缺失实验呈现出令人担忧的不对称性。切掉窗口前60%的数据,对LSTM几乎没有影响(NRMSE升高仅0.0%),对XGBoost甚至略有改善(降低1.3%)。这是因为MAST放电前段是等离子体电流爬升阶段,信息量少,去掉影响不大。Transformer受影响相对较大(升高52.5%),因其全局注意力机制没有天然时间权重偏好,把所有时间步一视同仁处理,前段数据缺失是一种信息均摊损失。然而,一旦将缺失移到窗口末端,情况急剧恶化。LSTM在末端缺失仅20%时,NRMSE直接跳升212%,且无论缺失比例扩大到25%还是50%,误差都维持高位不再变化,这表明LSTM对最后几个时间步存在几乎不可替代的依赖,而这些时间步恰恰在真实破裂临近时最易丢失。Transformer在末端20%缺失时升高143%,60%缺失时升高205%,说明全局注意力提供了一定缓冲,但仍严重受影响。CNN表现较Transformer温和,降幅在+67.7%到+167.7%之间,得益于其卷积池化结构对整条序列的综合处理。XGBoost降幅最温和(+8%到+37%),因为轨迹斜率等统计特征对末端缺失敏感度有限。前向填充在末端缺失低严重度时(20%缺失)能将LSTM的降幅从212%压回到+1.7%,但随着缺失区域扩大,效果迅速消失,因为前向填充无法创造真正新鲜的信息。
相关诊断组同时失效实验带来意外好消息。LSTM在主动磁性组失效时降幅26.2%,XGBoost在动力学组失效时降幅18.4%,在辐射组失效时降幅20.2%,这些数字虽不小,但远非灾难性。CNN和Transformer在所有组失效场景下,大多数情况降幅接近于零甚至略有改善。部分数值出现负降幅(误差反而降低),这提示这些信号在正常状态下可能携带轻微对抗性噪声,去掉反而让预测更稳定。Mirnov频谱仪失效对所有模型的影响均不超过1%,再次印证其在150毫秒窗口内的预测价值有限。
在“修复策略对报警指标的效果”实验中,出现了出人意料且极具实践意义的发现。在NRMSE框架下,均值填充在破裂临近失效场景中会让情况更糟。例如,LSTM的NRMSE从1.55进一步升高到1.88,这是因为用历史均值替换预测窗口最关键末端的数据,相当于给模型注入了错误先验。然而,当评估口径切换到放电级报警TPR时,结论完全反转。在25%末端缺失、零值填充条件下,LSTM的TPR从干净数据下的0.52崩溃到0.00,即50次破裂放电一次都未成功报警。而使用均值填充后,LSTM的TPR一跃恢复到1.00,所有50次破裂都提前收到报警。使用前向填充的恢复也非常强劲(TPR = 0.96)。CNN和Transformer在此场景下前向填充优于均值填充,Transformer在零值填充、均值填充、前向填充下的TPR分别为0.08、0.58、0.76;CNN分别为0.46、0.30、0.78。不同架构在不同修复策略下反应各异,这表明无法用单一评估指标判断修复策略优劣,必须同时考察预测精度指标和实际报警指标。
从四种架构的整体鲁棒性评分来看,XGBoost为0.841,LSTM为0.808,Transformer为0.765,CNN为0.764。这一排名背后有清晰逻辑。XGBoost将时间序列压缩成统计摘要再做决策,个别数值点缺失只能改变统计摘要幅度,不能消灭它,因此天然具备对随机点状干扰的抵抗力。其设计者陈天奇特别考虑了稀疏感知的决策树分裂算法,使其能优雅处理缺失特征,这一特性在等离子体诊断鲁棒性场景中得到验证。LSTM的时序归纳偏置——越靠近末端信息权重越高,在正常预测任务中是优势,在破裂临近失效场景中却成为致命弱点。Transformer的全局注意力分散了对任意单一时间段的依赖,提供有限保护,但以对前段缺失稍高敏感度为代价。CNN与Transformer的RS几乎完全相同(0.764与0.765),尽管两者架构截然不同,这说明“准确性与鲁棒性的权衡关系”是原始时间序列处理这一共同特征带来的,而非特定架构产物。
这些研究结果对未来的ITER级装置具有重要意义。ITER将在比现有任何托卡马克都更恶劣的电磁和辐射环境中运行,传感器失效率更高,失效模式更多样,一次漏报代价是数十亿美元设备损伤。当前在干净数据下的预警时间已只有12到15毫秒,远低于ITER要求的50到100毫秒。在破裂临近传感器失效且无修复策略情况下,LSTM甚至无法给出一次有效预警。研究者提出两条具体设计建议:一是将“缺失通道的伪占位符”训练策略从跨设备迁移技巧升格为标准做法,训练模型明确区分“信号值为零”与“信号不可用”,以便对缺失做出正确响应;二是对最关键信号(等离子体电流、主动线圈电流)配备独立冗余采集链路,确保单一硬件故障不能同时损坏模型最依赖的信号。麻省理工学院等离子体科学与聚变中心的Granetz博士提供的物理冗余案例也值得借鉴,等离子体电流通常由罗果夫斯基线圈测量,但可通过安培定律从磁场探针线圈阵列的线性组合中重建,Alcator C - Mod装置曾成功应用此方法,破裂预测TPR未下降,这表明当前模型对等离子体电流信号移除的高度敏感,反映的是模型尚未学会利用物理冗余,而非不可克服的物理限制。
当然,研究也存在一定局限性。Task 4 - 4是回归框架,而主流破裂预测文献更多采用二分类或时间到破裂的预测框架,不过研究者指出其鲁棒性方法论对分类任务同样适用,只是尚未实际扩展。MAST的缺损模式(前段为主、动力学类诊断高缺损率)可能是MAST特有的,其他装置的失效模式可能不同,需在具体设备背景下重新理解这些场景的代表性。测试集50次放电均为破裂放电,导致误报率无法计算。每个模型仅训练一次,未统计多次运行的方差。这项研究将等离子体诊断AI的鲁棒性问题从“我们知道这是个问题”推进到了“我们有具体的量化证据和可操作的结论”。核聚变走向商业化,不缺高精度模型,缺的是在最糟糕时刻依然能工作的可靠模型。一个在破裂最临近时刻传感器失效时TPR变成零的系统,无论平时NRMSE多漂亮,都不是能放心部署在ITER上的系统。该研究指出,我们用来保护反应堆的AI系统,在保护最迫切需要时,却最可能遭遇信号失效,这不是算法或数据问题,而是系统设计层面的工程挑战。前向填充可作为零成本的默认缺失处理策略,均值填充在报警检测场景下意外有用,这些务实结论可立即被工程实践采纳。










