Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.099 — 2026-10-11
PAPER H 73 约 7 分钟

不可靠芯片也能训练基础模型

让语言模型在训练时反复遭遇模拟硬件故障,模型越大,抗错能力反而可能越强。

不可靠芯片也能训练基础模型

先让模型习惯“缺零件”

想象你在一间照明不稳定的厨房学做菜:灯偶尔熄灭,秤也会随机漏掉一次读数。常规办法是先修好厨房,再要求厨师准确工作。这篇论文换了一个方向:如果故障无法完全避免,能不能让厨师从训练第一天起就在这种环境里练习,最终学会不依赖某一次读数?

Trevor McCourt、Ila R. Fiete 和 Isaac L. Chuang 研究的正是这个问题。他们让大语言模型(LLM——根据上下文预测下一个词或词片段的模型)在模拟的故障数字硬件上训练。结果显示,经过这种训练的模型不只能够适应错误;随着模型增大,它相对于普通模型的抗错能力还会提高。

这件事值得关注,是因为今天的 AI 默认芯片必须高度可靠。论文解释,芯片为了压住逻辑门之间的波动,通常要维持较高电压,而逻辑门切换所需的能量随电压的平方增长。降低可靠性可能换来更高能效,但前提是模型不能因为一次计算出错就全面失灵。

需要先划清边界:这些结论全部来自这篇 arXiv 论文。实验注入的是模拟故障,并没有在真实的不可靠芯片上完成训练或验证;论文直接研究的是 LLM,也不能无条件推广到所有基础模型。

它没有修好硬件,而是改变训练环境

研究团队使用 Llama2 风格的模型,在 FineWeb 网页文本的一部分上训练了数千个不同规模、训练量和故障率的模型,累计投入约 40,000 GPU-hours。这里的 GPU-hours 是所有实验消耗的计算时间总和,不是某一次训练持续了四万小时。

故障发生在 Transformer 最费计算的矩阵乘法中。Transformer 是现代语言模型常用的网络结构;矩阵乘法则可以理解为模型大量汇总和变换数字的基本动作。研究者把参与运算的连续权重块随机清零,相当于某些连接临时没有传递信息。每次训练或推理都会重新抽取故障,所以模型无法只记住一块芯片的固定毛病,只能学习对一整类随机错误保持稳定。

论文比较了两类模型。普通的“fault-blind”模型始终在无故障环境中训练,只在测试时突然遇到错误;“fault-hardened”模型则在训练和使用时面对相同故障率。前者像只在安静教室练习、上台后才第一次听见噪声;后者从排练开始就处在噪声里。

差异很明显。普通模型在错误足够多时会失去正常的缩放趋势:模型做得更大,表现甚至可能变差。作者认为,这与常规模型依赖少数“super weights”或“super activations”有关——它们是数值特别大、对功能又格外关键的内部特征,因而成为单点故障。一旦错误击中这些位置,输出可能严重混乱。

经过故障训练的模型则稳定得多。论文分析输出概率后发现,硬件错误会产生两种影响:一种只是让预测变得更分散,像把模型的信心旋钮调低;另一种会真正打乱不同候选词之间的关系,无法靠重新缩放输出修复。故障训练同时抑制了这两类损伤,并在一定故障范围内几乎没有因不可逆的输出混乱而损失能力。

模型越大,为什么反而更抗错?

作者用神经缩放定律概括数千次训练结果。神经缩放定律是一类经验公式,用来描述模型表现如何随参数量、数据量或计算量变化。论文发现,故障训练模型需要一个经过修正的缩放公式:新出现的曲率项意味着,模型扩大到一定程度后,会逐渐缩小与无故障模型之间的能力差距。

研究团队把这种现象解释为:模型可能学会了类似“好纠错码”的内部计算方式。纠错码通过加入冗余,让系统能够发现或修复错误。最笨的办法是不断复制同一份信息,但随着系统变大,用于复制的成本会吞掉越来越多空间。“好”纠错码则把冗余控制在整体的固定比例附近,因此系统再大,也仍有有限比例用于真正计算。

论文用“相对容量”衡量这一点:一个故障训练模型的表现,相当于多大的无故障模型。这个指标也可以理解为,模型参数中有多少仍在做有效工作,而不是只用来吸收错误。实验拟合显示,相对容量先下降,越过某个规模后又开始恢复。作者因此认为,模型的行为更像分布式的好纠错码,而不只是简单重复。

但“模型已经学会好纠错码”仍是机制解释,不是对模型内部结构的直接证明。论文也把更强的结论——适当训练的 LLM 可能具备形式化容错能力,即规模无限增大时仍保留有限计算能力——明确写成 conjecture,也就是有证据支持、尚未证明的猜想。

硬件只报错,模型负责善后

论文还把实验对应到一种 Low Energy Neural Network Accelerator(LENNA,低能耗神经网络加速器)的设想。这类芯片以较低电压运行,允许算术偶尔失败。硬件使用冗余余数系统检查矩阵乘法:额外保存少量校验信息,一旦发现结果不一致,就丢弃相应运算,让它表现为连接缺失。

关键分工是:硬件只负责发现错误,不承担昂贵的完整修复;模型通过训练吸收后果。论文给出的一个 12 位算术示例中,加入 3 位余数只增加几个百分点的开销,而在硬件中完成全面纠错,成本可能超过主要乘加运算本身。

这与传统容错路线的区别很清楚。传统思路尽量把错误隔离在模型之外,确保送到模型手里的每一步都正确;这里则允许主要计算部件偶尔失手,再让模型形成不依赖单个连接的表示。它不是取消纠错,而是重新安排纠错发生在哪里。

为什么值得关注

这项工作的意义,不在于已经造出一块能训练大型模型的低可靠芯片,而在于它提供了一条可检验的系统路线:硬件可以用一部分可靠性换能效,训练则把抗错能力写进模型本身。更重要的是,实验中的韧性没有随模型扩大而明显恶化,反而出现恢复趋势。这回应了此类方案最危险的问题:小模型上有效的技巧,会不会一扩大就崩掉。

如果修正后的缩放规律在更大模型和真实硬件上仍成立,低电压、不完全可靠的处理器或许能降低 AI 推理能耗。作者甚至提出可能获得显著乃至数量级的节能,但论文没有提供真实芯片能耗、节能比例或与现有加速器的实测对比。因此,这目前是附带条件的前景判断,不是已经兑现的工程收益。

局限与未知

  • 实验故障由软件模拟,而且只覆盖 Transformer 中主要矩阵乘法的特定随机丢块模式;归一化、位置编码、嵌入和读出等操作仍在无故障环境中运行。真实芯片的错误是否符合这一分布,尚未验证。
  • “好纠错码”来自缩放曲线所支持的推断。论文尚未在模型权重或激活中直接找到相应编码结构,形式化容错也没有得到证明。
  • 作者表示,现有实验规模不足以判断趋势能否延伸到商业模型尺度;完成更大规模验证的成本可能高到学术团队难以承担。

供稿材料 SOURCES — 1
01
Fault-tolerant foundation models arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-10-11 · 学术板块