Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.088 — 2026-09-30
NEWS 约 4 分钟

550B代码模型押注FP4竞赛

英伟达把550B代码模型压到FP4,并用“多次尝试再纠错”冲击IOI高分,开放权重与成绩边界都值得细看。

IMAGE — r/LocalLLaMA 日榜

先别把它当成“一次答对”的神童

想象你在参加一场不能上网的算法考试:题目很难,每道题只有有限次提交机会。与其写完第一版就交卷,更稳妥的办法是先准备几种解法,让评测结果指出问题,再把剩余机会留给更有希望的版本。NVIDIA这次发布的 Nemotron-Labs-3-Competitive-Coding,正是把“专门训练的代码模型”和“提交后继续纠错”组合起来,挑战竞赛编程。

它值得看,不只因为官方报告的分数很高。这个模型还有三个醒目标签:550B总参数、55B激活参数,采用 NVFP4 低精度格式,并以开放权重方式发布。不过,目前训练数字、比赛设置和成绩都来自 NVIDIA 的 Hugging Face 模型卡或研究论文,尚无 IOI 官方确认或第三方复现。

550B很大,但不是每次全开

模型全名中的“550B-A55B”容易让人误解。它有5500亿总参数,但每次生成只激活约550亿参数。可以把它理解成一个规模庞大的专家团队:人才库很大,每道题只调动其中一部分人,而不是全员同时工作。

它还采用 NVFP4。FP4——用大约4位浮点格式记录模型数值——相比常见的16位格式,理论上能减少显存和计算开销,代价是更容易因低精度产生误差。NVIDIA此次没有给出该版本相对其他精度的速度、显存占用或准确率对比,所以现在能说的是它押注了FP4路线,还不能说这条路线已经“赢下竞赛”。

开放权重则意味着训练完成的参数可以下载、自行部署,不等于训练代码、数据和许可证毫无限制。模型卡称其可用于商业或非商业用途,但实际使用仍应核对许可证和部署条件。

它怎么学会竞赛解题?

据 NVIDIA 模型卡,该模型从 NVIDIA-Nemotron-3-Ultra-550B-A55B 微调而来,用477,642条合成推理轨迹训练了一个 epoch——也就是把这批材料完整学一遍。这些轨迹覆盖22,000道精选题目,来自16个地区及国际竞赛系列。

这里的“推理轨迹”,可以理解为从读题、构思算法到形成答案的解题过程。它们由 GLM-5.2 蒸馏而来:让一个教师模型产出示范,再用这些示范训练目标模型。NVIDIA称,选择 GLM-5.2,是因为它训练出的版本比使用 DeepSeek-V4-Flash 的版本准确率更高,生成内容还短约30%。但模型卡没有披露完整对比数字。

这类模型面向的是竞赛编程,而非普通的软件开发。题目通常有明确输入输出、运行时间限制和隐藏测试,因此重点不是代码写得是否易维护,而是算法是否正确、能否在有限提交次数内通过测试。

真正拉开差距的,可能是反复修正

模型推理时还搭配 GenCorrect。它会生成多个不同候选方案,读取评测反馈,再迭代改进,同时遵守固定的提交预算。换句话说,最终参赛的不是一个只回答一次的模型,而是一套会分配尝试机会的解题系统。

据 NVIDIA 研究论文,团队在 IOI 2026 题目公开前进行了与赛事同步的前瞻性测试,并称系统遵守人类选手的比赛时长、断网和提交次数限制;不过,这项测试并非 IOI 官方组织,也未受 IOI 监督。论文报告系统得到535.4分(满分600),高于金牌线361.12分,也超过最高人类选手的498.27分。

同一论文还报告,在 IOI 2025 题目实验中,一个较小模型经过后训练后从130分升至291分,加入 GenCorrect 后进一步升至468分。至少按 NVIDIA 自己的实验,反复生成、测试和纠错带来的提升,比后训练本身还大。这也是最值得关注的信号:竞赛成绩不只取决于模型有多大,还取决于怎样组织它有限次数的尝试。

局限与未知

  • NVIDIA将其称为首个“被报道”在一届 IOI 题集上超过最高分人类选手的AI系统。这是带限定词的官方首创表述,不能直接写成无条件的“全球首个”。
  • 535.4分、金牌线、最高人类得分及所谓“正式比赛限制”,仍需 IOI 官方材料或独立复现核实;“实时、前瞻性”评测的具体流程也不够清楚。
  • 材料没有给出 NVFP4 相对其他精度的实测收益,也没有说明部署所需硬件。它证明了 NVIDIA 正把超大开放权重模型、低精度计算和测试时搜索押在同一条路上,但尚未证明每一环都不可替代。

供稿材料 SOURCES — 1

← 返回 2026-09-30 · 开源板块