Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.073 — 2026-09-15
NEWS 约 5 分钟

Intern-S2:科学Agent迈向397B

Intern-S2把科学文献、跨领域强化学习和长程Agent装进397B级模型,但能力与部署门槛仍待实测。

IMAGE — r/LocalLLaMA 日榜

你把一篇科学论文交给 AI,它读到的可能只是抽取后的文字。公式的位置、图表与图注的对应关系,甚至页面布局传达的线索,都可能在解析时丢失。Intern-S2 想换一种办法:别先把论文“拆平”,直接看原始页面,再让模型学习怎样完成科学任务和持续多步行动。

InternLM 将 Intern-S2-397B 定位为面向科学智能与长程 Agent 的多模态基础模型。多模态,指同一套系统可以处理文字、图像等不同形式的信息;长程 Agent,则是在较长时间和多轮交互中保持目标与计划,并连续调用工具完成任务。这个组合值得关注,因为它同时碰了两个难题:如何完整读懂科学材料,以及如何把理解变成一连串可靠行动。

需要先说明:目前关于正式版的能力描述均来自 InternLM 的模型介绍,材料没有给出实验表、具体分数或第三方复现。以下更适合看作技术路线拆解,而不是已经坐实的排行榜结论。

不先拆论文,直接看页面

Intern-S2-397B 的第一步,是把科学文献原始页面用于视觉预训练——让模型在正式做任务前,先从大量页面中学习文字、公式、图表和空间关系。它不经过中间解析,而是在共享表示空间中联合建模“符号是什么意思”和“视觉元素如何关联”。共享表示空间,可以理解为把文字含义与页面上的位置、形状和对应关系放进同一本内部笔记。

这不是单纯给语言模型加一双“看图的眼睛”。据 Intern-S2-Preview 技术论文,只把论文转成纯文本,可能丢掉公式、图表、图注和布局之间的联系;团队因此把渲染后的文档页面纳入多模态预训练,并筛选视觉信息确有额外价值的页面。正式版介绍延续了这条路线,强调保留文字与视觉内容的对应关系,并称其有助于空间、视觉推理和数据效率。

从会答题,推到会完成任务

第二步是强化学习——模型根据任务结果或反馈调整行为,而不只是模仿现成答案。InternLM 称,Intern-S2-397B 在超过 20 个领域的大规模、多任务科学强化学习任务上联合训练。这里的重点不只在任务数量,也在“联合”:它试图让不同领域的训练经验进入同一套模型,而不是为每类科学问题单独做一个工具。

模型介绍称,它在所谓开源模型中取得领先的通用推理表现,并在生物分子相互作用设计、材料结构生成等任务上得到“强劲结果”。但介绍没有列出基准名称、分数、对照模型和评测设置。因此,“领先”和“强劲”目前仍是发布方的比较性表述,不能当成经过独立验证的结论。

第三步更接近真正的 Agent。团队把多个 Agent 框架接入大规模沙箱环境。沙箱是隔离的试验场,模型可以在其中操作和试错,避免直接影响外部系统。模型再通过黑盒 Agent 强化学习训练:训练更关注它采取了什么行动、最后是否完成任务,而不要求外部系统内部过程完全透明。

这类训练瞄准的是长程任务。模型不只回答一次问题,还要连续规划、使用工具、检查结果和纠错。难点也随之出现:每一步的小错都可能累积,早期信息可能在长上下文中丢失,失败后还要知道怎样恢复。InternLM 称,这套训练提升了模型在通用及科学长程任务上的泛化能力,但同样没有提供可核验的量化证据。

397B既是野心,也是门槛

Intern-S2 系列的演进颇有意思。据上海人工智能实验室和书生·浦语官方文档,团队在 2026 年 5 月先开源了 35B 的 Intern-S2-Preview,主打以较小规模在多项科学任务上比肩此前的万亿规模 Intern-S1-Pro;同年 7 月又发布 Intern-S2-Preview-397B,正式版 Intern-S2 也采用 397B 这一规模标识。路线因此从“先降低使用门槛”,转向同时扩展大模型能力与长程 Agent。

B 通常表示十亿;若按参数规模理解,397B 约等于 3970 亿个可学习参数。不过现有材料没有明确说明这是总参数、激活参数,还是其他统计口径,所以不能直接把型号写成已经核实的“3970 亿参数”。无论具体口径如何,如此大的规模都把问题带回现实:参数更多不保证能力更强,却通常意味着更高的权重存储、显存和推理成本。

真正值得看的,因而不是一个更大的数字,而是三条扩展路线被绑在了一起:直接读取科学页面,扩大跨领域强化学习,再进入可交互环境学习长期行动。如果后续证据能证明三者确实相互增益,Intern-S2 展示的就不只是“会读科学论文”的模型,而是一套从理解证据走向执行复杂科学任务的基础设施方向。

局限与未知

  • 正式版材料没有披露评测表、具体分数、对照模型与统计设置,“领先”等结论暂时只能归于 InternLM 自述。
  • 397B 的统计口径尚不明确;材料也没有说明实际显存、推理速度和部署配置,使用门槛无法量化。
  • “开源模型”的说法仍需结合许可证、权重与训练材料的开放程度核查,不能把权重可下载直接等同于完全开源。

供稿材料 SOURCES — 1

← 返回 2026-09-15 · 开源板块