Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.041 — 2026-08-14
NEWS 约 4 分钟

SSI第一款模型,先挑战持续学习

SSI首款模型传闻指向持续学习:不追求出厂即全知,而是让AI在使用中继续改变自己。

IMAGE — 量子位

你教 AI 做一件新事,它当下可能照着提示完成;换个对话,它又像没学过一样。多数模型在部署后基本固定,只能临时参考眼前的信息。SSI 据称想改变这一点:让模型在解决问题时更新自身,真正把新经验“学进去”。如果消息属实,这将是 Ilya Sutskever 创办 SSI 后首次把“安全超级智能”落到一条具体技术路线上。

不过,眼下关于模型的核心信息都来自量子位转述的一名匿名 X 用户,SSI 尚未公开模型、论文或评测,发布时间也存在相互矛盾的说法。以下更适合看作路线信号,而非已经得到验证的产品发布。

不先做聊天模型,先学会学习

据量子位报道,SSI 正在探索一款基于 TTT(Test-Time Training,测试时训练)的小型推理引擎。普通模型把训练和使用分成两个阶段:训练结束后,内部能力基本冻结;TTT 则允许模型在处理实际问题时继续做有限训练,更新部分权重——也就是决定模型如何处理信息的大量数值参数。

直观地说,常见做法像给 AI 一张临时小抄,信息还在提示词里,但没有真正改变它。TTT 更像让它一边做题,一边调整自己的解题习惯。报道还称,这款模型会先用专门整理的数据学习“如何学习”,再在解决问题时更新部分权重;即使规模不大,也可能挑战训练规模更大的模型。

这些说法目前没有模型名称、参数量、测试基准和实验结果,也没有 SSI 官方确认。匿名消息称当前版本已经准备就绪,下一代拟扩大 10 倍;但这里的“扩大”究竟指模型规模、训练量还是其他指标,尚不清楚,也不应与 SSI 获得的算力增长混为一谈。

把长上下文变成一次学习

爆料提到论文《End-to-End Test-Time Training for Long Context》。论文提出的 TTT-E2E 把“长上下文”重新理解为持续学习问题:模型读取一段很长的材料时,继续进行下一个 Token(文本生成时的基本单位)预测,并把信息写入权重。

传统长上下文方法更像把资料留在桌上,需要时回头查。TTT-E2E 则试图把读过的内容压进模型内部。不过,这篇论文只能说明相关技术路线已经存在,不能证明 SSI 采用了同一方案,更不能替匿名爆料提供验证。

这条路线对应的是持续学习(continual learning):模型部署后仍能从新数据和新任务中更新能力,而不是出厂后完全固定。Ilya 此前主张,未来的超级智能不应只依靠预训练阶段获得的知识,而应在部署后继续成长。SSI 若真把首款模型押在这里,表态很明确:它首先要解决的不是“知道得更多”,而是“能不能继续学”。

为什么现在值得看

SSI 以安全超级智能为长期目标,研究一直高度保密,也不依靠公开产品形成收入循环。Ilya 于 2024 年 5 月离开 OpenAI,约一个月后成立 SSI。此后约两年,SSI 没有发布模型、产品或公开论文。

我们此前报道过,SSI 在 7 月借 Nvidia 的支持扩大实验。按供稿所引 Nvidia 公告,双方于 2026 年 7 月 27 日宣布长期战略合作,Nvidia 将投资 SSI,并提供下一代 Vera Rubin 系统,使其算力增加约 10 倍;据 Reuters 报道,投资金额最高达 50 亿美元。

因此,这次传闻的意义不只在于“SSI 可能要发模型”,而在于它第一次给出了较具体的方向:从笼统的安全超级智能,收窄到持续学习和测试时训练。Ilya 曾主导最终通向 OpenAI o1 等推理模型的研究,他现在选择先研究“模型如何在使用中改变自己”,自然会被视为一次重要的路线判断。

局限与未知

  • 匿名消息一面称模型最快可能于 2026 年 8 月向少数用户开放,一面又称当月可能不会发布。发布时间无法确认。
  • 持续更新权重也会带来灾难性遗忘——学习新任务后,旧能力明显退化——以及学错、学偏等风险。匿名账号声称 SSI 已解决这些问题,但没有证据,不能视为技术结论。
  • SSI 尚未公开模型规模、训练方法、评测结果和安全机制。现阶段能确认的是一条值得跟踪的方向,不能确认的是它是否已经成为可用、可靠的产品。

供稿材料 SOURCES — 1

← 返回 2026-08-14 · 科技板块