Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.048 — 2026-08-21
NEWS 4 信源 约 5 分钟

Ornith 1.5:开源模型冲上397B

Ornith-1.5 从笔记本可跑的 9B 一路铺到 397B MoE,亮点是让模型参与制造自己的训练题。

IMAGE — r/LocalLLaMA 日榜

你想在笔记本上让 AI 写脚本,也想知道开放权重模型能把性能推到多高,往往得看两套完全不同的产品。Ornith-1.5 试图用一个家族覆盖两端:小到 9B,大到 397B,并让模型参与设计自己的训练任务。它的看点不只是“更大”,而是能否靠自我改进训练,同时服务本地使用和高性能 Agent。这里的训练方法、跑分和性能比较均来自 Ornith 官方发布材料,尚无材料内的第三方复测。

三种尺寸,两条路线

Ornith-1.5 已发布三个版本:9B Dense、35B-A3B MoE 和 397B MoE。独立用户发现,三者的 Hugging Face 权重及 GGUF 版本均已上线。

Dense 指“稠密模型”:生成每个 token——也就是模型处理文字时的基本单位——通常都会调用主体参数。它结构直接,但模型越大,计算量通常也越高。MoE(Mixture of Experts,混合专家)则像把工作分给多个专门小组,每次只请其中一部分上场。这样能增加模型的总容量,却仍要存下全部参数。

35B-A3B 中的 A3B 表示每次约激活 3B 参数。397B 也采用 MoE,但现有材料没有说明它每次激活多少参数,也没有交代 397B 指总参数还是激活参数。因此,“397B”首先是规模标签,不能直接等同于每次推理都动用 397B 参数。

模型开始给自己出题

据 Ornith 官方介绍,1.5 延续了 Ornith-1.0 的 self-scaffolding 思路,形成更完整的自我改进循环:模型先提出新任务,再生成任务专用的 scaffold——可理解为完成任务所需的步骤框架与辅助结构——随后产出 solution rollout,也就是解决过程的完整轨迹,供强化学习继续训练。

这个思路像让学生不只做现成习题,还参与出题、编写解题提纲,再把解题过程交给下一轮训练。关键不在“模型自己学会一切”,而在于它可以持续制造新的学习材料。官方还称,Ornith-1.5 基于 Ornith-1.0;后者建立在 Qwen3.5 之上,并经历 continued pretraining、mid-training 和 post-training,即继续预训练、中期训练与后训练。不过材料没有披露这些阶段的数据、训练配方或各自贡献。

跑分很高,证据仍偏单薄

官方给出的成绩包括 Terminal-Bench 2.1 的 86.1、SWE-Bench Verified 的 86,以及 DeepSWE 的 56。这些 Agent 与编程基准不只考一道题答得对不对,还要求模型操作终端、修改代码、保持任务状态并纠正错误。

Ornith 据此宣称,1.5 在推理、Agent 和编程任务上可比 Claude Opus 4.8,并在同规模开放模型中达到 SOTA——即当前最佳水平。但材料没有说明比较口径、具体模型版本和完整评测配置,也没有第三方复现实验。这些数字适合视为官方成绩单,暂不宜当成定论。

一个更贴近日常使用的信号来自独立用户:他在一台配有 4GB VRAM、16GB RAM 的笔记本上,用六项自设医疗物理脚本任务测试 9B 版,模型一次完成五项,优于他测试的 Ling-3.0 Tiny、Qwen 3.5 4B 及 Empero 2B/4B distill。这个体验说明小版本值得继续观察,但样本只有一人、六题,不能外推为通用能力。

为什么值得关注

这套发布最有意思的地方,是把“个人设备可用”和“开放权重性能上限”放进同一家族。官方称全系列及 FP8、GGUF、MLX、NVFP4 量化版——通过降低数值精度来减少存储和运行负担的版本——均以 MIT License 发布,可用于商业和研究。现有材料能直接确认权重和 GGUF 文件已经出现,但不足以确认是否同时开放完整训练代码、数据与训练细节。因此,更准确的说法是一次覆盖 9B 到 397B 的开放权重发布,而不是已经得到充分验证的完整开源训练工程。

局限与未知

  • 所有基准成绩和“可比 Claude Opus 4.8”的判断都来自官方,缺少第三方复测与可复现实验细节。
  • 397B 的参数口径和实际激活规模未披露,硬件需求也无法据现有材料判断。
  • 自我改进循环只公布了轮廓,训练数据、任务筛选方式及各步骤带来的增益仍未知。

供稿材料 SOURCES — 4

← 返回 2026-08-21 · 开源板块