Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.040 — 2026-08-13
PAPER HF 212 约 5 分钟

Macaron-V1:模型开始边用边学

Macaron-V1把模型、工具脚手架与LoRA专长模块一起迭代,探索AI部署后的持续学习。

你请一位助理长期帮忙。几个月后,你换了工具,也形成了新的习惯,但助理仍停留在入职那天。今天的大模型大致如此:训练完成、部署上线,能力便基本固定。Macaron-V1想改变这件事。它尝试把使用中积累的经验,送回下一版模型与运行系统,并用多个轻量专长模块分工。

不过,“边用边学”需要谨慎理解。论文展示的是一套版本化迭代框架,不是模型在每次对话后实时修改参数。本文事实均来自Macaron-V1论文这一单一信源,尚无独立复现。

学习的不只是模型

Macaron-V1把目标拆成两部分:Adaptation(适应)和Collaboration(协作)。

适应的关键,是把模型和harness一起改。Harness可译作“脚手架”:模型之外的提示词、工具、记忆、界面和执行流程。一个Agent能不能把事办成,往往不只取决于模型本身,也取决于这套外围系统。

论文因此不把某个模型权重当成唯一主角,而是给“模型—脚手架组合”明确编号。某一版本产生的交互轨迹,会按照外部规则接受检查,再用于构造下一版本。这样做像改进一位客服:既可能补充培训,也可能调整工作台、权限和操作手册,随后重新评估整套服务。

作者把这一循环称为递归自我改进。配套组件包括Harness Context Protocol——记录运行配置、工具、技能和会话资源的可审计契约;MindForge——负责发现任务、扩展交互轨迹并连接后续更新的Agent强化学习框架;以及面向生成式界面的UI4A等脚手架。

但论文目前报告的脚手架搜索实验只隔离了MindForge的“扩展”阶段:模型保持冻结,也没有执行优化器更新。因此,它证明的是系统能搜索覆盖部分失败任务的配置,并未证明完整循环已经让模型一代代变强。

四位顾问,共用一个底座

协作部分采用Mixture-of-LoRA(MoL)。LoRA是一种低成本微调方法:冻结大模型主体,只训练少量附加参数,像不重印整本教材,只增加可替换的补充讲义。MoL准备多份讲义,再按当前问题请一位合适的“顾问”出场。

旗舰版Macaron-V1-Venti使用744B参数的GLM-5.2底座,配置四个LoRA:L0负责聊天,也是入口路由;L1负责Agent和工具调用;L2负责编程;L3负责生成式界面。面向本地部署的Macaron-V1-Tall基于Qwen3.6,整体发布规模约50B,采用同样的四模块设计。

每轮请求先由L0在24个token的预算内选择一个模块。选中的专家作答后,再生成一段最多192个token的内部摘要,供其他专家在后续轮次了解发生了什么。每位专家保留自己的完整历史,只看到其他专家的摘要。这样既维持对话连续性,也避免把所有中间过程反复塞给每个模块。

论文在来自LoRA训练数据的6448条轨迹上报告:Venti路由正确率为99.12%,Tall为99.04%。但这不是独立留出的测试集,只能视为实现诊断,不能代表面对陌生请求时的泛化水平。系统也假定每轮只有一个主要意图;一条消息同时要求讨论计划、写代码和生成界面时,目前仍只选择一位专家。

它为什么值得关注

第一,它把持续学习从“继续训练权重”扩展到整套Agent系统。新工具出现时,团队可以先更新脚手架;积累到足够可靠的轨迹后,再训练某个LoRA。模型、专家模块和运行环境可以按不同节奏发布。

第二,模块化降低了新增专长时改坏旧能力的直接风险。基础模型保持冻结,新专家不会覆盖底座权重。不过,路由或脚手架的变化仍可能改变最终行为,所以“底座没变”不等于系统能力一定保留。

第三,这种设计有明显的部署动机。按论文公开适配器张量计算,Venti让一个744B底座由四个专家共享,逻辑存储量约为774.8B;若分别部署四份合并后的底座,则约为2.976T。前者的存储参数值减少约74%。这说明MoL能减少重复保存底座的成本,但论文明确没有证明它比四个独立专家拥有更低延迟或更高吞吐。

更重要的是,Macaron-V1把“终身学习”落成了一个可以讨论和审计的工程对象:经验从哪里来,按什么标准筛选,改变模型还是脚手架,以及下一版如何验证。它提供的首先是一条路线,而不是终点成绩。

局限与未知

  • 现有实验没有展示部署后在线更新,也没有完成跨多代、同时衡量遗忘与累计提升的持续学习验证。因此不能说它已经证明模型会实时“边用边学”。
  • 论文只评估随系统发布的四个专家,尚未验证不同团队或不同用户训练的LoRA能否安全协作,更没有证明组合后超过最强单个专家。
  • “open”具体覆盖论文、代码、权重还是训练数据,供稿没有完整说明;Personal Intelligence等内部基准也更接近分布内证据,不能直接当作通用能力领先的证明。

供稿材料 SOURCES — 1

← 返回 2026-08-13 · 学术板块