Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.046 — 2026-08-19
NEWS 约 1 分钟

Mobius拆开知识与推理模块

把知识做成共享记忆,再让多个推理器反复调用;思路新鲜,实际收益仍待验证。

IMAGE — r/LocalLLaMA 日榜

像把资料库和分析团队分开:资料只存一份,多个分析员按需查阅,再一轮轮推进判断。Mobius-v0 想把基础模型也这样拆开。传统 Transformer 常让同一组层兼顾记知识和处理信息;它则用共享的 FFN(前馈神经网络,可理解为逐项加工信息的模块)充当 Memory,存放知识向量,再配多个由 Self-Attention(让不同位置彼此参照的机制)构成的 Reasoner,负责迭代推理。

推理过程中,模型缓存隐藏状态——也就是尚未输出答案时形成的内部数字表示——把它当作工作记忆。Reasoner 据此反复查询共享 Memory,取回所需知识,再继续加工。作者称,从零训练的 7B 模型只用基线 62.6% 的训练数据,就取得相近的下游任务分数;从 Qwen3.5-35B 继续预训练的 Intern-S2-Mobius,则在分数相近时带来接近 4 倍的端到端推理加速。不过目前供稿只有作者在 Reddit 发布的介绍,未提供实验设置与逐项结果,尚不足以判断这些收益是否稳定、来自哪些具体环节。


供稿材料 SOURCES — 1

← 返回 2026-08-19 · 开源板块