深度专题 FEATURES — 3
Motif 3:3140亿参数只激活132亿
Motif 3用384个专家撑起3140亿参数,每个词只调用其中8个,展示大模型如何兼顾容量与计算。
世界模型也要有可寻址记忆
WorldTrace 给视频世界模型装上带目录的视觉记忆,让它走远后仍能认出旧场景。
量化误差为何会越层越放大
量化不只是让平均分下降:它会按比例压缩决策优势,悄悄改变工具调用与安全拒答。
速览 BRIEFS — 8
PAPER
长程Agent的五道断层
AI会推理,却常做不完几小时的任务:问题分散在规划、记忆、执行、训练和评测五环。
PAPER
世界模型先滤掉无关运动
先减去所有动作共有的变化,让世界模型重新看清每个动作真正改变了什么。
PAPER
UniJEPA统一视觉预测学习
UniJEPA把图像变化、视频演化和动作规划装进同一套视觉预测框架。
PAPER
自动驾驶世界模型不必生成未来
SimWAM把未来视频留在训练场,让自动驾驶部署时直接规划轨迹。
PAPER
LLM服务开始按延迟预算排队
Cascade按请求剩余延迟预算排队,让短问答与长推理混跑时少些超时。
PAPER
冻结模型也能自动稀疏注意力
AoH只看冻结模型的查询—键结构,就能预先决定哪些注意力头保留长程记忆。
PAPER
机器人价值模型开始规模化
RynnValue把“离目标还要多久”变成统一标尺,让异构机器人数据能共同训练价值判断。
PAPER
代码Agent迎来大型重构考场
SWE-Bench ProMax把代码Agent送进跨文件重构考场,最佳解题率仅41.2%。