深度专题 FEATURES — 2
世界模型需要“会话运行时”
世界模型不只要会生成,还要像游戏一样能存档、分叉并原样续演。
不同词表的模型也能蒸馏
把不同模型的切词方式对齐到字节层,让大模型跨家族教会同一个小模型。
速览 BRIEFS — 9
PAPER
训练推理模型,算力该投向哪一步
先少量试答,再把算力追投给更有学习价值的题目,最高省下约57%轨迹。
PAPER
异步强化学习给旧数据系安全带
异步强化学习跑得快,却会混入旧策略数据;ESTR按模型犹豫程度动态划定安全范围。
PAPER
世界模型何时根本无法辨认
预测得准未必懂因果:动作覆盖不足时,世界模型可能学错可控规律。
PAPER
给KV缓存按重要性分层
HiKV把KV缓存分两层筛选,并用专用硬件缓解长上下文解码的显存瓶颈。
PAPER
机器人奖励不只看成没成功
一篇综述为机器人“过程奖励”搭框架,也提醒:任务做得更好,不等于进度判断更准。
PAPER
机器人的身体从世界模型里拆出来
先把机械臂的运动渲染出来,再让世界模型专心预测环境如何响应。
PAPER
技能越多,Agent也可能越差
新增技能既会救回任务,也会弄坏旧能力;只看平均分,会漏掉这笔“退化税”。
PAPER
冻结权重的Agent也能边用边学
Agent不改底座参数,也能把部署反馈写成经验,供下次任务调用。
PAPER
连续控制不能照搬GRPO
四旋翼实验提示:GRPO能否学会连续控制,关键可能不在奖励,而在动作接口。