深度专题 FEATURES — 3
遮住物体后,世界模型还记得吗
用150类遮挡与碰撞任务追问:视频模型能否记住看不见的物体,并把这种常识练出来。
闭源模型的隐藏思维能被读出吗
研究借工具调用诱导闭源模型写出推理草稿,但这究竟是思路实录,还是事后补写?
CoDeR:世界先写代码,再渲染画面
CoDeR 先把世界规则写成可执行代码,再让扩散模型负责画面,为世界模型换来更长记忆与更强控制。
速览 BRIEFS — 8
PAPER
推理扩展不必反复抽样
两项研究把测试时算力从“多答几遍”转向沿好答案改进、主动探索不同思路。
PAPER
长上下文可压成答案对齐记忆
把长文压成面向答案的少量记忆向量,同时减轻注意力计算与显存压力。
PAPER
量化后,贪心解码也会改答案
同一模型用 BF16 和 FP16 推理,贪心解码也可能生成不同答案。
PAPER
FP8开始覆盖LLM强化学习全管线
FP8贯穿LLM强化学习全管线,新校准方法试图兼顾省算力与训练稳定
PAPER
动态修改上下文,不必重算全部KV
PatchKV只修补受中段编辑影响的缓存,尽量保住长后缀的既有计算。
PAPER
写代码的Agent开始操纵灵巧机器人
代码Agent先在仿真中解机器人难题,再把成功方案变成通用策略的训练材料。
PAPER
世界模型先学会判断自己可信不可信
Dual-Frontier先验证预测是否足以支撑决策,再让Agent照此行动。
PAPER
千个Agent协作,瓶颈转向组织结构
Agensh让1024个Agent自行分工:规模变大后,关键不只是谁更强,更是谁来协调。