深度专题 FEATURES — 2
研究Agent先在世界模型里试错
让研究 Agent 先在“虚拟实验室”预演,再用少量真实实验校准,训练算力降至约三分之一。
JEPA会预测,不等于会行动
JEPA会预测潜在未来,但未必会选对动作;ACPC专门检查这道落差。
速览 BRIEFS — 9
PAPER
KV缓存开始按思考内容压缩
TAM按推理片段的重要性分配缓存空间,让长思考少占显存,也尽量少丢准确率。
PAPER
KV页也能随时回收再恢复
vToken把KV缓存虚拟到Token级,让零散显存真正腾出来复用。
PAPER
扩散草稿一次长出整棵树
DARTree让扩散草稿并行长出候选树,试出比单线草稿更激进的无损加速。
PAPER
GPU内核Agent开始改造编译器
CAKE让生成GPU内核的Agent读懂编译反馈,并反过来改造编译器。
PAPER
越会自我改进,Agent可能越危险
一次危险的成功,可能被自我改进 Agent 写成长期技能,并在新任务中再次触发。
PAPER
视频蒸馏也要对齐真实上下文
让教师只看学生当时看得到的内容,纠正少步视频蒸馏中的“偷看未来”偏差。
PAPER
MoE负载均衡不能只数Token
TEMPO不再只数Token,而是直接压低最慢GPU决定的MoE延迟。
PAPER
Scaling Law为何会突然拐弯
极简模型解释:平滑训练为何会出现平台期、能力突现与规模规律。
PAPER
指令一多,模型会突然失守
多项要求单看都能做到,叠在一起却会突然失守;关键不是冲突,而是小失误不断相乘。