深度专题 FEATURES — 3
海量并行训练,SAC要重写规则
WarpSAC发现:并行模拟让经验不再稀缺,SAC过去的“保险措施”反而可能拖慢学习。
预训练配方变成一场混合实验
把大模型数据配比当作配方实验,用更少的小模型试训寻找更好的混合方向。
机器人世界模型真的听指令吗
WorldEcho专测机器人是否真按动作预测未来,揭开“画面合理、动作失真”的盲区。
速览 BRIEFS — 8
PAPER
世界模型只在必要时想象
让机器人偶尔在后台“看一眼未来”,不耽误实时动作。
PAPER
KV不够时,加卡还是压缓存
实测比较显示:KV显存吃紧时,模型装得下就压缓存;装不下,加卡才是入场券。
PAPER
Agent投机解码开始适配批处理
AgentSpec让投机解码适应批量Agent请求,最高实现2.02倍加速
PAPER
扩散语言模型服务有了硬件账本
实测发现,扩散语言模型的并行优势,关键不只在GPU算得快,更在于能否把请求合成一批。
PAPER
机器人学会在推理等待时行动
让机器人把“等待模型思考”的空档也纳入学习,减少停顿与失控。
PAPER
RL训练可能放大隐私泄露
只用无害事实做强化学习,也可能让模型更容易吐出早已记住的私人信息。
PAPER
长任务换模型,要交接力税
长程代码 Agent 中途换模型并非无缝接力,交接方式会直接影响质量与成本。
PAPER
科学Agent评测开始验收全流程
FrontierChallenge验收科学Agent全流程:做了多少不算,交齐产物才算过。