深度专题 FEATURES — 3
多智能体世界模型如何不被人数拖垮
Khora把多人视角共用一份“世界总账”,让世界模型加人时不必推倒重练。
MoE规模定律,不能只算总算力
MOSAIC把通信、内存和闲置时间也算进MoE规模定律,寻找真正能在集群上高效训练的模型。
世界模型错了,机器人就该收手
CausalNav给世界模型加了“拒答键”:预测不可靠时,不让它接管控制。
速览 BRIEFS — 9
PAPER
ZEST让运动技能跨机器人迁移
ZEST让多种机器人在模拟训练后,直接上真机完成高动态动作。
PAPER
4D一致性补上自动驾驶未来的空间骨架
4D-WAM用几何监督对齐未来画面与行车轨迹,让两者描述同一个世界。
PAPER
换套评测,世界模型成绩从头再算
同一模型只换目标设置,成功率就从84%跌到8%,评测规则足以改写结论。
PAPER
流式视频生成也需要统一训练轨迹
Stream Forcing让训练逐步贴近逐帧生成,减少长视频中的误差累积。
PAPER
推理模型不会自己分配思考预算
多道题共用一笔Token预算时,推理模型更看出题顺序,不太看难度和分值。
PAPER
昂贵推理可以蒸馏成便宜技能
把反复出现的长推理压成操作卡,让 Agent 少花计算也能办事
PAPER
失败轨迹也能教会代码Agent
FailForge把代码Agent的失败记录炼成解题套路,救回逾26%的难题。
PAPER
Agent安全评测开始批量制造陷阱
ToolHazard批量生成恶意工具环境,让Agent安全测试从手工设陷阱走向规模化压力测试。
PAPER
边缘投机解码开始看内存下单
MemSpec先看设备内存,再安排草稿模型,让边缘端投机解码少为换模型付账。