深度专题 FEATURES — 3
WorldClaw:一句话生成可漫游世界
WorldClaw把一句描述拆成规划、造地形和摆资产,让AI像制作团队一样搭建可漫游、可编辑的3D世界。
Copilot实录:编码Agent如何工作
拆解千万级 Copilot 实录:Agent 如何调用工具、消耗上下文,又在哪里浪费算力。
Enfold:世界模型学会卸下想象器
Enfold把世界模型的“想象过程”压成决策笔记,让机器人行动时不必反复生成未来。
速览 BRIEFS — 9
PAPER
手腕相机不该只是第二个主视角
World-to-Wrist让机器人提前感知夹爪附近的变化,而非把腕部画面当作第二个主视角。
PAPER
BridgeVLA++给机器人补上长期记忆
BridgeVLA++让机器人记住先前看过和做过的事,减少重复采集数据的压力。
PAPER
KV缓存压到2比特,先转对方向
OptR先重排KV缓存数值,再压到INT2,让长上下文更省显存,也尽量少伤模型判断。
PAPER
PI-Mem把上下文推到360万Token
PI-Mem并行阅读、反复汇总长文,在360万token测试中兼顾准确率与速度。
PAPER
扩散MoE也开始认真研究规模化
LLaDA MoE v2摸清扩散语言模型的扩容配方,并用30B模型验证
PAPER
不同尺寸模型也能交接KV缓存
用闭式线性映射搬运KV缓存,让同家族大小模型切换时不必重读上下文。
PAPER
工具调用也能乱序投机执行
OoO-Spec让小模型并行猜函数与参数,再由主模型核验,加速Agent工具调用。
PAPER
MiniWorld降低视频世界模型门槛
MiniWorld用单台8卡服务器从零训练视频世界模型,并开放完整流程。
PAPER
未来分叉,未必代表模型懂随机性
预测对了未来分布,也可能猜错分叉原因;ClosurePairs 专门检验这一点。