深度专题 FEATURES — 3
世界动作模型开始拆分模态
ModAR 把机器人未来拆成运动、语义和几何再规划动作,RGB 不再是唯一答案。
废掉的草稿,也能加速推理
推测解码丢掉的并非全是废料:回收被拒绝分支的内部状态,可让下一轮草稿猜得更准。
同一世界模型,讲出两套物理
同一模型文字懂物理,视频却不照做:跨模态一致性比画面逼真更难。
速览 BRIEFS — 8
PAPER
Agent的KV缓存要分阶段清理
AgentKV按推理、行动和工具返回分阶段留缓存,避免长流程Agent把稍后仍有用的信息过早清掉。
PAPER
KV缓存只存Value,Key随用随算
只缓存“内容”,索引随用随算:GVA以计算换内存,缓存缩小约一半。
PAPER
前缀复用原来是排序题
把提示片段排对顺序,就能让更多请求共享“草稿”,少做17%—36%的预填充计算。
PAPER
BPO把Bellman方程带进LLM训练
BPO用Bellman方程改写训练目标,不训练critic也能追踪整段推理的长期价值。
PAPER
VLA安全对齐先检查动作可行性
ShieldVLA先判断机器人能否安全行动,再决定继续任务还是转入避险。
PAPER
双臂机器人瞄准动态操作
AthenaZero用低惯量双臂挑战高速抛接,让机器人本体追上动态操作策略。
PAPER
世界模型何时该按下暂停键
先证明候选动作确实比不动更好,再让世界模型执行。
PAPER
量化后才触发的Agent后门
同一模型全精度时安分,量化部署后却可能触发恶意工具调用。