深度专题 FEATURES — 3
GRPO的公平目标为何不可兼得
GRPO想忠实奖励又不偏爱长答案,论文证明:在结果奖励下,两者不能兼得。
WorldDiT:世界与动作合成一条链
WorldDiT让同一模型既预想未来画面,也生成机器人动作,以3.99亿参数取得有竞争力的控制表现。
Raygun:蛋白质也能伸缩改造
Raygun 能给天然蛋白质“改尺寸”:增删替换氨基酸,同时尽量保住原有结构与功能。
速览 BRIEFS — 8
PAPER
MLA为何能拆开内容与位置
机制研究发现:MLA把“写了什么”压进摘要,把“出现在哪”留给独立通道。
PAPER
人机互动世界模型跑进实时档
数字人把身体、手、表情与物体接触一起生成,并在双 H100 上跑到实时速度。
PAPER
Agent沙箱也开始投机调度
SpecBox边读Agent输出边预热沙箱,把工具启动等待藏进模型生成时间。
PAPER
稀疏注意力的索引器成了瓶颈
PIVOT让相邻查询共用一次全文筛选,避免索引器吃掉稀疏注意力省下的时间。
PAPER
VLA加速从动作词表下手
VQVLA按动作幅度切换量化精度,并复用码字计算,尝试降低机器人实时推理延迟。
PAPER
机器人化学实验室迎来压力测试
把LLM Agent接入机器人化学实验室后,最强系统也只有28.1%的流程真正可执行。
PAPER
具身数据也需要一座金字塔
把真实操作、仿真与人类视频分层看,机器人数据扩量的取舍更清楚了。
PAPER
长上下文解码改用页内密钥摘要
LOCKS给每页KV缓存做密钥摘要,先筛页面再读取,减少长上下文解码的数据搬运。