深度专题 FEATURES — 3
先在脑中推演,再用奖励选计划
RP1让AI在潜在世界里反复推演,用奖励学会怎样改好整套计划。
235B模型怎样塞进8GB显存
235B模型并未真塞进8GB显存;研究者训练路由器提高专家复用,却发现速度与质量难两全。
ADEPT:灵巧手先预训再强化
ADEPT让多指机器人先练通用手上功夫,再稳妥转学插接、摆盘等具体任务。
速览 BRIEFS — 8
PAPER
测试时算力为何花不出效果
多给 AI 几次作答机会,难点未必是找不到好答案,而是认不出、用不好它。
PAPER
Agent强化训练试着倒序优化
RTPO从任务结尾倒着训练,让多轮Agent更容易分清每一步的功过。
PAPER
视频稀疏注意力补上可执行一步
SparsePR把注意力稀疏性编排成硬件可执行的共享路线,并补回被跳过的信息。
PAPER
Transformer让跨层KV彼此混合
WhiteMatter让各层按内容调用不同深度的历史记忆,并可压缩KV缓存。
PAPER
机器人基础模型有一道具身鸿沟
通用机器人模型会“懂任务”,却未必会用一副新身体把它做出来。
PAPER
VLA推理开始细分Token职责
RoleSub不再整颗删除Token,而是按角色压缩内部信息,让VLA以更低成本控制机器人。
PAPER
工具Agent也要遵守最小权限
让工具Agent学会按任务取权:既把事办成,也少碰不该碰的权限。
PAPER
人形机器人行走控制走到哪了
一篇综述串起人形机器人行走控制数十年的路线变化,也标出生成式方法的下一站。