深度专题 FEATURES — 2
模型没变,推理后端改了答案
同一组模型权重,换个推理后端,基准分数和答对的题都可能变。
AgentOPSD:给关键一步记功
AgentOPSD把长程任务的总奖励拆到关键回合,让Agent知道哪一步真正改变了结局。
速览 BRIEFS — 8
PAPER
环境太贵,Agent先在脑中排练
EnvACE让Agent自己模拟工具反馈,在“脑内排练”中学习长程任务,减少对昂贵环境的依赖。
PAPER
机器人跨身体,控制仍要各学各的
DyPES-VLA让不同机器人共享“世界规律”,但保留各自的控制方式。
PAPER
KV量化开始盯住查询目光
NOVA-KV按查询真正关注的方向压缩缓存,用2比特尽量守住注意力结果。
PAPER
MoE选专家,不必死守固定数量
看路由分数的“拐弯”按词分配专家,无需重训,也能省下推理时间。
PAPER
VLA实时推理也能投机执行
Deltoris只算连续画面的变化,再先猜后验,把扩散式VLA推向实时控制。
PAPER
多模态预训练开始追问底层规律
研究追踪视觉与语言如何互相影响,把多模态预训练从试配方推向找规律。
PAPER
Agent测评该把外壳也算进去
HarnessOpt-Bench把提示、工具、记忆和流程纳入评测,衡量AI改造整套Agent的能力。
PAPER
基因组语言模型开始设计噬菌体
AI开始续写整段噬菌体基因组:285个设计中,16个真正存活