深度专题 FEATURES — 3
AcrossVAM:把机器人视频拆成粒子世界
把机器人视频拆成“物体怎么动”和“画面长什么样”,让预测更容易检查,也暴露出语言控制仍弱。
机器人数据不够,先扩表示
机器人轨迹难堆量,VLAct改从表示下手,让有限数据更能跨任务、跨身体复用。
蒸馏的老师,也可能教错
两项研究追问策略蒸馏的进步从哪来:老师可能教错,学生也可能靠修剪自己的坏选择变强。
速览 BRIEFS — 8
PAPER
GUI智能体先在世界模型里练
WM-R1让手机智能体在“模拟手机”里试错,减少训练对真机操作的依赖。
PAPER
滑窗注意力为何仍能赢
直接保留最近一小段上下文,竟比专门压缩记忆的线性注意力更强、更稳。
PAPER
量化可能唤醒模型后门
模型在高精度测试中表现正常,量化上线后却可能激活后门,且攻击能跨量化方案存活。
PAPER
长推理何时该提前停
SABER故意让模型“唱反调”,答案仍不动时就提前结束推理。
PAPER
机器人听错话会有多危险
研究发现,机器人“听错”后可能绕过安全拒绝,把危险指令变成可执行动作。
PAPER
手势也能成为VLA指令
DeicticVLA把语言和指点统一成机器人指令,“拿这个、放那里”也能听懂。
PAPER
推理模型也有隐性偏差模式
研究发现,推理模型处理刻板印象时,计算投入也会呈现偏差模式。
PAPER
每个Token并不等价耗电
每Token能耗下降,不代表整次请求更省电;固定开销可能只是被摊薄了。