深度专题 FEATURES — 3
反事实世界,也要共享同一阵噪声
Twin Rollouts让两条未来共享噪声、只更换动作,使“换个动作会怎样”成为更可核查的问题。
120B模型塞进消费级硬件
RotaryQuant同时压缩权重、运行记忆和注意力,让120B MoE逼近消费级本地部署。
杂乱环境抓取,先学会理解接触
SpaHybGen先学习“该怎么接触”,再适配不同机械手,让杂乱场景抓取更容易迁移。
速览 BRIEFS — 8
PAPER
BDH-CQ:把思考藏进循环记忆
BDH-CQ让示例持续改写循环记忆,再在内部反复推演,以低成本完成临场归纳。
PAPER
LLM强化学习先挑“学得会”的题
先用短跑测试挑出“学得会”的题,再把有限的强化学习算力投过去。
PAPER
世界Token给VLA补一门预测课
让机器人训练时预判动作后果,部署时却不用现场生成未来视频。
PAPER
KV缓存共享,也会泄露租户信息
共享KV缓存能帮AI提速,也可能让攻击者从响应快慢猜出别人的提示词。
PAPER
训练扩散LLM,别忘了真实生成条件
训练时别把提示词也弄脏:PCD用干净前文缩小扩散模型的生成错配。
PAPER
输入多换几种,比答案多采几遍更值
同样多问几次 AI,换着说问题,可能比反复生成答案更划算。
PAPER
动作后训练可能磨掉VLM的深度感
机器人学会行动后,VLM末层原本清晰的深度信息反而明显变弱。
PAPER
软最大优势,重分配GRPO学习信号
用Softmax重分配GRPO学习信号,少在简单题上用力