深度专题 FEATURES — 3
全程FP4,LLM强化学习也能跑
把大模型强化学习的采样与训练都压到FP4,关键是救回被量化抹掉的中间信息。
CG-World:给世界模型一份总账
CG-World把画面背后的状态、动作与因果分支记进同一本账。
论文更多了,科学却可能更差
一项模型研究警告:LLM 能让论文变多,但若评价仍重数量,科学未必因此做得更好。
速览 BRIEFS — 8
PAPER
个性化上下文不必反复搬
InferScale把反复调用的长期记忆预先算好并直接注入GPU缓存,让AI更快开口。
PAPER
游戏世界不能只像,还得守规则
StatePlay把血量、技能槽等状态纳入生成,让游戏世界不只像游戏,也更守规则。
PAPER
机器人视频动作开始跨身体迁移
ContactFlow只记录接触点如何移动,让同一套动作表达有望跨越人手与不同机器人。
PAPER
RAG路线之争迎来规模实验
统一放大语料后,BM25反超Agent搜索:复杂RAG并非越高级越耐规模。
PAPER
长视频用频谱给自己纠偏
FreqForcing在频域给长视频设锚点,减缓颜色漂移和运动停滞。
PAPER
推理正确,不等于证据用对
十个开放权重模型的对照实验显示:多想一会儿更会用现有证据,却未必更愿意主动求证。
PAPER
MoE拥塞不只怪通信带宽
MoE堵车不只因带宽不足:发送顺序也会让流量突然挤向热门专家。
PAPER
GRPO开始对抗分布坍缩
ReCo给GRPO的热门答案降权,尽量留住少见但正确的推理路径。