深度专题 FEATURES — 2
JEPA-Anything:一种预测法跨越不同世界
把预测拆成互补因子,JEPA-Anything试图用同一原则理解图像、病程、分子与天气。
DeepSeek把KV缓存再压一步
长程 Agent 越跑越贵,DeepSeek 用跨层复用与 4 位缓存,把关键 KV 缓存压到前代约四分之一。
速览 BRIEFS — 8
PAPER
失败之后,机器人该学什么
MAGMA-GEN用反事实重执行筛掉误判,让机器人的失败经历成为更可靠的恢复教材。
PAPER
草稿模型何时复制、何时生成
SwitchSD 读取主模型的内部信号,动态决定草稿该复制还是生成。
PAPER
世界模型也要先预测量化损失
PreDE先看离线动作偏差,筛出值得上机器人实测的量化配置。
PAPER
寿司操作把触觉接入世界模型
TacSushi让机器人边看边“摸”,在寿司操作中学会预判接触后果。
PAPER
视频越生成越忘,问题可能在训练
长视频越生成越容易漂移,Recency Forcing把原因指向训练与实际生成时的记忆落差。
PAPER
模型开始自己决定何时回看上下文
模型先看近处,必要时才回查完整历史,减少长上下文的重复扫描。
PAPER
别把环境反馈从Agent训练里抹掉
让Agent连环境反馈也学着预测,会改变强化学习后的探索方式。
PAPER
4D基础模型真的记得住世界吗
用360°视频给4D模型做记忆体检:画面外的物体,普遍记不牢。