深度专题 FEATURES — 3
SPADE:Agent自己造世界升级
SPADE让同一个LLM边造可执行训练世界、边闯关,把AI升级的难题推向“谁来持续出好题”。
60美元旧显卡也能跑70B
128张每张约60美元的二手V100合力服务70B模型:省下硬件钱,却把账单转向电力与运维。
人形机器人上场踢真足球
机器人靠机载视觉边追边踢,在真实RoboCup赛场检验感知与全身控制。
速览 BRIEFS — 9
PAPER
JEPA不靠高斯先验也能站稳
用“看状态猜动作”防止JEPA学成一团,在复杂场景中胜过高斯约束。
PAPER
TileMix把注意力精度拆到小块
TileMix按GPU计算块分配FP16或INT8,在长文本预填充中兼顾速度与精度。
PAPER
冻结Transformer也能外挂长记忆
MoNe给冻结Transformer外挂可更新记忆,读到128K上下文也无需重训主模型。
PAPER
GRPO开始估计梯度的不确定性
GUPO给每组梯度估算可信度,减少冲突信号对GRPO更新的干扰。
PAPER
无监督推理从多Agent群体中涌现
Co-RL让不同Agent互相当老师,在没有标准答案时也能练出更强推理。
PAPER
代码Agent的训练环境进入RL本体
LEGO-RL把工具、仓库与执行反馈一并纳入代码Agent的强化学习训练。
PAPER
Agent技能不必每次全塞进上下文
技能按需加载能省Token,但前提是把缓存折扣和取用开销算清楚。
PAPER
视频生成评测开始检查事情办没办成
SemComp-Bench不只评画面好不好看,还检查指令要求的事情是否真的办成。
PAPER
医疗LLM安全风险有了全流程地图
Nature综述绘出医疗LLM全流程风险地图,把安全检查从模型一路延伸到临床现场。