深度专题 FEATURES — 2
榜单被污染,排名却未必失真
污染会让模型多得分,却未必改名次。这项研究把“分数虚高”和“榜单失真”拆开检验。
GrowPage:推理时动态扩缩KV预算
GrowPage让长推理的KV容量按注意力需求逐页增长,在准确率与并发吞吐之间寻找更灵活的平衡。
速览 BRIEFS — 8
PAPER
离散扩散给LLM无损提速
让LLM一次并行生成多个Token,最高提速3倍,同时保留原模型的输出分布。
PAPER
手机推理开始边猜边精修
LeanStream让手机端大模型先预取、再修正,边读权重边计算,缓解内存与等待瓶颈。
PAPER
JEPA规划补上物理约束
给只预测潜表示的 JEPA 加上物理状态校准,让机器人少走视觉捷径。
PAPER
世界模型也要出具事故报告
VeriPhy把视频物理评测变成可追溯的“事故报告”,指出哪条规则在何时失效。
PAPER
安全关键系统不能只看视频逼真
世界模型画得再真,也可能漏掉真正会改变安全决策的危险证据。
PAPER
FP4算力快,不代表注意力就快
Blackwell把FP4矩阵乘法做快后,Softmax和片上存储接力反而成了注意力的新瓶颈。
PAPER
开源人形机器人从形态一起设计
BRIDGE把机器人身体与控制器一起优化,让人类动作更容易落到实体机器上。
PAPER
脑信号开始直接引导机器推理
把脑活动与模型内部表示对齐,让脑信号从“观察对象”变成机器推理的引导信号。