深度专题 FEATURES — 3
Twin:让Agent现场写出游戏世界
Agent边玩边写游戏规则:先在数字孪生里试走,再把验证过的动作交给真实游戏。
FreeToken:让MoE在边缘按带宽运行
FreeToken让MoE按设备的实时带宽分配任务,把超大模型搬到个人电脑上运行。
隐式思考,也能开口解释
SELR让模型在潜空间里省字推理,再亲自把内部表示译成人话,试图兼顾效率与可审计性。
速览 BRIEFS — 8
PAPER
一年真实流量,重画LLM服务地图
一整年真实线上请求,检验LLM缓存、负载均衡与基准测试是否仍贴近现实。
PAPER
概率JEPA原来像隐马尔可夫模型
用隐马尔可夫模型重读概率 JEPA,看清它如何推断、推进并检验世界状态。
PAPER
INT8同接口,不等于同结果
同样的 INT8 接口,只换 GPU 内核,模型就可能写出不同答案。
PAPER
KV缓存压缩有了信号编码视角
把 KV 缓存当作信号来编码,按注意力影响分配精度,约压缩 5.8 倍
PAPER
长上下文蒸馏,不再受分词器绑架
让长上下文教师跨分词器带学生,长推理能力迁移不再要求同门同派。
PAPER
机器人关键一瞬,需要预测式反应
Reflex让机器人评测不再“暂停等思考”,直面高速任务中的真实延迟。
PAPER
Agent出错后,执行现场也能倒带
AgentRewind把对话与环境一起存档,让长程Agent能从早期错误前真正重来。
PAPER
VLA现场学会调用工具
ART 给现有 VLA 插上工具箱,遇到能力边界时先调用专用模块再动手。