深度专题 FEATURES — 3
FlowBlock:扩散语言模型并行破局
FlowBlock让多个文本块边写边改,绕开扩散语言模型的块间串行瓶颈。
SAGE:世界模型先定目标再行动
SAGE先预测可达子目标,再生成候选动作,让世界模型的长程规划少靠盲猜。
LLM网关的故障地图
一张多模型网关故障地图:真正棘手的不是报错,而是看似成功、实际已损坏。
速览 BRIEFS — 8
PAPER
线性注意力也能投机解码
SpecLA让线性注意力模型也能批量核验候选词,最高提速1.70倍。
PAPER
无损加速也有硬件账单
实测显示:投机解码保持输出不变,却未必能在消费级硬件上提速。
PAPER
KV缓存开始压缩后再拼装
C²KV把长文缓存压缩成可拼装模块,让RAG少占显存,也少做重复计算。
PAPER
手机大模型只加载需要的神经元
SelectInfer让手机只加载、计算当前任务需要的神经元,把端侧优化细化到运行时选择。
PAPER
代码MoE砍掉一半专家
代码MoE一次剪掉约半数专家仍保住编程表现,但剪法不能跨模型照搬。
PAPER
Agent强化学习先解决等慢车
WAR按负载切换生成与调度策略,减少同步Agent训练被最长轨迹拖住的空等。
PAPER
机器狗开始在脑中预演障碍
机器狗在内部状态中预演障碍走势,部署时却不增加计算负担。
PAPER
VLA用前瞻残差补上精细装配
给通用机器人加上“会为下一步留余地”的纠偏层,让精细装配不再各步成功、全程失败。