深度专题 FEATURES — 2
K2 Horizon:开放模型再冲前沿
K2 Horizon 横跨 0.9B 到 375B,想把前沿性能与训练过程一起开放。
337KB语音合成跑上3美元芯片
sanoTTS把多语言语音合成压到337KB,试图让3美元芯片离线开口。
速览 BRIEFS — 9
NEWS
Qwen MTP合入主线,5090速度翻倍
Qwen3.8-Flash-Next 的 MTP 加速进入主线,作者实测 5090 编码解码速度翻倍。
NEWS
双3090跑Qwen解码再快四成
量化、专家缓存与MTP叠加,让双RTX 3090解码达到37—41 tok/s
NEWS
Claude Code把代码差异贴到对话旁
Claude Code 新增侧边 diff 面板,边聊边看 AI 改了什么
REPO
NodeTerm把并行Agent铺成无限画布
把并行运行的终端和编码 Agent 摆成一张可缩放、可拖拽的任务地图。
NEWS
MoE多激活一点,推理反而少绕路
不重训模型,只让后段多位专家参与,推理 token 据称减少 8.5%
NEWS
Nemotron Puzzle 75B接入llama.cpp
75B 混合架构模型现可通过 llama.cpp 本地运行,专用生成加速仍待接入。
REPO
Agent Skills开始统一安装与同步
Skills Hub把多款 AI 编码工具的技能集中管理,做到一次安装、多端同步。
REPO
长任务编码Agent有了原创题考场
DeepSWE用113道原创工程题,检验编码Agent能否在真实项目里持续干活。
NEWS
近GPU闪存瞄准超显存大模型
美光据报探索把大容量 NAND 搬到 GPU 身边,为超显存模型增加一层近端存储。