深度专题 FEATURES — 2
OpenViking:Agent记忆不再分家
OpenViking把记忆、资料和技能收进同一套目录,让Agent更容易找回经验,也更容易排错。
Mage-VL让视频理解边看边答
Mage-VL借视频压缩结构少看重复画面,让模型更接近边看边理解、遇事再回答。
速览 BRIEFS — 9
NEWS
Kimi K3的1.5TB GGUF开始落地
Unsloth开始发布Kimi K3的1.5TB本地运行文件,但顶级工作站实测仍慢至每秒0.23 Token。
NEWS
VibeVoice ASR压向无GPU边缘CPU
VibeVoice-ASR 的 BitNet 压缩版可在普通 CPU 实时转写,让本地语音 Agent 少一道 GPU 门槛。
REPO
TokenSpeed挑战极限推理速度
TokenSpeed主打Agent场景的极限生成速度,但“光速”仍待完整基准验证。
REPO
QwenPaw把个人助手接进聊天软件
把个人 AI 助手装在自己的设备上,并接进微信、钉钉、Telegram 等聊天入口。
REPO
Flint给Agent一门画图语言
Flint给AI Agent一套可修改的画图规格,再编译成常见绘图库配置,让制图更可控。
NEWS
多语言编码榜开始补齐真实世界
SWE-rebench加入五种语言的真实任务,开始检验编码模型能否应付不同技术栈。
NEWS
量化前先测哪些权重碰不得
逐组测试量化损伤,把有限精度留给真正怕压缩的权重。
NEWS
DeepSeek V4 Flash跑上Strix Halo
128GB统一内存装下V4 Flash与草稿模型,作者称生成约32 tok/s
REPO
TensorZero把LLMOps收进一套平台
TensorZero把模型接入、监控、评测和实验合到一处,帮团队少维护几套重复工具。