Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.026 — 2026-07-30
REPO 34 STARS 约 1 分钟

TokenSpeed挑战极限推理速度

TokenSpeed主打Agent场景的极限生成速度,但“光速”仍待完整基准验证。

IMAGE — GitHub Trending(Python·日榜)

让 AI 同时替许多人执行任务,难点不只是模型够不够聪明,还要看回答能否又快又稳。TokenSpeed 是一个新开源的大模型推理引擎——也就是把训练好的模型真正跑起来,负责请求调度、显存管理和多 GPU 协作的软件层。它瞄准 Agent 工作负载,希望兼顾 TensorRT-LLM 级性能与 vLLM 级易用性。

项目把请求生命周期、KV Cache(保存已读上下文中间结果的显存缓存)归属和计算重叠时机写进有限状态机,并尝试在编译阶段保证缓存安全复用。它还用静态编译器预先生成多 GPU 通信计划,减少运行时开销。作者自述,TokenSpeed 在 Qwen3.5-397B-A17B 的 Agent 场景中达到 580 TPS——即每秒生成 580 个 token。不过现有材料未披露完整测试配置、并发条件和对照结果,“speed-of-light”仍是项目口号,后续公开基准才是关键。


供稿材料 SOURCES — 1
01
lightseekorg/tokenspeed GitHub Trending(Python·日榜) · REPO
原文 ↗

← 返回 2026-07-30 · 开源板块