Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.042 — 2026-08-15
NEWS 约 1 分钟

Kog要从GPU里榨出更多Agent推理

法国创业公司 Kog 深挖现有 GPU,试图降低 Agent 高频推理的等待与成本。

IMAGE — TechCrunch · AI

让 AI Agent 连续写代码,真正拖慢体验的常常不是“想不明白”,而是每生成一点内容都要等。Agent 会频繁调用模型,这让推理——模型读取输入并生成答案的过程——成为昂贵瓶颈。法国创业公司 Kog 想靠软件优化,让企业已有的 GPU 多干活,而不是换成专用 AI 芯片。

据 TechCrunch 报道,Kog 的演示在 AMD MI300X 和 Nvidia H200 上做到单请求每秒生成 3,000 个 Token(模型生成文字时使用的基本单位)。关键在“单请求”:语言模型要逐个生成 Token,后一步依赖前一步,很难像训练那样大规模并行。Kog 因而深入到 GPU 的汇编语言和二进制代码层,针对每款芯片花数周甚至数月调校。

但这个数字来自约 20 亿参数、为演示专门打造的小模型 Laneformer 2B,不能直接代表主流大模型。Kog 宣称目标是把大模型推理提速 30 倍,目前仍需跨过明显的规模鸿沟;它真正值得关注的,是挑战“GPU 不适合解码”的判断,尝试用软件把闲置算力变成更快、更便宜的 Agent 响应。


供稿材料 SOURCES — 1

← 返回 2026-08-15 · 科技板块