Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.023 — 2026-07-27
NEWS 约 1 分钟

浏览器小模型冲到1440 tok/s

LFM 2.5 230M借定制WebGPU后端,在RTX 3090浏览器中跑到约1400—1500 tok/s。

IMAGE — r/LocalLLaMA 日榜

网页里的 AI 常让人觉得慢:你输入一句话,还要盯着光标等它逐字往外蹦。开发者 lordhiggsboson 展示了另一种速度:让 LFM 2.5 230M 直接通过 WebGPU——网页调用本机 GPU 的接口——在浏览器内运行。据其在 Reddit 自述,模型在 RTX 3090 上达到约 1400—1500 tok/s,在 Apple M4 上达到约 400—500 tok/s。tok/s 是每秒处理或生成的 token 数;token 可以简单理解为模型读写文字时切分的小片段。

关键不只在模型小,还在定制后端——把模型计算翻译成特定 GPU 操作的软件层。作者针对 Nvidia 和 Apple Silicon 分别优化 kernel:前者采用多阶段的激进融合,后者合成一个大型 kernel,以减少 WebGPU 上的额外开销。kernel fusion 就像把多趟零散加工并成更少的流水线,省下反复启动、同步和搬运数据的时间。这为端侧网页应用展示了一条高吞吐路径,但项目仍在开发中,作者称未来几周才会把它并入 Sipp library;目前这些速度也只是作者公布的特定硬件结果。


供稿材料 SOURCES — 1

← 返回 2026-07-27 · 开源板块