网页里的 AI 常让人觉得慢:你输入一句话,还要盯着光标等它逐字往外蹦。开发者 lordhiggsboson 展示了另一种速度:让 LFM 2.5 230M 直接通过 WebGPU——网页调用本机 GPU 的接口——在浏览器内运行。据其在 Reddit 自述,模型在 RTX 3090 上达到约 1400—1500 tok/s,在 Apple M4 上达到约 400—500 tok/s。tok/s 是每秒处理或生成的 token 数;token 可以简单理解为模型读写文字时切分的小片段。
关键不只在模型小,还在定制后端——把模型计算翻译成特定 GPU 操作的软件层。作者针对 Nvidia 和 Apple Silicon 分别优化 kernel:前者采用多阶段的激进融合,后者合成一个大型 kernel,以减少 WebGPU 上的额外开销。kernel fusion 就像把多趟零散加工并成更少的流水线,省下反复启动、同步和搬运数据的时间。这为端侧网页应用展示了一条高吞吐路径,但项目仍在开发中,作者称未来几周才会把它并入 Sipp library;目前这些速度也只是作者公布的特定硬件结果。