Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.021 — 2026-07-25
NEWS 约 1 分钟

M5的INT8算力还没被吃满

M5 已支持 8 位激活,但主流后端仍用 16 位,实测预填充提速 1.4 倍

在 Mac 上让模型先读一大段材料,等待往往发生在正式回答之前。这个阶段叫 prefill(预填充)——模型把整段输入逐步转换成内部表示。问题可能不全在芯片:据开发者 maddie-lovelace 在 Reddit 分享,M5 已支持 W4A8,即权重用 4 位、激活值用 8 位计算,但 MLX 和 Mac 版 llama.cpp 目前仍普遍采用 16 位激活。换句话说,硬件已经准备好走一条更省计算的路,主流推理后端却还没接上。

作者自行编写 W8A8 内核后,在 M5 MacBook Air 的 Gemma4 预填充测试中报告约 1.4 倍提速:处理 130,173 个输入 token(模型切分文字后的基本单位)时,速度从原版的每秒 2,193 token 提升到 3,029。这个结果尚属单名开发者、单套测试的自述,也没有披露精度影响,但它点出了一块明确的优化空间:苹果本地推理下一步的增量,可能不只来自更强芯片,也来自 MLX、llama.cpp 这类连接模型与 Apple Silicon 的软件底座真正用上 8 位激活。


供稿材料 SOURCES — 1

← 返回 2026-07-25 · 开源板块