Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.051 — 2026-08-24
NEWS 约 1 分钟

Intel显卡也能跑27B生产栈

Arc Pro B70 跑通 27B 本地模型,实测生成 52.2 tok/s,并支持 128K 上下文。

想在自己的电脑上部署大模型,难点不只在显卡够不够大,还在软件能不能真正把硬件用起来。一名 Reddit 用户报告称,Intel Arc Pro B70(32GB 显存)已通过 vLLM XPU 跑通 Qwen3.8-27B 的 GPTQ INT4 版本。vLLM 是负责显存调度和文本生成的推理引擎,XPU 则是它调用 Intel GPU 的后端;INT4 会以可能损失一定精度为代价压缩模型,从而降低显存占用。

按发帖者公布的五轮测试中位数,开启 MTP2 speculative decoding 后,模型生成速度达到 52.2 tok/s;关闭时为 33.2 tok/s。该配置还能提供日常使用的 64K 上下文,以及可选的 128K 上下文——也就是一次可处理的输入与输出词元总量。发帖者还称,视觉输入、工具调用和代理测试均已通过。

这让 Intel 独立显卡多了一个可用于本地大模型服务的选项。不过边界也很明确:测试将请求串行化,128K 需要把 GPU 利用率设为 0.95,192K 以上在 32GB 显存中不可行;上述表现来自单名用户发布且注明由 AI 总结的配置报告,尚非独立基准测试。


供稿材料 SOURCES — 1

← 返回 2026-08-24 · 开源板块