想在自己的电脑上部署大模型,难点不只在显卡够不够大,还在软件能不能真正把硬件用起来。一名 Reddit 用户报告称,Intel Arc Pro B70(32GB 显存)已通过 vLLM XPU 跑通 Qwen3.8-27B 的 GPTQ INT4 版本。vLLM 是负责显存调度和文本生成的推理引擎,XPU 则是它调用 Intel GPU 的后端;INT4 会以可能损失一定精度为代价压缩模型,从而降低显存占用。
按发帖者公布的五轮测试中位数,开启 MTP2 speculative decoding 后,模型生成速度达到 52.2 tok/s;关闭时为 33.2 tok/s。该配置还能提供日常使用的 64K 上下文,以及可选的 128K 上下文——也就是一次可处理的输入与输出词元总量。发帖者还称,视觉输入、工具调用和代理测试均已通过。
这让 Intel 独立显卡多了一个可用于本地大模型服务的选项。不过边界也很明确:测试将请求串行化,128K 需要把 GPU 利用率设为 0.95,192K 以上在 32GB 显存中不可行;上述表现来自单名用户发布且注明由 AI 总结的配置报告,尚非独立基准测试。