Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.059 — 2026-09-01
NEWS 5 信源 约 1 分钟

Qwen新模型跑遍五类硬件

社区实测显示,Qwen3.8-Flash-Next已能在手机、老卡与多卡系统上本地运行。

IMAGE — r/LocalLLaMA 日榜

同一款 AI,换台设备往往就像把只会一种插头的电器带去旅行:模型文件有了,软件和硬件也未必接得上。Qwen3.8-Flash-Next 值得关注,正因为它开始跨过这道门槛,从中端安卓手机一路跑到 NVIDIA、AMD 的新旧 GPU 和多卡系统。以下数字均来自用户自测,尚无统一条件下的横向验证。

一台 12GB、售价约 400—500 美元的安卓手机报告达到 3.5 tok/s;tok/s 即每秒生成多少小段文字。单张 96GB Pro 6000 通过量化——用较低精度压缩模型——跑到约 16.5万至17万 token 上下文,单路生成 76—125 tok/s。更大的配置也已出现:四张 Radeon R9700 报告生成 80—120 tok/s;两台 DGX Spark 在 26.2万上下文下单路约 45.9 tok/s;四张较老的 V100 则把约 50GB 数据卸载到系统内存,在 25.6万上下文末端仍约 57—63 tok/s。真正的进展不是某个速度纪录,而是不同量化格式、推理引擎和硬件后端已开始接力,把同一模型送进五类机器。


供稿材料 SOURCES — 5

← 返回 2026-09-01 · 开源板块