同一款 AI,换台设备往往就像把只会一种插头的电器带去旅行:模型文件有了,软件和硬件也未必接得上。Qwen3.8-Flash-Next 值得关注,正因为它开始跨过这道门槛,从中端安卓手机一路跑到 NVIDIA、AMD 的新旧 GPU 和多卡系统。以下数字均来自用户自测,尚无统一条件下的横向验证。
一台 12GB、售价约 400—500 美元的安卓手机报告达到 3.5 tok/s;tok/s 即每秒生成多少小段文字。单张 96GB Pro 6000 通过量化——用较低精度压缩模型——跑到约 16.5万至17万 token 上下文,单路生成 76—125 tok/s。更大的配置也已出现:四张 Radeon R9700 报告生成 80—120 tok/s;两台 DGX Spark 在 26.2万上下文下单路约 45.9 tok/s;四张较老的 V100 则把约 50GB 数据卸载到系统内存,在 25.6万上下文末端仍约 57—63 tok/s。真正的进展不是某个速度纪录,而是不同量化格式、推理引擎和硬件后端已开始接力,把同一模型送进五类机器。