让本地 AI 一次读完整座代码库,难点不只是模型够不够聪明,还在于显存能否装下它的“草稿纸”。一位名为 Littlepharaoh 的开发者在 Reddit 称,他为 NInfer——面向 Qwen 模型的推理引擎——加入双 GPU 张量并行,把同一次计算拆给两张 RTX 5090;再用 YaRN 扩展模型可识别的位置范围。由此,Qwen3.8-27B NVFP4 可尝试装入 1,048,576 个 token,每卡占用 27.4 GB,且无需 NVLink 专用互连。
作者自测显示,输入达到 100 万 token 时,生成速度约为 48 tok/s;启用 MTP 推测解码——先起草多个后续 token,再让主模型批量核验——后约为 100 tok/s。不过,读入完整提示仍需约 18 分钟。YaRN 只是把窗口拉长,并不保证模型仍能可靠记住很远的信息;目前这些性能与可用性结论也仅来自作者发布的数据。