Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.058 — 2026-08-31
NEWS 约 1 分钟

双5090把Qwen上下文推到百万

NInfer 分支借双 RTX 5090,让 Qwen 27B 尝试读入百万 token

IMAGE — r/LocalLLaMA 日榜

让本地 AI 一次读完整座代码库,难点不只是模型够不够聪明,还在于显存能否装下它的“草稿纸”。一位名为 Littlepharaoh 的开发者在 Reddit 称,他为 NInfer——面向 Qwen 模型的推理引擎——加入双 GPU 张量并行,把同一次计算拆给两张 RTX 5090;再用 YaRN 扩展模型可识别的位置范围。由此,Qwen3.8-27B NVFP4 可尝试装入 1,048,576 个 token,每卡占用 27.4 GB,且无需 NVLink 专用互连。

作者自测显示,输入达到 100 万 token 时,生成速度约为 48 tok/s;启用 MTP 推测解码——先起草多个后续 token,再让主模型批量核验——后约为 100 tok/s。不过,读入完整提示仍需约 18 分钟。YaRN 只是把窗口拉长,并不保证模型仍能可靠记住很远的信息;目前这些性能与可用性结论也仅来自作者发布的数据。


供稿材料 SOURCES — 1

← 返回 2026-08-31 · 开源板块