Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.051 — 2026-08-24
NEWS 约 1 分钟

两地GPU也能协同跑大模型

ShardFlow让跨地区GPU协同推理,把公网等待从“每词一次”摊到“每批一次”。

两块GPU隔着几个州,也能一起跑大模型吗?难点像两个人远程接力:计算未必慢,反复通信才耽误时间。ShardFlow把模型拆到多台GPU上,再用推测解码——小模型先猜一批Token(模型生成文字的基本单位),主模型随后集中验证——把公网等待从“每生成一个Token一次”变成“每轮一次”。

据作者在 Reddit 自述,两块位于 GCP Iowa 和 Oregon 的 T4 GPU,经 Ohio 的 AWS EC2中继连接,公网往返延迟约86毫秒。运行 Qwen2.5-7B 时,每轮草拟8个Token,平均确认4.07个;速度从非推测方案的4.92 TPS,提高到加入 CUDA Graphs 后峰值28.10 TPS、平均20.31 TPS。TPS指每秒生成的Token数。这里最值得注意的是,CUDA Graphs把一串GPU操作预先录好、一次重放,将草稿模型单轮延迟从112毫秒降到25毫秒;此前 Python 循环每轮启动约1500个CUDA内核,GPU有65%的时间在空等。结果尚属作者基准测试,但它具体展示了:闲散GPU即使分散在不同云区,也可能被拼成可用的推理资源。


供稿材料 SOURCES — 1

← 返回 2026-08-24 · 科技板块