Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.049 — 2026-08-22
PAPER 约 6 分钟

60美元旧显卡也能跑70B

128张每张约60美元的二手V100合力服务70B模型:省下硬件钱,却把账单转向电力与运维。

60美元旧显卡也能跑70B,但不是一张卡

想象一家小餐馆接到大型宴席订单。它买不起一套昂贵的自动化厨房,于是找来许多二手灶台,把每道工序拆开:一台切配,一台烹煮,一台装盘。单台设备并不强,真正决定能否出餐的,是整条流水线会不会堵住。

论文《DumpsterCluster》做的正是类似尝试。研究团队用二手零件搭建了一个包含128张 NVIDIA V100 GPU 的集群,让它承担 LLaMA-70B 的模型推理——也就是模型训练完成后,实际接收问题并生成回答的过程。70B表示模型约有700亿个可调参数,模型本身和运行时的临时数据远远装不进一张16GB显存的V100。

所以,标题中的“$60 GPUs”不能理解成“一张60美元显卡独立运行70B”。按论文列出的当前二手价格,每张V100约60美元,128张卡合计7680美元;算上二手CPU、内存、主板、网卡和交换设备,整套系统约2.2万美元。以下性能、成本和碳排放数字均来自这一篇论文,尚无独立信源交叉验证。

旧卡不够大,就把模型切成流水线

旧GPU主要吃亏在三处:显存小,计算慢,多卡之间传数据也慢。显存可以理解为GPU手边的工作台;互连带宽则像工位之间的传送带。卡越多,如果每一步都要来回交换大量数据,传送带反而可能先堵死。

常见的大模型服务软件会优先采用张量并行——把同一层计算拆给多张GPU,算完再汇总。这适合卡间通信很快的新硬件,却不适合V100这样的旧设备。论文换了一个角度:优先采用设备级流水线并行,把模型的不同层放到不同GPU上,让每张卡成为一道工序。运行70B模型时,流水线最深可达80级。

这样做减少了频繁拆分、汇总同一层结果的通信。论文称,跨GPU所需带宽约为3.125 GB/s,低于这套集群能够提供的带宽。团队还在CPU一侧异步预取下一步数据:GPU处理当前任务时,CPU提前准备下一批输入,尽量把传输等待藏在计算背后。

软件也不是在现成框架上改几个参数。团队用 Rust 编写了定制服务引擎,并把这套由二手GPU、CPU、内存和主板组成的系统实际运行了一年。

“能跑”与“跑得快”是两回事

论文用 TPS(Tokens Per Second,每秒处理或生成的文本片段数量)衡量吞吐量。token是模型处理文字的基本单位,可以粗略理解为字词片段。TPS越高,同一时间能服务的请求通常越多。

在偏重长输入处理的8B模型测试中,128张V100达到约22.4万 TPS,而单张B200约为6.27万 TPS。这里比较的是一整个128卡集群和一张新卡,说明大量旧卡叠加后确实能换来很高的总吞吐量,并不表示单张V100比B200快。

70B更能说明这项工程解决了什么。128张V100达到1512 TPS;作为对照,8张B200组成的系统为37045 TPS,8张H100为19885 TPS。旧卡集群明显更慢,但它完成了单张16GB V100根本容纳不了的工作。换句话说,这项成果的重点不是追平新硬件的绝对速度,而是用低采购成本跨过“无法部署”的门槛。

论文把这一表现称为“competitive throughput”,但这个说法需要收窄理解。至少在披露的70B测试里,它的绝对吞吐量只有8卡B200系统的大约二十五分之一。优势主要来自购买价格:论文按当时市场价格估算,完整DumpsterCluster约2.2万美元,而8卡B200系统约60万美元。两者的成本口径和硬件规模并不完全相同,价格也会随时间和地区变化。

便宜硬件,把成本转移到了别处

二手设备省下的是前期采购费,不一定省下长期电费。V100每生成一个token耗能更多。论文的总拥有成本分析显示,旧卡方案只有在电价较低的地区才保持优势;70B模型的计算量更大,电力支出会更快吞掉最初省下的钱。论文自己的表格还显示,二手A100 80GB系统在多年期比较中可能比V100方案更划算。

可靠性也需要额外工程。团队先对旧GPU进行压力测试和筛选,并预留冗余设备。持续运行一年期间,集群记录了58次事件。其中50次可通过软件处理,包括32次PCIe重置和18次由软件原因触发的重置;8次需要更换硬件,包括2张网卡、1张GPU和5张CPU。论文据此计算出约6.25%的年度设备故障率。多数问题可以恢复,但监控、重启、诊断和备件管理仍需要人力,而且二手设备没有新硬件那样可预测的保修与寿命。

再利用不自动等于更环保

这项研究最值得注意的地方,是它没有把“二手”直接写成“绿色”。延长GPU寿命,可以摊薄制造硬件时产生的隐含碳排放,也能减少电子废弃物。但旧卡运行效率低,使用阶段的排放可能更大。

按论文采用的电网平均碳强度和五年生命周期口径,V100系统运行8B模型时,每百万token的总碳排放约为当代硬件的3.7倍;运行70B时,差距扩大到约41倍。结果还会随电力来源、设备利用率以及是否把旧卡的制造排放计入而变化。即使把二手卡的既有制造排放视为零,70B推理的用电仍是沉重负担。

因此,这不是一套到处复制都合理的廉价方案。论文给出的成立条件很明确:电既要便宜,又要低碳。满足这两个条件时,二手GPU集群可以用较低的前期投入扩展AI推理能力;条件不满足时,它可能只是把硬件采购成本和电子废弃物问题,转化成更高的电费、排放与维护成本。

局限与未知

  • 论文没有明确披露所服务LLaMA-70B的具体版本、模型精度或量化方式,这些设置会显著影响显存占用和性能,因而“跑70B”目前只能理解为这套集群完成了相应规模模型的推理。
  • 70B测试给出了总吞吐量,却未完整披露并发量、单请求延迟等服务体验指标;仅凭TPS不足以确认广义的“生产可用”。
  • 2.2万美元与60万美元是特定时间的市场估价,且成本口径未必完全一致。实际选择还取决于当地电价、电力碳强度、设备成色和维护能力。

供稿材料 SOURCES — 1

← 返回 2026-08-22 · 学术板块