GPU 排得满,不代表算力用在了最重要的地方。Ai2 管理着数千块 NVIDIA H100、B200 和 B300,服务约 150 名研究人员;任何时刻,大家申请的 GPU 都是实际供应的 2—3 倍。过去,集群调度器——给 GPU 任务排班的系统——主要看优先级,结果所有已调度任务最终都标成了 HIGH,低优先级任务几乎拿不到算力,甚至有人用空任务提前“占座”。
Ai2 因此改用 GPU 时间预算、分层公平分配和分时契约。关键变化不是让机器更忙,而是把 Impact(影响力)纳入调度:有限算力应优先支持机构认为价值更高的研究。各项目该获得多少 GPU 时间,也从运维人员逐案协调,转成透明的管理预算流程。这提供了一个值得关注的工程视角:算力短缺时,调度首先是资源治理问题。不过,谁来定义“价值”、怎样衡量影响力,仍需要机构自己作出明确选择。