训练大模型,不是把芯片堆进机房就够了,更像让上万名工人同时完成一项工程:网络、软件和调度跟不上,再多人也会互相等待。国产算力替代尤其如此,它不只是逐颗换掉 Nvidia 芯片,还要重做编译器、通信库、训练框架和运维体系。
据 Bloomberg 报道,中国大模型公司 Z.AI(智谱)已建成一座只使用中国制造芯片、用于 AI 模型训练的大型数据中心,规模达到1吉瓦。Bloomberg 还称,Z.AI 已建设或运营多个各含逾1万颗芯片的计算集群。所谓训练集群,就是用高速网络把大量加速芯片连起来,共同完成一次模型训练;真正决定有效算力的,还包括芯片利用率、互连效率和软件适配。
这座设施值得关注,因为它为出口限制环境下、本土软硬件能否组成大型训练系统提供了新的落地案例。不过现有材料未披露芯片型号、实际训练任务及性能数据,因此它证明了设施可以建成,尚不足以判断其训练效率和国际竞争力。