两台服务器一起训练大模型,像一群人合力搬钢琴:只要一人没跟上,其他人再忙也可能原地打转。这份现场报告记录了作者如何用16张NVIDIA B300,对Qwen3-32B做全参数微调——继续训练并更新模型内部几乎全部数字。它不提出新算法,价值在于公开真实故障与无效优化。
作者发现,GPU利用率会“报喜不报忧”:一次NCCL通信死锁中,多数卡仍显示100%利用率,实际吞吐却已归零。相比之下,功耗下降及各卡之间的功耗差异,更能分辨GPU是在计算、等待数据,还是卡在通信。故障最终指向各GPU分到的打包文本数量不一致;团队随后加入启动前检查,论文称只需2.7秒,就能提前拒绝这类危险任务。
报告还给出一个负面结果:直接从共享NFS读取并现场分词,冷启动与热缓存吞吐分别为52.8k和53.0k token/s;预先分词并放到本地缓存同样是53.0k。换句话说,在这组数据能装进内存、训练又受计算限制时,折腾本地缓存并没有提速。数字与诊断均来自作者现场测量,未见独立复现。