从零训练语言模型,像是从空白开始教一个学生读懂海量文字,通常最难跨过的门槛不是想法,而是算力账单。Puro-2B试着把这件事压进小团队可承受的范围:团队用消费级RTX 5090 GPU集群,从随机参数开始训练约20亿参数的模型,并公开数据、代码、权重和中间检查点。这里并非“一张显卡完成训练”,而是用更容易购得的消费级显卡降低整体成本。
最具体的参照来自团队拟合的成本缩放曲线:按其评测和租赁等价口径,约4400美元的训练成本可达到Qwen2-1.5B的综合表现,低于标题所强调的5090美元。其最佳版本训练了约1.4万亿个token——模型学习文本时处理的基本单位——耗时17.6天,计算成本约6900美元,作者称表现接近Qwen2.5-1.5B。团队把成本下降归因于FP8低精度训练、优化器、数据编排和硬件选择的协同设计;不过这些效果与成本数字均来自论文自己的评测及核算口径。