训练大模型有点像带学生反复做题:先让它批量作答,再评分,最后根据分数调整。但模型、出题、评分各由不同系统负责时,流程很容易变成一堆难以排查的管线。THUDM 开源的 slime,正是为扩展这类强化学习后训练而做的基础设施,不是供普通用户聊天的模型。
slime 最值得注意的设计,是让训练、rollout——模型批量生成完整回答或行动轨迹——以及奖励计算,都经过同一条 training / rollout / Data Buffer 数据路径。它用 Megatron 承接分布式训练,用 SGLang 负责生成,并允许团队自定义数据生成、验证和环境交互流程。这样做的重点不只是速度,也是把数据流摆在明面上:强化学习中的错误常常不会直接报错,slime 因此提供仅生成和仅训练的独立调试路径。
项目方称,slime 已用于 GLM-4.5 至 GLM-5.2 等模型的完整后训练流程,也支持多代 Qwen、DeepSeek V3 系列和 Llama 3。不过,供稿未给出具体吞吐量或训练收益对比;眼下更值得观察的是,这套轻量且明确押注 Megatron + SGLang 的架构,能否成为强化学习扩展实验的稳定底座。