Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.045 — 2026-08-18
REPO 31 STARS 约 1 分钟

slime押注强化学习后训练扩展

THUDM 开源大模型强化学习后训练框架 slime,把训练、生成与奖励评估接入同一条数据流。

IMAGE — GitHub Trending(Python·日榜)

训练大模型有点像带学生反复做题:先让它批量作答,再评分,最后根据分数调整。但模型、出题、评分各由不同系统负责时,流程很容易变成一堆难以排查的管线。THUDM 开源的 slime,正是为扩展这类强化学习后训练而做的基础设施,不是供普通用户聊天的模型。

slime 最值得注意的设计,是让训练、rollout——模型批量生成完整回答或行动轨迹——以及奖励计算,都经过同一条 training / rollout / Data Buffer 数据路径。它用 Megatron 承接分布式训练,用 SGLang 负责生成,并允许团队自定义数据生成、验证和环境交互流程。这样做的重点不只是速度,也是把数据流摆在明面上:强化学习中的错误常常不会直接报错,slime 因此提供仅生成和仅训练的独立调试路径。

项目方称,slime 已用于 GLM-4.5 至 GLM-5.2 等模型的完整后训练流程,也支持多代 Qwen、DeepSeek V3 系列和 Llama 3。不过,供稿未给出具体吞吐量或训练收益对比;眼下更值得观察的是,这套轻量且明确押注 Megatron + SGLang 的架构,能否成为强化学习扩展实验的稳定底座。


供稿材料 SOURCES — 1
01
THUDM/slime GitHub Trending(Python·日榜) · REPO
原文 ↗

← 返回 2026-08-18 · 开源板块