Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.060 — 2026-09-02
PAPER HF 59 约 1 分钟

生成优先,潜空间训练换顺序

GenFirst把训练顺序倒过来:先让潜空间利于生成,再逐步补回重建细节。

像教人做速记:若一开始只要求逐字还原,记号可能很精确,却未必方便拿来续写。潜生成模型也有类似矛盾。标准做法先训练变分自编码器(VAE——把图片压成潜变量、再还原图片的模型),随后冻结它,再训练生成器。GenFirst则把重点调换:先用生成目标塑造潜空间——图片压缩后的内部数字表示,再逐步加强重建,让模型补回视觉细节。

关键不只是“先后顺序”。作者分析认为,重建学得快、监督信号强,生成却更慢、更难;两者同时用力时,重建容易抢先主导。论文还指出,KL 散度目标中的熵项——维持潜变量不确定性的部分——是避免潜变量坍塌的关键,否则不同图片可能被挤进相似表示。作者称,这套方法实现了不发生坍塌的直接端到端训练;在 ImageNet-256 上,SiT 配合 CFG(生成时强化条件约束的引导方法)取得 0.97 gFID,不用 CFG 时为 1.45。结果来自论文自述,尚不能单凭这些数字判断它在更多数据和模型上的稳定性。


供稿材料 SOURCES — 1

← 返回 2026-09-02 · 学术板块