好比一直拿残缺题干练习,考试时却突然拿到完整题干:模型未必不会答,只是没练过这种条件。扩散语言模型先遮盖或扰乱文本,再分多轮补全;但训练时,提示词和待续写内容可能一起被污染,真正生成时却通常要依据一段干净前文续写。论文把一部分性能损失追到了这种“训练—生成错配”。
作者提出 PCD(Prefix-Conditioned Diffusion,前缀条件扩散):把每条训练文本切成两段,左侧前缀保持干净,像自回归模型那样逐词学习;右侧后文才接受扰动,并由模型去噪还原。关键在于,它只调整训练中的注意力、扰动和答案标记方式,不要求更换推理模式。作者报告,在 LLaDA2-Mini 的六项基准平均分上,PCD 相对稳定基线提升 4.2%,即 2.56 分;在 Qwen-1.7B 的主要机制对比中,相对提升 14.2%,即 4.86 分。结果说明,训练时让模型真正见到使用时的干净前文,可能收回一部分续写性能。