


从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布 理解大模型后训练中的能力学习、泛化与遗忘 引言:后训练究竟在改变什么? 大语言模型在预训练阶段阅读海量文本,并通过“预测下一个 token”学习语言规律、世界知识、代码结构与一定程度的推理能力。然而,一个完成预训练的模型并不天然知道怎样遵循用户指令,也不一定会按照我们期待的格式回答,更不会自动把“对用户有帮助”“数学答案正确”或“代码能够通过测试”当作自己的优化目标。 这正是后训练要解决的问题。 后训练并不是简单地向模型中添加几条知识,而是在已有能力的基础上,改变模型面对特定输入时生成各种回答的概率。对于同一个问题,模型原本可能生成简短答案、冗长解释、错误推理、正确推理或格式混乱的内容。经过后训练,这些候选回答之间的概率关系会发生变化:某些行为被强化,另一些行为被压低,还有一些原有行为可能在训练过程中受到意外影响。 因此,我们可以把后训练理解为对模型输出分布的重新塑造。 本文重点讨论三种后训练方法: 监督微调(Supervised Fine-Tuning,SFT):在预先准备好的标准答案上学习; 强化学习(Reinforcement Learning,RL):从当前模型的输出中采样,再根据奖励优化; 在线策略蒸馏(On-Policy Distillation,OPD):由学生生成轨迹,再由教师在学生实际访问的状态上提供逐 token 指导。 三种方法都能提升模型能力,但它们使用的数据来源、学习信号和优化目标并不相同。这些差异进一步影响了训练效率、泛化能力、灾难性遗忘和输出多样性。 全文将围绕三个问题展开: SFT、RL 和 OPD 分别如何改变模型的输出分布? 它们最明确的优势、局限和适用条件是什么? 为什么它们在泛化与遗忘方面会表现出不同的倾向? 全文按照“概念—机制—证据—实践”逐步展开: 第一至三章建立基础,并分别说明 SFT 与 RL; 第四章从知识蒸馏出发,解释 OPD、OPSD 与 MOPD; 第五、六章讨论遗忘、泛化、KL 方向,以及学生为何可能超过教师; 第七章回到实验,检验教师类型与在线策略数据分别发挥什么作用; 第八、九章给出完整后训练流水线、方法选择框架与最终结论。 具体链接地址为:https://mp.weixin.qq.com/s/-GwE8wNo0UVDYks1qvCn_g