智能硬件周刊

智能硬件行业资讯,IoT、机器人、AR/VR、智能家居前沿

从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布

从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布理解大模型后训练中的能力学习、泛化与遗忘引言:后训练究竟在改变什么?大语言模型在预训练阶段阅读海量文本,并通过“预测下一个 token” TensorBoard PPO log 解析
热门文章

© 2026 智能硬件周刊 版权所有

Sitemap