Meta超级实验室MSL最新研究论文探索了利用强化学习微调大语言模型的方法。该方法通过「回收利用」模型先前生成的回答作为新起点,实现自我改进或自我发散,逐步扩展训练分布。
研究采用GRPO强化学习微调方法,相比传统PPO方法减少了资源需求。该方法使用蒙特卡洛轨迹估计基线,并通过「可学习性分数」和课程机制优化训练任务选择。
为保持输出多样性,研究引入了发散改进组件,使模型在改进解决方案的同时显著偏离原方案。实验显示,该方法在单轮和多轮任务场景中均表现优异,单步性能提升达22%。
分析表明,完整ExIt方法在任务空间探索中展现出最大多样性,其产生的任务实例分布显著优于基础训练集。该方法可应用于多种搜索框架,为LLM自我改进提供了新思路。

粤公网安备 44010602000162号
网友评论