首页 > 热点播报 > 正文

Meta实验室发布LLM自举进化新方法 单步性能提升高达22%

Meta超级实验室MSL最新研究论文探索了利用强化学习微调大语言模型的方法。该方法通过「回收利用」模型先前生成的回答作为新起点,实现自我改进或自我发散,逐步扩展训练分布。

研究采用GRPO强化学习微调方法,相比传统PPO方法减少了资源需求。该方法使用蒙特卡洛轨迹估计基线,并通过「可学习性分数」和课程机制优化训练任务选择。

为保持输出多样性,研究引入了发散改进组件,使模型在改进解决方案的同时显著偏离原方案。实验显示,该方法在单轮和多轮任务场景中均表现优异,单步性能提升达22%。

分析表明,完整ExIt方法在任务空间探索中展现出最大多样性,其产生的任务实例分布显著优于基础训练集。该方法可应用于多种搜索框架,为LLM自我改进提供了新思路。

网友评论

热门IT产品
  1. ¥5999
    苹果iPhone17
    ·
  2. ¥9999
    苹果iPhone17 Pro Max
    ·
  3. ¥5999
    Xiaomi 17 Pro Max
    ·
  4. ¥4699
    HUAWEI Pura 80
    ·
  5. ¥1399
    荣耀X70
    ·
  6. ¥2699
    HUAWEI nova 14
    ·
  7. ¥3399
    荣耀400 Pro
    ·
  8. ¥4399
    vivo X300
    ·
  9. ¥2799
    OPPO Reno14
    ·
  10. ¥6499
    vivo X200 Ultra
    ·