RL 训练偏爱简单题:马太效应让 LLM 难题进步停滞
研究发现强化学习训练显著提升 LLM 在简单任务上的表现,但对难题几乎无改善,作者称之为「马太效应」。关键原因在于采样策略:较大的 k 值会浪费算力在简单题的罕见错误上,而较小的 k 值反而更有效。这意味着当前 RL 后训练方法存在系统性偏科,需要调整采样策略来平衡难易题的训练。
一篇新博客文章揭示了 LLM 强化学习训练中的一个重要现象:模型在简单问题上进步显著,但在难题上几乎停滞不前。作者用 Olmo 3.1 RL-Zero 在 AIME 2025 数学评测上的表现说明,将 30 道题按初始正确率分为易、中、难三档后,简单题的正确率大幅提升,而初始 pass@32=0 的难题在训练后大多仍然无法解决。作者将这一现象类比为网络科学中的「马太效应」——富者愈富,即 RL 对任务的改善程度与模型初始能力成正比。
研究进一步在代码和智能体任务(Deepcoder、DeepSWE)中验证了该现象,并尝试用 GSM8k 数据集探究原因。实验对比了不同采样数量 k 对训练效果的影响,结果出人意料:k=4(小采样)比 k=32(大采样)在难题上表现更好。原因在于训练批次中只包含部分正确部分错误的样本,大 k 虽然更容易找到难题的稀有正确解,但也更容易在简单题上遇到稀有错误解,从而浪费大量算力。
训练过程中存在一个拐点(约第 200 步):早期 k=32 能解决更多难题,但之后 k=4 反超。这是因为小 k 能更快过滤掉已被充分解决的简单题,腾出算力给难题。作者认为,马太效应的根源不仅是难题采样不足,更是过多算力被消耗在简单题上。他们提出「永不放弃」(Never Give Up)策略来应对这一偏差,强调调整采样动态可能是突破当前 RL 训练瓶颈的关键。
本文由程序自动抓取公开报道,经 AI 筛选与改写生成,未经人工逐条核实,事实以原文为准。