每日速看!当AI学会做数学题后,为什么越练越"发疯"?

作者: 来源: 科技行者 2026-09-20 22:34:39

 

你有没有想过这样一个场景:一个学生天天刷同一本习题册,做到后面,他给自己出的题目会越来越诡异,甚至开始跳出习题册的范围,自己瞎编题目做。老师看他刷题正确率还不错,觉得没什么问题,结果一到真正的考试,他直接崩了。

这听起来有点荒谬,但这恰恰是现在训练大语言模型做数学推理时,真实发生的事情。


(资料图)

2024年到2025年间,用强化学习训练大模型做数学推理成了主流做法,GRPO、PPO这些算法名字满天飞。但一个隐藏的问题始终没人真正解决:模型在训练过程中,看待"问题"本身的方式在悄悄漂移,而所有人都只盯着模型"回答"的方式有没有跑偏。

来自阿里巴巴AMAP、西安交通大学、京东、北京师范大学和新加坡国立大学的一支研究团队,把这个被忽视的角落挖了出来,写成了一篇论文,叫做《超越稳定性-探索困境:面向LLM策略优化的环境正则化》。他们发现的东西,可能会让你重新思考"稳定训练"到底该管什么。

稳定与探索,一个两难的选择

先说清楚问题出在哪。

训练大模型做推理任务,本质上是一种强化学习过程。模型看到一个问题,尝试生成答案,答案对不对由一个验证器打分,模型根据打分调整自己,让下次更容易答对。这个过程听起来简单,但训练久了会出问题:模型可能会为了拿高分而走捷径,输出一些奇怪但能骗到高分的内容,导致训练效果和实际泛化能力脱节。业内管这个现象叫"奖励破解"。

奖励破解*:模型学会了利用打分机制的漏洞获取高分,而不是真正学会了任务本身,导致训练分数好看但实际能力没有真正提升。

为了防止模型跑偏,大家通常会加一个"缰绳",业内叫它Policy-KL,也就是策略KL散度约束。

策略KL散度*:衡量当前模型生成答案的方式和训练前(或某个参考版本)生成答案方式之间的差异,差异越大说明模型"变化"越大,加上这个约束就是让模型别变得太快太离谱。

问题来了:这根缰绳只管住了模型"怎么回答",却完全管不住模型"怎么看问题"。

这就好比一个学生在刷题过程中,老师只检查他答题的格式对不对,却从没检查他理解题目的角度有没有跑偏。学生表面上答题规范,实际上可能已经开始把简单题目脑补成难题,或者把难题简化成他会做的样子,题目本身在他脑子里的"样貌"已经变了,而老师毫无察觉。如果不检查这一层,等到真正的考试来了,题目还是原来的样子,学生却已经用错误的方式理解题目很久了,成绩自然崩盘。

这不是比喻上的夸张。论文里给出了一张实测图(图1),在固定的Policy-KL预算下,用批次估计的Query-KL(问题层面的KL散度)持续走高,而Policy-KL几乎是一条平线。这意味着,即便你死死管住了模型回答的自由度,模型看待问题本身的分布,仍然在毫无阻拦地漂移。

策略优化*:一整套用于调整AI模型行为的训练方法,让模型在与环境(比如做题、对话)互动中不断改进自己的决策方式,PPO、GRPO都是策略优化的具体算法。

这就是研究者所说的"稳定性-探索困境"的核心:你要是加强Policy-KL约束,模型的探索空间会被压缩,可能学不到更好的解法;你要是放松约束甚至干脆不用,模型就没有任何"刹车",训练到后期容易失控。两条路好像都走不通。

论文作者的思路是,别在这两条老路上纠结了,换个地方下手:既然模型"看问题的方式"没人管,那就专门给它加一道约束,同时把回答层面的约束彻底松开。

Query-KL:给模型的"世界观"上一道保险

论文提出的核心方法叫ERPO,全称是环境正则化策略优化。

环境正则化策略优化*:一种训练方法,通过约束模型对训练问题分布的理解方式,而不是约束模型的回答方式,来控制训练过程的稳定性。

要理解ERPO,得先弄明白一个新概念:模型诱导的查询分布。

简单说,一个语言模型不仅会生成回答,它本身也能给任何一段文字(包括问题本身)打一个"概率分数",也就是这段文字在模型看来有多"像"它会自然生成的内容。随着训练进行,模型参数在变化,它给同一批训练题目打出的概率分数也会跟着变化。这个概率分数的整体分布,就是"模型诱导的查询分布",简写为ρθ。

查询分布*:模型根据自己当前的参数,给训练集里每一道题目赋予的"自然程度"概率,这个分布会随着模型训练不断变化,即便题目本身没有变。

这里有个容易搞混的地方需要拎清楚:训练集里题目出现的顺序和频率(论文里叫ρtrain)是固定不变的,出题人没有换题库。但模型自己对这些题目的"理解方式"、"熟悉程度"却在偷偷变化。就像同一本习题册摆在那里没动过,但学生刷了几百遍之后,看待每道题的感觉已经完全不一样了,有些题目他觉得越来越"熟悉"(哪怕做错),有些题目他反而觉得越来越"陌生"。

ERPO的做法是,专门算一个叫Query-KL(简称QKL)的指标,衡量当前模型的查询分布和训练最初(强化学习开始之前)的查询分布之间差了多少,然后把这个差异当作惩罚项加进损失函数里。

这样一来,模型如果想要"看待问题的方式"偏离原始状态太远,就要付出代价,但这个约束完全不碰模型生成答案的自由度。

论文里有一个数学证明(Proposition 1),专门证明了这件事:Query-KL的梯度只通过问题的对数似然传递,而策略梯度估计器用到的"回答得分函数"完全不出现在Query-KL的计算里。换句话说,这个约束在数学结构上就和回答生成过程是解耦的,不会给探索空间带来任何直接压力。

这就好比给汽车装了两套完全独立的刹车系统。一套管发动机转速(对应回答的自由度,完全不动),另一套专门监控导航系统有没有把目的地悄悄改了(对应问题理解方式)。以前的做法相当于只装了发动机刹车,指望靠控制车速来防止开错路,结果车速控制得再好,导航系统偏了照样开到错误的地方。ERPO则是新装了一套导航监控,让发动机刹车彻底松开,车可以开得更快,但导航系统一旦想要偏离原定路线,就会被立刻纠正。

图2画出了整个架构:策略模型和参考模型分别对同一个问题算出概率,两者之间算出一个Query-KL去约束"环境漂移";同时策略模型正常采样一组回答,走标准GRPO的打分流程;最后在计算优势值的时候,用一个基于参考模型的权重,对不同问题的贡献做加权。

给"熟悉的题目"更多话语权

ERPO还有第二个组件,叫查询重加权,这个设计的动机和Query-KL紧密相关但角度不同。

标准强化学习目标是在训练集的问题分布上,最大化模型回答获得的期望奖励。ERPO则想让训练目标更贴近参考模型(也就是强化学习开始之前那个版本)眼里"典型"的问题,而不是完全照搬训练集里题目原本的出现频率。

数学上,这需要给每个问题乘一个重要性权重,理想情况下这个权重等于参考模型看待这个问题的概率,除以训练集里这个问题实际出现的概率。如果训练集里题目大致均匀采样,这个权重就正比于参考模型给这道题打的概率分数。

论文没有直接用原始的概率分数当权重,而是做了一步处理:先算出每道题在参考模型下的负对数似然,再取这个值相对于数据集平均值的比例作为权重的雏形,最后把权重限制在0到2之间,防止某道题的权重过大导致训练被少数样本主导。

为什么要专门给"参考模型觉得熟悉"的题目更多权重?论文里给出了一个关键的相关性分析(附录D,对应正文图9):他们发现,一道题目本身的"陌生程度"(问题的负对数似然)和模型对这道题给出的回答"陌生程度"之间存在很强的正相关,在95%的训练样本里相关系数接近1。

这意味着,那些模型觉得"奇怪"的问题,往往也会诱导出模型觉得"奇怪"的回答,而这些低概率回答一旦被强化学习当成正样本反复训练,就会拉高整体的输出熵,也就是让模型的行为变得更加不确定、更容易发散。

这就像一个老师批改作文,如果某个学生写了一篇用词生僻、语法怪异的文章,碰巧被判了高分,老师如果一直拿这篇文章当范文反复讲评,全班同学慢慢都会学着写这种怪腔怪调的句子,全班的写作水平反而会变得不稳定。如果不给这类"意外高分"的样本降权,训练信号里混入的噪声会越滚越大,最终表现为模型输出熵飙升,也就是俗称的训练崩溃。查询重加权本质上就是提前把这类可疑样本的音量调低,让训练更多依赖那些参考模型本来就熟悉、稳定的题目。

ERPO到底管用吗:六个数学榜单的实测结果

方法讲完了,接下来看效果到底怎么样。

研究团队用MATH数据集里难度3到5级的题目,大约8500道,作为训练集,分别用GRPO和ERPO训练Qwen2.5-Math-7B和Qwen2.5-32B模型,然后在六个数学推理榜单上测试:AIME2024、AIME2025、AMC、MATH500、Minerva和OlympiadBench。

这里有个很关键的细节,之前很多论文测试强化学习效果的时候,采样温度(控制模型生成随机性的参数)设置得比较随意,甚至根本没交代清楚。研究团队发现,采样温度对最终表现影响巨大,而且这个影响会随着训练轮数增加变得更严重。于是他们干脆把0.1到1.5的温度区间全部测一遍,取平均值作为最终指标,这样测出来的结果才有说服力。

结果是这样的:

在Avg@32这个指标(32次采样的平均准确率)上,ERPO相比GRPO平均提升了6.2%,某些榜单上提升幅度高达14.9%。具体到每个榜单,AIME2024上GRPO是17.4分,ERPO是21.8分;MATH500上GRPO是52.8分,ERPO直接冲到67.7分,这是个相当夸张的跃升。

在Pass@32(32次采样里只要有一次答对就算过)和Pass@1(单次采样就要答对)两个指标上,ERPO同样全面超过GRPO,分别提升了3.64%和5.69%。

更值得注意的是训练动态的差异。研究者专门跟踪了训练集上的采样准确率,以及模型和参考模型之间的KL散度变化(图4)。结果显示,两种方法在训练集上的表现差不太多,但GRPO的Query-KL上升速度比Policy-KL快了一个数量级。这说明只约束回答层面,根本没能拦住问题理解层面的漂移,训练集和测试集之间出现了明显的表现落差,这正是奖励破解的典型信号。

论文附录C里专门量化了这个落差:GRPO在训练准确率和推理准确率之间平均差了6.47个百分点,而ERPO把这个差距压到了3.14个百分点,降幅超过一半。尤其在训练到第240步的时候,GRPO的评估准确率从75%左右骤降到58.4%,而训练准确率却还维持在高位,这是一个非常危险的信号,模型看起来学得很好,实际上正在悄悄崩塌。ERPO在同样的训练步数下,评估准确率反而保持在78%左右,没有出现这种断崖式下跌。

长跑测试:谁能撑到最后

短期训练看不出问题,那就拉长赛道。研究团队把训练步数从240步一直加到1000步,专门观察模型长期训练下的表现变化(图5、图6)。

结果显示,GRPO在低温度采样(低于1.0)下大约能稳定到240步(约15个epoch),但过了400步之后,高温度采样下的表现开始明显下滑,随着训练步数继续增加,这种崩溃逐渐扩散到几乎所有温度区间。

ERPO虽然也没能完全免疫这种长期训练带来的崩溃现象(论文原文很坦诚地承认了这一点,表现为熵值突然飙升、采样能力丧失),但整体的性能衰退幅度明显更小,而且在高温度区间的表现甚至有所提升。

这就好比两个人跑马拉松,起跑阶段两人速度差不多,但跑到中段,一个人的心率突然失控,配速忽快忽慢,最后几公里彻底掉速;另一个人虽然也会累,配速会有波动,但整体节奏保持得更稳,最终跑完全程的成绩明显更好。如果没有Query-KL这层约束,模型相当于一直在没有心率监控的情况下狂跑,直到某个临界点突然垂直式崩溃,而有了这层约束,至少能提前感知到"心率异常"的信号,把崩溃的烈度压下来。

拆开看每个部件到底谁在起作用

光看整体效果还不够,研究团队做了细致的消融实验,把ERPO拆成两个组件分别测试:只用Query-KL替换Policy-KL、只加查询重加权、两者都加。

结果显示(表2、表3),单独用Query-KL替换Policy-KL,在不改动任何其他超参数的情况下,平均比GRPO提升了15.9%,但这个版本在极高温度(1.2到1.5)下的表现会打折扣,因为它没有查询重加权来控制策略侧的熵增长。

单独加查询重加权(论文里管这个变体叫GRPO*),Policy-KL的数值降到了0.0113,是所有对比方法里最低的,同时熵值也降到0.2782,说明重加权确实能有效抑制策略层面的波动。但如果只有重加权没有Query-KL约束,环境漂移问题依然没被真正管住。

两者结合起来的完整版ERPO,在多次重复实验中(表3里的Avg@3),Query-KL被压到0.0828,Policy-KL是0.0728,熵值是0.4244,是一个相对均衡的状态,既没有让环境漂移失控,也没有让策略侧的探索空间被过度压缩。

这解释了为什么论文的标题强调"超越"稳定性-探索的两难,而不是"在两者之间找平衡"。传统做法是拿Policy-KL这一个杠杆同时兼顾两件事,天然会顾此失彼;ERPO相当于多引入了一个独立的调节杠杆,把原本捆在一起的两个目标拆开单独调,各自都能调得更精确。

论文还测试了正则化强度系数α的影响,默认值是0.01,他们额外试了0.005和0.05,发现加大约束强度(0.05)能进一步提升整体表现,尤其在高温度区间提升更明显(表2)。但研究者坦诚说明,他们并没有对α做系统性的网格搜索,保留默认值主要是为了实验对比的公平性,这也是留给未来工作的一个方向。

另外一个有意思的发现是采样数量(rollout count)的影响。把每道题采样的回答数从8个增加到16个,Qwen-7B模型在ERPO下的平均Pass@1提升到了74.6%,而且高温度区间的稳定性也显著提升,同时没有明显加剧对参考模型的偏离。这说明增加采样数量和ERPO的机制是互补的,采样越充分,模型越容易学到正确的推理格式。论文里特别提到一个细节:在多次实验里,GRPO方法始终没能稳定学会论文要求的输出格式(把推理过程包在think标签里,最终答案放进boxed),所以论文所有实验只报告最终答案的准确率,这也侧面反映了GRPO训练不稳定带来的实际后果。

换个算法试试:普适性验证

ERPO的设计思路并不是绑死在GRPO上的,研究团队还把这个思路套到了另外两个强化学习算法上:DAPO和RLOO。

DAPO*:一种开源的大语言模型强化学习训练系统,是GRPO的一种变体优化方案。

RLOO*:一种重新审视经典REINFORCE算法思路、用于从人类反馈中学习的强化学习方法。

结果(表6)显示,DAPO加上ERPO之后,在低于1.0的温度区间平均提升了10.24个百分点;RLOO加上ERPO之后,提升了2.28个百分点。而在Qwen-32B这个更大规模的模型上,ERPO同样带来了2.98个百分点的提升,并且在1.2到1.5的高温度区间,准确率从57.2%跃升到82.8%,涨幅超过25个百分点,这是所有实验结果里最夸张的一组数字。

这说明Query-KL这个思路不是针对某个特定算法的补丁,而是一种可以插到各种策略梯度类算法上的通用组件,论文里也强调了这一点:只要一个算法遵循策略梯度的基本框架(不管是GRPO的分组相对优势、PPO的裁剪比例,还是REINFORCE的基线减法),ERPO的两个组件都可以无缝嵌入,不需要额外的前向计算开销,因为参考模型的对数似然可以提前一次性算好并缓存,当前模型的对数似然则可以复用策略梯度估计器本来就要做的前向传播。

写在后面

读完这篇论文,最触动我的其实是那张揭示奖励破解的曲线图(附录C的表5):GRPO训练到第240步的时候,训练准确率还稳稳地保持在76.7%,评估准确率却直接从73.6%摔到58.4%。这种"训练分数完好无损、实际能力已经腐烂"的场景,让我想起了应试教育里那种刷题刷到麻木、题型稍微一变就懵掉的状态,数字上的巧合感有点意外。

更让我意外的是附录D那个相关性分析。模型觉得"陌生"的问题往往诱导出模型觉得"陌生"的回答,这个发现本身其实是常识,但用负对数似然把它量化到95%样本相关系数接近1的程度,是我没想到的精确度。这说明"输入的怪异程度"和"输出的怪异程度"之间存在一种近乎线性的传导关系,而这条传导链条此前几乎没有被单独当作正则化的对象来处理。

论文里还有一个诚实的细节值得记一下:作者明确说他们没有做α系数的网格搜索,也承认ERPO在超长训练下依然会出现崩溃迹象,只是崩得比GRPO慢一点、轻一点。这种不吹全能药的态度,在方法论论文里其实不算常见。

一个没在论文里被回答的问题是:如果查询分布漂移是普遍存在于所有强化学习训练里的现象,那在写作、对话这类没有明确验证器的任务上,"问题理解方式的漂移"又该怎么定义和测量?这篇论文的所有实验都建立在数学题这种有唯一正确答案的场景上,换到开放式任务里,这套思路还成立吗。

Q&A

Q1:ERPO和传统的Policy-KL约束方法相比,核心区别是什么?

A:传统方法用Policy-KL约束模型生成回答的自由度,管的是"怎么答";ERPO用Query-KL约束模型理解问题的方式,管的是"怎么看问题",两者作用在不同层面,且数学上被证明相互独立,所以ERPO在管住问题理解漂移的同时,完全不压缩回答层面的探索空间。

Q2:ERPO在实际训练中会增加多少计算成本?

A:几乎不增加。参考模型对训练题目的对数似然只需要在训练前算一次并缓存下来,当前模型的对数似然则复用策略梯度估计器本来就要做的前向传播,所以ERPO不需要额外的前向计算过程,可以直接插入GRPO、PPO、REINFORCE等现有算法。

Q3:ERPO是否能完全解决强化学习训练中的模型崩溃问题?

A:不能完全解决,论文原文也承认这一点。在超长训练(1000步)下,ERPO依然会出现类似崩溃的现象,表现为熵值突然升高、采样能力下降,但整体崩溃的幅度和速度都明显低于传统GRPO方法,训练与评估之间的表现落差从6.47个百分点降到3.14个百分点。

 

关键词 算法 实验 数学题 正则化


相关文章