过去一年,大模型在数学推理和编程任务上的进步,已经不只是“回答得更像人”。更明显的变化是:模型开始投入更多计算去拆解问题、检查中间过程,并在必要时借助代码执行或其他工具完成验证。2025年至2026年的讨论因此逐渐从“模型会不会解题”,转向“它能否稳定地解决、验证并解释复杂问题”。

数学能力的提升,关键不在于“记住更多答案”
GSM8K、MATH这类基准测试,分别覆盖了不同难度层次的数学文字题、代数推理和多步骤问题。模型在这类任务上的表现,通常不只取决于参数规模,还取决于它是否能够把问题转化为连续、可检查的推理步骤。
早期语言模型经常在简单计算中出错,或者能够给出正确结果,却无法保持过程的一致性。推理模型的变化在于,它们会为复杂问题分配更多测试时计算,通过分解条件、尝试不同路径、回看中间结论来降低一次性生成错误答案的概率。这种方法并不意味着模型真正“理解”了数学,也不能保证每个推理步骤都正确,但它确实改善了长链任务中的整体成功率。
从公开资料来看,2025年的模型进展已经将数学推理能力延伸到科研辅助场景。OpenAI在介绍GPT-5.2时,将数学推理与模拟、统计、预测、建模、编程和实验设计联系起来,并强调更稳定、更可靠的多步骤推理能力。不过,这类厂商自报结果与公开基准成绩不能直接混为一谈。研究者仍然需要区分测试集、推理预算、是否允许工具调用,以及答案由模型独立生成还是经过外部验证。
GSM8K和MATH成绩应当怎样解读
面对GSM8K或MATH上的高分,至少要问三个问题。
第一,模型是否使用了更长的思考过程。推理预算增加,往往会带来更高的正确率,但也会增加延迟和计算成本。两个模型即使使用同一套参数,允许的思考量不同,结果也可能明显不同。
第二,模型是否调用了计算工具。能够生成代码、运行程序并根据结果修正答案,与完全依靠语言模型内部计算,是两种不同的能力。工具调用可以降低算术错误,却不能自动解决建模错误、条件遗漏或错误理解题意的问题。
第三,评测是否存在数据污染或题型记忆。公开题库被广泛使用后,训练数据与测试数据之间可能出现重叠。对于高级模型,更有区分度的评测应当包含新题、变式题和跨领域问题,而不能只看一个熟悉基准上的单点成绩。
因此,GSM8K和MATH仍然有价值,但更适合用来观察模型在结构化数学问题上的进步,不宜直接当作通用科学推理能力的完整证明。
强化学习正在改变推理模型的训练方式
这轮能力提升中,最受关注的技术路线之一是可验证奖励强化学习,也就是通常所说的 RLVR。它特别适合数学和代码任务,因为这两类问题往往存在可以自动检查的结果:数学题可以核对最终答案或部分约束,程序则可以通过测试用例、编译结果和执行行为进行验证。
与只依赖人工偏好不同,RLVR可以让模型反复尝试解决问题,再根据可验证结果调整策略。模型不仅学习“什么表达方式更像标准答案”,还可能逐渐形成更有效的问题拆解、回溯和自检习惯。中国工业互联网研究院发布的相关报告也将可验证奖励强化与DeepSeek-R1等思维链强化模型联系起来,指出工程规则、物理约束和设计规范可以被纳入奖励与验证机制。
这条路线的局限同样明显。验证器只能奖励它能够检查的目标。如果奖励函数只关注最终数值,模型可能忽略推导过程;如果代码评测只覆盖有限测试用例,模型可能针对测试条件“投机取巧”。换句话说,强化学习把模型推向目标的同时,也会放大目标设计中的缺陷。
这也是为什么“模型会推理”不能简单等价于“模型的内部思考过程可信”。研究者需要同时评估最终答案、过程有效性、验证覆盖范围,以及模型在题目稍作改写后的稳定程度。
思维链让模型更有机会处理长问题,但不是可靠性证明
思维链(CoT)通常指让模型显式或隐式地展开中间推理。它的实际作用,首先是把一个复杂任务拆成多个局部任务,使模型不必在单次输出中直接跳到结论。
在数学问题中,思维链可以帮助模型先提取变量和条件,再建立方程,最后检查结果。在编程任务中,它可以先分析需求和边界情况,再设计算法,最后生成实现。对于需要多轮判断的任务,这种顺序通常比直接给出答案更有利。
但思维链文本本身并不等于模型真实的决策机制。模型可能生成一段看似严密的解释,却在某一步使用了错误前提;也可能先得到答案,再补写一套听起来合理的过程。更长的思维链还会带来新的风险:错误可能在多个步骤中累积,冗长表达也会掩盖真正的关键假设。
较稳妥的评估方式,是把思维链与独立验证结合起来。数学推导需要检查约束和计算结果,代码则需要执行测试、审查边界条件,并确认生成的程序确实解决了原始问题,而不是只解释了问题。
编程竞赛能力正在从“写代码”走向“搜索解法空间”
Codeforces等编程竞赛测试,对模型提出的要求与普通代码生成不同。模型不仅要理解题意,还要选择合适的算法,分析复杂度,处理边界情况,并在实现后根据反馈修正错误。
过去的代码模型往往擅长补全常见模板,却容易在算法选择上失误。例如,它可能写出语法正确的程序,但忽略数据规模带来的时间或内存问题。推理模型的改进,则更多体现在先分析约束,再比较候选思路,并通过小规模样例或程序执行来验证方案。
这类能力提升与强化学习、思维链和工具调用形成了组合关系。强化学习为“通过结果反馈改进解法”提供训练机制;思维链帮助模型拆解题目和规划算法;代码执行工具则把抽象判断变成可观察的编译与运行反馈。三者结合后,模型解决竞赛题的过程更接近一个反复搜索和验证的程序,而不是一次性生成代码。
不过,Codeforces成绩也不能直接代表工程编程能力。竞赛题通常有清晰输入输出和明确正确性标准,而真实项目还包括遗留代码、需求变更、团队约定、部署环境、权限边界和长期维护。一个模型能够通过竞赛测试,说明它在特定形式化任务上具有较强能力,并不意味着它能独立承担完整的软件工程责任。

工具调用提高了可验证性,也引入了新的失败路径
工具调用是推理系统的重要补充。对于数学任务,工具可以承担精确计算、符号处理或数值验证;对于编程任务,工具可以完成编译、运行测试、检查依赖和定位报错。模型负责提出假设和安排步骤,工具负责提供外部反馈,两者之间形成循环。
这种方式的价值不只是“算得更快”。当模型能够看到执行结果时,它可以根据错误信息重新定位问题,而不是继续用自然语言掩盖不确定性。对高级工程师而言,真正值得观察的指标也因此不应只有最终通过率,还包括平均尝试次数、无效调用比例、错误恢复能力和验证过程的可复现性。
工具并非万能。模型可能调用错误的工具、构造不完整的输入,或者错误解读工具返回的信息。在代码执行环境中,还要考虑依赖版本、权限、资源限制和数据安全。一个推理链条即使在局部上正确,只要工具接口设计不清晰,整个任务仍可能失败。
当前能力的边界:长板更长,稳定性仍不足
2025年至2026年的资料普遍把推理、编程和Agent能力视为模型进步较快的方向,但同时也指出,模型的能力呈现明显的“长短板”结构。数学和代码这类形式化任务有标准答案或可执行验证,因此更适合通过强化学习持续优化;真实世界问题则常常缺少完整信息、明确目标和可靠反馈。
模型目前仍可能在以下情形中失效:题目中的隐含条件发生变化,多个约束之间存在冲突,需要调用外部事实,或者问题本身没有唯一答案。它也可能在简单任务上表现稳定,在稍微改变措辞或数据分布后突然退化。对于长链任务,前面一个看似细小的误判,可能在后续步骤中被不断放大。
研究者还应警惕“看起来会解释”与“确实能验证”之间的差距。模型生成的过程越流畅,越容易让人忽略关键假设。尤其在数学、工程和安全相关场景中,最终输出必须经过独立检查,不能因为推理过程完整就跳过验证。
评估新模型,不能只看一个榜单数字
如果要比较2025年至2026年的模型,较完整的评测应当同时覆盖能力、成本和稳定性。GSM8K、MATH可以观察结构化数学推理,Codeforces可以观察算法编程,但还需要加入未见过的题目、扰动后的题目和不同难度的长链任务。
对工程部署而言,以下维度往往比单一最高分更有参考意义:
- 在不同推理预算下的正确率和响应延迟;
- 不使用工具、允许工具调用、工具调用失败时的表现差异;
- 对题目改写、数据变化和边界条件的敏感程度;
- 最终答案正确时,推导或代码是否能够被独立验证;
- 多次重复运行时的结果稳定性;
- 解决问题所需的计算资源与人工复核成本。
这样的评估方式,才能区分“偶尔解出难题”和“在约束条件下稳定完成任务”。对于AI研究者,它有助于判断改进来自模型本身、推理预算还是外部工具;对于高级工程师,它则直接关系到系统是否值得接入真实工作流。
大模型在数学和编程上的进展是真实的,尤其体现在多步骤规划、可验证奖励和工具辅助推理的结合上。但这更像是推理系统工程化程度的提升,而不是模型已经获得了普遍可靠的逻辑能力。接下来真正重要的问题,不只是基准分数还能提高多少,而是模型能否在新问题、错误反馈和不完整信息下保持可解释、可验证、可恢复。