概念更新于 2026-06-21 · 版本 1.0

什么是推理模型?

推理模型是经过训练的语言模型,在回答前会消耗额外的计算资源进行“思考”——生成内部推理步骤以解决数学、代码和逻辑方面的更难问题。它们在复杂的多步任务中以延迟和成本换取准确性。其核心思想是测试时计算(test-time compute):让模型在推理时进行更长时间 of 推理,而不仅仅是把模型做大,这可以显著改善结果。

证据: 基准测试置信度: 来源: 基准测试来源: 论文

定义

推理模型是经过优化的语言模型,旨在推理阶段执行扩展的分步推理——利用额外的测试时计算(test-time compute)——以提高解决复杂、多步问题的准确性。

核心要点

  • 它们在回答前进行“思考”,使用额外的推理计算资源。
  • 测试时计算(test-time compute)是超越模型尺寸的新扩展维度。
  • 最适合数学、代码、逻辑和多步规划。
  • 它们以延迟 and Token 成本换取准确性。
  • 对于简单任务来说是大材小用——应使模型与问题相匹配。

背景

标准模型无论问题难易,回答时间大致恒定。推理模型打破了这一常规:它们生成内部推理链,实际上在更难的问题上投入更多计算资源,从而提升了在需要多步推导的任务上的表现。

这引入了第二个扩展维度。除了将模型做大(训练时计算)之外,您还可以让它们在推理时进行更长时间的推理(测试时计算)——这是近期在困难基准测试上取得进展的主要驱动力。

架构

推理模型通常经过训练,在给出最终答案之前产生冗长的内部推理,这通常通过奖励正确结果的强化学习(RL)进行巩固。在推理时,更多的“思考”Token 通常意味着在困难问题上能获得更好的答案。

在智能体系统中,推理模型充当强大的规划者和决策者,而更便宜、更快速的模型则可以处理常规步骤。根据任务难度在它们之间进行路由是一种常见的成本控制模式。

组件

扩展推理(思考 Token)测试时计算预算基于强化学习(RL)的推理训练最终答案提取

优势

  • 在复杂、多步问题上具有更高的准确性。
  • 擅长数学、编程和规划。
  • 推理工作量可以根据每个查询进行扩展。
  • 作为高能力智能体核心的优秀规划者。

风险

  • 更高的延迟和 Token 成本。
  • 对于简单任务来说是大材小用,且造成浪费。
  • 较长的推理并不总是更正确。
  • 内部推理可能难以审计,也难以逐字信任。

工具与技术

来自主要供应商的推理模型层级可调节的推理力度设置按任务难度进行模型路由评估套件

示例

  • 解决让标准模型感到棘手的多步骤数学或逻辑问题。
  • 在执行前规划复杂的智能体任务。
  • 仅将困难的工单路由到推理模型以控制成本。

常见问题解答

推理模型与标准 LLM 有何不同?
它们经过训练和配置,可以在回答前进行长时间的推理,在困难问题上消耗更多的推理算力,而不是在几乎恒定的时间内做出回复。
什么是测试时算力?
在推理阶段消耗的计算资源(模型“思考”更长时间),与用于构建模型的训练时算力相对。这是提升效果的一种独特方式。
我应该一直使用推理模型吗?
不应该。它们的成本更高且会增加延迟。请将它们用于复杂的、多步骤的问题,并将更简单的任务路由到更快、更便宜的模型。
它们能消除幻觉吗?
不能。推理提高了许多任务的准确性,但并不能保证正确性;事实依据(grounding)、工具和评估仍然是必不可少的。

参考文献