跳到主内容
智客 ZICQ

智客百科 AI 概念

推理模型(Reasoning Model)

AI 概念
别名: 推理大模型 o1 o3 ·2026-09-14

推理模型(Reasoning Model)

推理模型是专门针对"慢思考"任务优化的大模型:在给出最终答案前,会先生成 大量"思考 token"(chain-of-thought),把内部推理过程摊开来。代表:OpenAI o1 / o3、 DeepSeek-R1、Claude with extended thinking。

与传统 LLM 的区别

维度 传统 LLM 推理模型
响应 直接给答案 先思考再给答案
思考 隐式(参数内) 显式(输出 token)
延迟 低 高(5-10x)
适用 写作、对话、抽取 数学、代码、规划、逻辑

什么时候用

  • 数学/科学问题:MATH、AIME、GPQA。
  • 复杂代码生成:Codeforces、LeetCode Hard。
  • 多步规划:研究分析、战略制定。
  • 调试:理解复杂 bug。

什么时候不用

  • 简单问答、对话、写作 —— 传统模型快 10 倍还便宜。
  • 实时性要求高的场景 —— 思考时间不可控。

原理(推测)

业界普遍认为推理模型基于 RL 在"长 chain-of-thought + 正确答案"上训练。 OpenAI 没有公开细节,DeepSeek 公开了 R1 的训练流程。