推理模型(Reasoning Model)
推理模型是专门针对"慢思考"任务优化的大模型:在给出最终答案前,会先生成 大量"思考 token"(chain-of-thought),把内部推理过程摊开来。代表:OpenAI o1 / o3、 DeepSeek-R1、Claude with extended thinking。
与传统 LLM 的区别
| 维度 | 传统 LLM | 推理模型 |
|---|---|---|
| 响应 | 直接给答案 | 先思考再给答案 |
| 思考 | 隐式(参数内) | 显式(输出 token) |
| 延迟 | 低 | 高(5-10x) |
| 适用 | 写作、对话、抽取 | 数学、代码、规划、逻辑 |
什么时候用
- 数学/科学问题:MATH、AIME、GPQA。
- 复杂代码生成:Codeforces、LeetCode Hard。
- 多步规划:研究分析、战略制定。
- 调试:理解复杂 bug。
什么时候不用
- 简单问答、对话、写作 —— 传统模型快 10 倍还便宜。
- 实时性要求高的场景 —— 思考时间不可控。
原理(推测)
业界普遍认为推理模型基于 RL 在"长 chain-of-thought + 正确答案"上训练。 OpenAI 没有公开细节,DeepSeek 公开了 R1 的训练流程。