精华简报:控制大语言模型中的推理投入
TL;DR
推理模型已成为大语言模型(LLM)的标配形态。本文系统阐述了推理模型的核心概念、训练方法(可验证奖励强化学习,RLVR)与推理扩展(inference scaling),并重点解释了如何通过“思考标记”(think tokens)和多档“推理投入”(reasoning effort)设置来灵活控制模型的计算消耗与回答质量。新一代模型如GPT-5.6已内置多种投入级别,标志着推理控制从“开/关”走向细粒度调节,为实际应用带来更大的成本与性能权衡空间。
核心观点与技术/商业洞察
1. 推理模型的本质:输出中间推理轨迹,而非人类式“思考”
- 所谓“推理模型”并非真的像人脑一样推理,而是指模型在最终答案之前生成一段逐步推导的中间轨迹(reasoning trace)。
- 这一轨迹用于逐步拆解问题、回溯和自我纠错,是提升复杂任务表现的关键。
2. 训练推理模型:RLVR 是主流配方
- DeepSeek-R1 提出使用可验证奖励强化学习(RLVR),对数学(用符号求解器)和代码(用编译器/单测)等可验证领域提供 0/1 奖励信号。
- 关键发现:仅基于最终答案的奖励就足以让模型学会生成推理轨迹,出现“啊哈时刻”(模型自主发现并纠正错误)。
- 推理轨迹本身并不直接参与模型权重更新;是否将中间过程纳入训练(如过程奖励模型)仍是活跃研究方向。
- DeepSeek-R1-Zero 证明纯 RLVR(无监督微调)即可触发推理行为,但完整流程通常需要多阶段训练。
- 如今大多数 LLM 实质上已是推理模型(使用类似 RLVR 方法训练)。
3. 推理扩展:训练之外的性能提升杠杆
- 训练扩展(training scaling):通过 RLVR 等训练手段提升模型能力。
- 推理扩展(inference scaling):在推理时投入更多计算量来换取更好答案。
- 推理模型天然输出更多 token,本身就是一种隐式推理扩展。
- 自洽性(self-consistency,多次采样+多数投票)是常用扩展技术,可叠加在推理模型上(如 DeepSeekMath-V2 达到竞赛级数学性能)。
4. 思考标记(think tokens)的真相:格式装饰,而非能力来源
thinking和response等分隔符不会增强推理能力,去掉它们训练同样能达到相近性能。- 它们的作用仅是标记推理轨迹起止,便于训练流程和用户界面(如 ChatGPT)隐藏中间过程。
- 这些标记通过 RLVR 阶段额外添加的“格式奖励”被引导出来,例如总奖励 = 准确率奖励 + 格式奖励。
5. 推理投入控制:从固定模式到多档调节
- 第一代推理模型(如 DeepSeek-R1)是专用推理模型:无论简单还是复杂提示,都输出冗长轨迹,且无法关闭推理模式,导致高延迟和 token 浪费。
- 新一代模型(如 Qwen3、GPT-5.6)采用混合/可调模式:同一模型可设置多档推理投入(GPT-5.6 有约 5–6 档),让用户在速度、成本和准确率之间灵活权衡。
- 这种设计意味着推理计算成为可配置资源,而非固定开销,是工程实践上的重要进步。
行业启发与影响
- 推理模型成为行业标准:新发布的模型普遍内置推理能力,“纯传统 LLM”已少见;开发者需要适应这一默认行为。
- 成本与延迟的可控性:多档推理投入使企业能按场景选择合适档位——简单任务用低投入、关键任务用高投入,从而优化推理成本和用户体验。
- 开源生态加速了技术扩散:DeepSeek-R1 等开源项目公开 RLVR 细节,使得小型团队也能训练推理模型,推动行业整体水位上升。
- 思考标记标准化:
<thinking>/<response>等格式可能成为事实标准,UI 层可统一隐藏/展示推理过程,提升交互一致性。 - 推理扩展技术走向实用:自洽性等推理扩展手段可作为“即插即用”的增强器,与模型训练互补,未来可能演变为按需调用的 API 功能。
- 训练与推理的界限模糊:推理投入控制表明,模型能力不仅取决于训练时投入,还取决于推理时预算;这改变了“一次训练、固定性能”的传统认知,为 AI 服务按需计费提供新的产品维度。