思考型推理模型
核心概念:Test-Time Scaling——不在训练期堆算力,而在推理期"多想"。o1/R1 范式:模型回答前生成不可见的 reasoning tokens,思考预算越大能力越强,同一权重动态变强。
两大扩展轴
并行扩展:采样 N 条推理路径,多数投票(Self-Consistency)或验证器选优(Best-of-N)
串行扩展:拉长 CoT、树搜索(ToT/MCTS)、过程验证器(PRM)
关键数据
DeepSeek-R1:AIME 15.6%→71%,加多数投票 86.7%;成本比 o1 低 70%
s1:仅 1000 条高质量轨迹 + budget forcing(追加"Wait"强迫继续思考)即可复现部分效果
反直觉发现(ACL 2025):正确解的平均长度反而更短;多数 o1 类模型串行扩展无增益——自我修正成功率 <10%,失败修正率甚至更高
工程要点
reasoning tokens 是可计量资源:占上下文、计费、可限额——须纳入 SLA(最大思考预算/延迟/重试)
计算最优 ≠ 系统最优:并行采样加吞吐压力,长思考拉爆 P99
停止策略最重要:任务分层路由(easy 走 greedy,hard 走多采样),别所有请求默认深入
验证器是推理栈核心资产:优先接确定性工具(单测/符号求解),LLM-as-verifier 不独占裁决
