AIGC

行业资讯

AIGC模式解析(11)

  • 发布时间
  • 点击次数

思考型推理模型

核心概念:Test-Time Scaling——不在训练期堆算力,而在推理期"多想"。o1/R1 范式:模型回答前生成不可见的 reasoning tokens,思考预算越大能力越强,同一权重动态变强。

两大扩展轴

  • 并行扩展:采样 N 条推理路径,多数投票(Self-Consistency)或验证器选优(Best-of-N)

  • 串行扩展:拉长 CoT、树搜索(ToT/MCTS)、过程验证器(PRM)

关键数据

  • DeepSeek-R1:AIME 15.6%→71%,加多数投票 86.7%;成本比 o1 低 70%

  • s1:仅 1000 条高质量轨迹 + budget forcing(追加"Wait"强迫继续思考)即可复现部分效果

  • 反直觉发现(ACL 2025):正确解的平均长度反而更短;多数 o1 类模型串行扩展无增益——自我修正成功率 <10%,失败修正率甚至更高

工程要点

  • reasoning tokens 是可计量资源:占上下文、计费、可限额——须纳入 SLA(最大思考预算/延迟/重试)

  • 计算最优 ≠ 系统最优:并行采样加吞吐压力,长思考拉爆 P99

  • 停止策略最重要:任务分层路由(easy 走 greedy,hard 走多采样),别所有请求默认深入

  • 验证器是推理栈核心资产:优先接确定性工具(单测/符号求解),LLM-as-verifier 不独占裁决


JK小助手
转人工 ×