测试时计算(Test-Time Compute,也称 Inference-Time Compute)是 2024-2026 年 AI 研究的核心范式转变——不再仅靠更大的训练来提升模型,而是让模型在回答时「多想一会」。
传统范式 vs 新范式
- 传统:训练时用更多 GPU、更多数据 → 推理时快速一次前向传播出结果
- 新范式:训练可以相对节省 → 推理时多步思考、多次采样、自我验证,「用计算换质量」
关键技术
- 思维链(Chain of Thought):模型写出推理步骤,增加 token 消耗换取更高准确率
- 多数投票(Majority Voting):同一问题跑多次,取最常见答案
- 树搜索(Tree Search):探索多条推理路径,选最优
- 自我反思(Self-Reflection):模型检查自己的答案并修正
经济影响
推理模型的 Hidden Reasoning Tokens(隐藏推理 token)用户看不到但需付费,成本可能是标准响应的 5-20 倍。这改变了 AI API 的定价模型——不再只看输入/输出 token,「思考深度」成为新的成本维度。
代表产品
OpenAI o1/o3、DeepSeek-R1、Claude Extended Thinking、Gemini Deep Think。