行业对大模型的注意力,正从"训练时堆参数"悄悄转向"推理时多思考"。所谓推理时计算(test-time compute),就是让模型在回答前花更多算力去搜索、验证、自我反驳,而不是一口吐出答案。我们认为这是继 Scaling Law 之后最值得关注的一次范式迁移。
为什么"想更久"有效
很多复杂问题(数学证明、代码调试、多步规划)的难点不在"知识不够",而在"推理链条容易断"。给模型更多推理预算,让它尝试多条路径、交叉验证,正确率会明显上升——这一点在多个数学和竞赛基准上已经被反复验证。
本质上,这是用"时间换准确率"。一条路不对就换一条,比一次性押注更稳。对人类来说这很像"慢思考",对模型来说则是把算力从训练平移到了推理。
代价也很真实
代价首先是成本和延迟。推理时计算意味着每次回答都要消耗更多 token、更长时间。一个简单的问答被拖成几十秒,对实时场景(客服、对话)是体验灾难。所以这类能力往往只配给"值得慢"的任务。
其次是"过度思考"风险:模型可能陷入无意义的自我循环,越想越偏,既费钱又出错。如何让模型"该想则想、该停则停",是工程上没完全解决的问题。
对产品和选型的启示
给应用开发者的建议:把"推理预算"当成一个可调旋钮。简单任务关掉深度思考省钱,复杂任务才打开。一味追求"最强推理"会让你的账单和延迟一起爆炸。
对模型厂商,这条路线降低了"靠堆参数碾压对手"的确定性——中小团队也能通过推理策略在特定任务上追上大厂。竞争维度变多了,是好事。
参考来源
免责声明:本文基于公开技术资料与第三方观察整理,test-time compute 仍处快速演进期,具体能力与成本以各家最新版本为准。