论文提出 TOPS(Thinking-Optimal Scaling):
不让模型一味延长 CoT,而是学习针对不同难度的问题,生成“能够答对的最短推理过程”。
现有 Test-Time Scaling 通常认为:
推理 Token 越多,模型思考越充分,准确率越高。
但论文发现,这一规律并不总成立:
因此,Test-Time Scaling 的目标不应是“尽可能多思考”,而应是“分配恰当的思考量”。
作者分析不同长度的推理过程后发现:
因此,过度思考不仅浪费 Token,还可能引入新的计算错误,使原本正确的方向被推翻。