一句话总结

论文提出 TOPS(Thinking-Optimal Scaling):

不让模型一味延长 CoT,而是学习针对不同难度的问题,生成“能够答对的最短推理过程”。


1. 研究动机

现有 Test-Time Scaling 通常认为:

推理 Token 越多,模型思考越充分,准确率越高。

但论文发现,这一规律并不总成立:

因此,Test-Time Scaling 的目标不应是“尽可能多思考”,而应是“分配恰当的思考量”。


2. 为什么过长 CoT 可能有害?

作者分析不同长度的推理过程后发现:

因此,过度思考不仅浪费 Token,还可能引入新的计算错误,使原本正确的方向被推翻。