Don't Overthink it. Preferring Shorter Thinking Chains for Improved LLM Reasoning

Demystifying Long Chain-of-Thought Reasoning in LLMs

Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning

Unveiling the Key Factors for Distilling Chain-of-Thought Reasoning

Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning

对比:

论文 研究阶段 核心问题 核心观点
Demystifying Long CoT 能力形成 长 CoT 是如何产生的? 长推理、自我纠错和回溯能力可由 RL 激发;SFT 主要提供更好的初始化
Unveiling Key Factors for Distilling CoT 能力蒸馏 如何把 CoT 能力传给小模型? 蒸馏效果取决于推理粒度、教师质量和学生能力是否匹配,而非 CoT 越长越好
Don’t Overthink It 候选选择 多条推理中应该选择哪一条? 同一问题下,较短、较早完成的推理往往更可靠,可优先选择短链
Thinking-Optimal Scaling 预算分配 每个问题应该思考多长? 不同问题存在不同的最优推理预算,应追求“最短正确推理”,而非固定长度
Stepwise Penalization 训练优化 如何减少 CoT 内部冗余? 根据每个步骤对正确答案的贡献分配惩罚,压缩无效步骤、保留关键步骤

推理能力需要通过长 CoT 探索和学习,但最终目标不是生成更长的 CoT,而是用更少、更有效的步骤得到正确答案。(减少COT内部冗余)