Don't Overthink it. Preferring Shorter Thinking Chains for Improved LLM Reasoning
Demystifying Long Chain-of-Thought Reasoning in LLMs
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
Unveiling the Key Factors for Distilling Chain-of-Thought Reasoning
Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning
对比:
| 论文 | 研究阶段 | 核心问题 | 核心观点 |
|---|---|---|---|
| Demystifying Long CoT | 能力形成 | 长 CoT 是如何产生的? | 长推理、自我纠错和回溯能力可由 RL 激发;SFT 主要提供更好的初始化 |
| Unveiling Key Factors for Distilling CoT | 能力蒸馏 | 如何把 CoT 能力传给小模型? | 蒸馏效果取决于推理粒度、教师质量和学生能力是否匹配,而非 CoT 越长越好 |
| Don’t Overthink It | 候选选择 | 多条推理中应该选择哪一条? | 同一问题下,较短、较早完成的推理往往更可靠,可优先选择短链 |
| Thinking-Optimal Scaling | 预算分配 | 每个问题应该思考多长? | 不同问题存在不同的最优推理预算,应追求“最短正确推理”,而非固定长度 |
| Stepwise Penalization | 训练优化 | 如何减少 CoT 内部冗余? | 根据每个步骤对正确答案的贡献分配惩罚,压缩无效步骤、保留关键步骤 |
推理能力需要通过长 CoT 探索和学习,但最终目标不是生成更长的 CoT,而是用更少、更有效的步骤得到正确答案。(减少COT内部冗余)