论文系统研究了 Long CoT 如何通过 SFT 与强化学习产生。核心结论是:
长推理能力并不等于输出更多 Token,而依赖于合适的初始化、奖励设计、可验证数据和训练计算量。
论文主要回答四个问题:
Long CoT 是否必须依赖 SFT? Long CoT 可以由纯 RL 涌现,但 SFT 能让这种涌现更稳定、更高效。
如何稳定地增加推理长度?关键是使用基于正确性的长度奖励塑形,而不是直接奖励“输出越长越好”。
稳定方案:Cosine Reward + 重复惩罚 + 足够的 RL 训练量。
Cosine Reward
答案正确:推理越短,奖励越高;
答案错误:短推理惩罚更重,长推理惩罚更轻;
促使模型“有把握就停止,没把握就继续探索”。
这种设计能避免推理长度突然增长到上下文上限。(arXiv)
加入 N-gram 重复惩罚
防止模型通过重复句子虚假增加长度。最好在重复 Token 出现的位置直接施加惩罚,而不是只在整条轨迹结束后惩罚。(arXiv)
同步增加训练计算量
更长的上下文窗口不代表模型会自动利用它;论文中相同训练量下,16K 甚至不如 8K,需要更多样本和训练步数。(arXiv)
相比短 CoT,使用长 CoT 数据进行 SFT:
不过,SFT 并非产生 Long CoT 的必要条件,它主要用于降低 RL 难度、提高训练效率。高质量的自然长 CoT 数据也明显优于人工拼接的固定推理模板。