一句话总结

论文系统研究了 Long CoT 如何通过 SFT 与强化学习产生。核心结论是:

长推理能力并不等于输出更多 Token,而依赖于合适的初始化、奖励设计、可验证数据和训练计算量。


1. 研究问题

论文主要回答四个问题:

  1. Cosine Reward

  2. 加入 N-gram 重复惩罚

    防止模型通过重复句子虚假增加长度。最好在重复 Token 出现的位置直接施加惩罚,而不是只在整条轨迹结束后惩罚。(arXiv)

  3. 同步增加训练计算量

    更长的上下文窗口不代表模型会自动利用它;论文中相同训练量下,16K 甚至不如 8K,需要更多样本和训练步数。(arXiv)


2. Long CoT SFT

相比短 CoT,使用长 CoT 数据进行 SFT:

不过,SFT 并非产生 Long CoT 的必要条件,它主要用于降低 RL 难度、提高训练效率。高质量的自然长 CoT 数据也明显优于人工拼接的固定推理模板。