一句话总结

这篇论文研究的不是“如何提出一种新的 CoT 蒸馏算法”,而是系统回答:

把大模型的推理过程蒸馏给小模型时,什么样的 CoT 数据最有效?

作者发现,CoT 蒸馏需要考虑三个匹配关系:推理粒度、表达格式和教师模型。最强教师、最长推理、最复杂格式,都不一定最好。论文发表于 ACL 2025 Findings。(ACL Anthology)


1. 什么是 CoT 蒸馏?

普通监督微调只训练:

问题 → 最终答案

CoT 蒸馏则训练:

问题 → 中间推理过程 → 最终答案

例如:

作者主要研究三个变量:

  1. Granularity:推理写得多详细;
  2. Format:推理用什么结构表达;
  3. Teacher:推理过程由谁生成。(arXiv)

实验覆盖 4 个数学数据集、3 个常识推理数据集、4 类教师来源和 7 个学生模型。学生模型包括 BLOOM 560M–3B、Gemma 2B,以及 LLaMA 3.2 1B/3B。(arXiv)


2. 发现一:CoT 不是越详细越好