这篇论文研究的不是“如何提出一种新的 CoT 蒸馏算法”,而是系统回答:
把大模型的推理过程蒸馏给小模型时,什么样的 CoT 数据最有效?
作者发现,CoT 蒸馏需要考虑三个匹配关系:推理粒度、表达格式和教师模型。最强教师、最长推理、最复杂格式,都不一定最好。论文发表于 ACL 2025 Findings。(ACL Anthology)
普通监督微调只训练:
问题 → 最终答案
CoT 蒸馏则训练:
问题 → 中间推理过程 → 最终答案
例如:
答案是 24先计算每组数量,再乘以组数,因此答案是 24作者主要研究三个变量:
实验覆盖 4 个数学数据集、3 个常识推理数据集、4 类教师来源和 7 个学生模型。学生模型包括 BLOOM 560M–3B、Gemma 2B,以及 LLaMA 3.2 1B/3B。(arXiv)