这篇论文提出 SwAP(Step-wise Adaptive Penalization):不再粗暴地惩罚整条长推理链,而是判断每个推理步骤对正确答案的贡献,重点删除低价值步骤,保留真正推动答案的关键步骤。(arXiv)
现有推理模型经常出现 Overthinking:
以往基于 RL 的方法通常对整条回答施加长度惩罚:
$R = R_{\text{correct}}-\lambda L$
问题是,这相当于告诉模型:
只要写得长,就要扣分。
但一条长推理中可能同时存在:
统一惩罚容易把两者一起压缩,导致准确率下降。(arXiv)
SwAP 不问: