一句话概括

这篇论文提出 SwAP(Step-wise Adaptive Penalization):不再粗暴地惩罚整条长推理链,而是判断每个推理步骤对正确答案的贡献,重点删除低价值步骤,保留真正推动答案的关键步骤。(arXiv)


1. 它想解决什么问题?

现有推理模型经常出现 Overthinking:

以往基于 RL 的方法通常对整条回答施加长度惩罚:

$R = R_{\text{correct}}-\lambda L$

问题是,这相当于告诉模型:

只要写得长,就要扣分。

但一条长推理中可能同时存在:

统一惩罚容易把两者一起压缩,导致准确率下降。(arXiv)


2. SwAP 的核心思想

SwAP 不问: