ICLR 2025

关键词:Recursive Transformer / Parameter Sharing / Layer-wise LoRA / Model Compression / Early Exit


1. TL;DR

这篇论文研究:

能不能把一个已经训练好的大 Transformer,通过 Layer Sharing 压缩成更小的模型,同时尽量保留原模型能力?

核心方法:

原始 Transformer
      ↓
Layer Sharing
      ↓
Recursive Transformer
      ↓
性能下降
      ↓
加入 Layer-wise LoRA
      ↓
Relaxed Recursive Transformer
      ↓
Knowledge Distillation / Uptraining
      ↓
恢复原模型能力

核心思想:

大部分参数共享,少量 Layer-specific LoRA 保留不同深度的 specialization。

同时利用 Recursive Structure 支持:

Early Exit + Depth-wise Batching


2. 为什么需要 Recursive Transformer?

假设原模型有 18 个 Layer:

L1 → L2 → L3 → ... → L18

每个 Layer 都有独立参数,因此参数量较大。

作者把它改成:

L1 → L2 → ... → L9
             ↓
L1 → L2 → ... → L9

第二次循环使用的是同一套参数。

因此: