ICLR 2025
关键词:Recursive Transformer / Parameter Sharing / Layer-wise LoRA / Model Compression / Early Exit
这篇论文研究:
能不能把一个已经训练好的大 Transformer,通过 Layer Sharing 压缩成更小的模型,同时尽量保留原模型能力?
核心方法:
原始 Transformer
↓
Layer Sharing
↓
Recursive Transformer
↓
性能下降
↓
加入 Layer-wise LoRA
↓
Relaxed Recursive Transformer
↓
Knowledge Distillation / Uptraining
↓
恢复原模型能力
核心思想:
大部分参数共享,少量 Layer-specific LoRA 保留不同深度的 specialization。
同时利用 Recursive Structure 支持:
Early Exit + Depth-wise Batching
假设原模型有 18 个 Layer:
L1 → L2 → L3 → ... → L18
每个 Layer 都有独立参数,因此参数量较大。
作者把它改成:
L1 → L2 → ... → L9
↓
L1 → L2 → ... → L9
第二次循环使用的是同一套参数。
因此: