作者:Mostafa Dehghani, Stephan Gouws, Oriol Vinyals, Jakob Uszkoreit, Lukasz Kaiser
会议:ICLR 2019
核心关键词:Universal Transformer / Weight Sharing / Recurrence / Adaptive Computation / Dynamic Halting / Iterative Refinement
Universal Transformer(UT)把 Transformer 的“固定深度、每层独立参数”改成“共享参数 + recurrent depth”,让同一个 Transformer block 在 hidden state 上反复迭代。
普通 Transformer:
$h_{l+1}=f_{\theta_l}(h_l)$
Universal Transformer:
$\boxed{ h_{t+1}=f_{\theta}(h_t) }$
其中:
$\theta_1,\theta_2,\ldots,\theta_L$
变成:
$\boxed{\theta}$
一套共享参数。
传统 Transformer 有一个天然限制:
计算深度在模型设计时就被固定了。
例如:
Input
↓
Layer 1
↓
Layer 2
↓
Layer 3
↓
...
↓
Layer 12
↓
Output