作者:Mostafa Dehghani, Stephan Gouws, Oriol Vinyals, Jakob Uszkoreit, Lukasz Kaiser

会议:ICLR 2019

核心关键词:Universal Transformer / Weight Sharing / Recurrence / Adaptive Computation / Dynamic Halting / Iterative Refinement


1. TL;DR

一句话

Universal Transformer(UT)把 Transformer 的“固定深度、每层独立参数”改成“共享参数 + recurrent depth”,让同一个 Transformer block 在 hidden state 上反复迭代。

普通 Transformer:

$h_{l+1}=f_{\theta_l}(h_l)$

Universal Transformer:

$\boxed{ h_{t+1}=f_{\theta}(h_t) }$

其中:

$\theta_1,\theta_2,\ldots,\theta_L$

变成:

$\boxed{\theta}$

一套共享参数。


2. 为什么需要 Universal Transformer?

传统 Transformer 有一个天然限制:

计算深度在模型设计时就被固定了。

例如:

Input
 ↓
Layer 1
 ↓
Layer 2
 ↓
Layer 3
 ↓
...
 ↓
Layer 12
 ↓
Output