
何が起きたか
Microsoft ResearchのHongyu Wang氏らがDeepNetを提案。DeepNormと縮小初期化を組み合わせ、1000層のPost-LN Transformerを学習した。
なぜ重要か
深いPost-LN Transformerの不安定さの原因が学習ごく初期の更新爆発とその後の更新停止であることを特定。提案手法により1000層Transformerを学習できると分析する。
注目点
論文はarXiv版が2022年であると注記。今後の予定されたイベントは示されていない。
誰に効くか深層ニューラルネットワークの学習に取り組むAI研究者やエンジニア、特に非常に深いTransformerモデルを構築する者にとって、1000層のPost-LN Transformerの学習を可能にした実証済みの手法(DeepNormと縮小初期化)が得られる。
こういう要約が、毎朝あなたのメールに届きます。
本論文の出発点は具体的な診断にある。深いPost-LN Transformerでは学習の最初期に更新が爆発しその後ほぼ止まる。著者らはこれを、LayerNormの入力が大きくなるとLayerNormを通る勾配が縮小し、モデルが悪い局所解に陥ると説明する。
DeepNetの修正は新しい学習テクニックではなく構造的なものだ。各Post-LNサブ層の残差接続をαでスケーリングし、FFNの重みとアテンションのVおよび出力射影を通常のβ倍のスケールで初期化する。QとKの射影は標準のXavier初期化のままとする。著者らの分析によれば、通常のPost-LNは更新の大きさが全サブ層のパラメータ変化の総和程度に蓄積するのに対し、DeepNetは深さによらずO(1)に保つ。αとβはいずれもアーキテクチャのサイズのみで決まる定数(N層のエンコーダのみのスタックではα = (2N)^{1/4}、β = (8N)^{-1/4})であり、学習パラメータではない。この点が、この手法が予測可能にスケールする理由を説明する助けとなる。
実験では、1000層のDeepNet(エンコーダ500層、デコーダ500層、サブ層2500)が問題なく学習された。論文は翻訳の比較も報告している。バイリンガルコーパスで学習した200層・32億パラメータのDeepNetは、テストしたすべての多言語翻訳評価セット(WMT、OPUS、TED、Flores-101)でBLEUスコアにおいてM2M-100(Facebookの多言語翻訳モデル、48層・120億パラメータ)を上回った。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。