AIToday
大規模言語モデルQiita 機械学習掲載日時: 2026年10月9日 1:00

DeepNet、1000層Transformer学習成功

LINEで送る
DeepNet、1000層Transformer学習成功

3つのポイント

  1. 何が起きたか

    Microsoft ResearchのHongyu Wang氏らがDeepNetを提案。DeepNormと縮小初期化を組み合わせ、1000層のPost-LN Transformerを学習した。

  2. なぜ重要か

    深いPost-LN Transformerの不安定さの原因が学習ごく初期の更新爆発とその後の更新停止であることを特定。提案手法により1000層Transformerを学習できると分析する。

  3. 注目点

    論文はarXiv版が2022年であると注記。今後の予定されたイベントは示されていない。

誰に効くか深層ニューラルネットワークの学習に取り組むAI研究者やエンジニア、特に非常に深いTransformerモデルを構築する者にとって、1000層のPost-LN Transformerの学習を可能にした実証済みの手法(DeepNormと縮小初期化)が得られる。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

本論文の出発点は具体的な診断にある。深いPost-LN Transformerでは学習の最初期に更新が爆発しその後ほぼ止まる。著者らはこれを、LayerNormの入力が大きくなるとLayerNormを通る勾配が縮小し、モデルが悪い局所解に陥ると説明する。

DeepNetの修正は新しい学習テクニックではなく構造的なものだ。各Post-LNサブ層の残差接続をαでスケーリングし、FFNの重みとアテンションのVおよび出力射影を通常のβ倍のスケールで初期化する。QとKの射影は標準のXavier初期化のままとする。著者らの分析によれば、通常のPost-LNは更新の大きさが全サブ層のパラメータ変化の総和程度に蓄積するのに対し、DeepNetは深さによらずO(1)に保つ。αとβはいずれもアーキテクチャのサイズのみで決まる定数(N層のエンコーダのみのスタックではα = (2N)^{1/4}、β = (8N)^{-1/4})であり、学習パラメータではない。この点が、この手法が予測可能にスケールする理由を説明する助けとなる。

実験では、1000層のDeepNet(エンコーダ500層、デコーダ500層、サブ層2500)が問題なく学習された。論文は翻訳の比較も報告している。バイリンガルコーパスで学習した200層・32億パラメータのDeepNetは、テストしたすべての多言語翻訳評価セット(WMT、OPUS、TED、Flores-101)でBLEUスコアにおいてM2M-100(Facebookの多言語翻訳モデル、48層・120億パラメータ)を上回った。

よくある質問
DeepNetは1000層Transformerを学習可能にするため具体的に何をしたのか?
Post-LNをDeepNormに置き換え、残差接続を定数α>1でスケーリングし、初期化時にFFNの重みとアテンションのVおよび出力射影の重みをβ<1倍した(QとKの射影は標準のXavier初期化のまま)。これらの定数は層数のみに依存し、学習パラメータではない。
どこにいつ掲載されたのか?
IEEE TPAMI(Transactions on Pattern Analysis and Machine Intelligence)第46巻第10号、2024年に掲載。arXiv版は2022年。
深いPost-LN Transformerはそもそもなぜ不安定になるのか?
著者らは、深いPost-LNモデルでは学習のごく初期に更新が爆発しその後ほぼ停止することを観測した。大きな更新はLayerNormの入力を大きくし、LayerNormを通る勾配の大きさは入力サイズに反比例するため勾配が消失し、モデルが悪い局所解にはまる。
Qiita 機械学習元記事を読む
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

次の記事へ生物学AIデータに18億ドル 米政府とMeta・Google DeepMind・Isomorphic Labsが共同出資