AIToday
大規模言語モデルQiita 機械学習掲載日時: 2026年10月6日 16:00

AI性能向上の正体は5つの方向の積み重ね

LINEで送る
AI性能向上の正体は5つの方向の積み重ね

3つのポイント

  1. 何が起きたか

    現代のAI性能向上は、事前学習、RLHF、RLVRと推論時スケーリング、MoEと蒸留、エージェントとコンテキスト設計の5つの方向から説明できると整理されている。

  2. なぜ重要か

    モデルを大きくするだけでは説明できず、人間の評価や自動採点、計算量を抑える構造、使う側の環境づくりまでが性能を左右するとみられる。

  3. 注目点

    Epoch AIは人間が書いた公開テキストを約300兆トークンと推定し、2026年から2032年の間に使い切る可能性があると予測しており、データの壁が焦点となる。

誰に効くか自社でAI導入を検討する情報システム担当者や、AIモデルの選定に関わる企画担当者は、モデルの大きさだけでなく、RLHFやMoE、エージェント設計といった仕組みの違いを比較軸にする必要がある。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

AIの性能向上をめぐる議論は、かつてはモデルのパラメータ数を増やすことが中心だった。しかし2022年にDeepMindが発表した研究は、同じ計算量ならモデルの大きさと学習データ量をバランスよく増やす方が良いという結果を示し、700億パラメータのChinchillaが2800億パラメータのGopherを上回った。ここから「パラメータ数の約20倍のトークンを読ませる」という目安が広く知られるようになった。

その後、性能を押し上げたのは学習の工夫だけではない。人間の評価で回答を仕上げるRLHF、自動採点を報酬にするRLVR、考える時間を増やす推論時スケーリング、計算量を抑えながら大規模化するMoEと蒸留、道具と記憶を持たせるエージェントとコンテキスト設計が組み合わされている。DeepSeek-R1-Zeroが強化学習だけで推論能力を伸ばした事例や、DeepSeek-V3が6710億パラメータのうち1トークンあたり370億だけを動かす事例はその代表だ。

こうした仕組みは大量の高品質データを前提にしており、Epoch AIは2026年から2032年の間に公開テキストを使い切る可能性を指摘する。ただし合成データや効率化で越えられる可能性も示されており、今後はデータの制約と計算効率のどちらを軸に性能を伸ばすかが焦点になるとみられる。

よくある質問
同じモデルでも性能の数字が変わるのはなぜですか?
DeepSeek-R1-Zeroでは、1回の回答で正解する確率が77.9%、複数の回答から最も多い答えを採用する自己整合性を使うと86.7%まで上がった。測り方で数字が変わるため、ベンチマークを見るときは測定条件まで確認する必要がある。
学習データは将来足りなくなるのですか?
Epoch AIは人間が書いた公開テキストを約300兆トークンと推定し、今の傾向が続けば2026年から2032年の間に使い切る可能性があると予測している。ただし合成データやデータの使い方の効率化で壁を越えられる可能性が高いとも述べている。
小さいモデルでも大きいモデルに勝てますか?
2022年のInstructGPTの研究では、パラメータ数が100分の1以下の13億モデルの出力が、1750億のGPT-3の出力より好まれたと報告されている。一方でDeepSeekの比較では、R1-Distill-Qwen-32Bは5項目のうち4項目でo1-miniを上回ったが、Codeforcesでは下回っている。
Qiita 機械学習元記事を読む
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へFalcon-Emirati-7B、Alyahスコア84.83%でアラビア語AI勢を制す