
Appleの研究者が拡散型言語モデルの復号プロセスを改善する新しい学習手法を発表しました。
従来の経験則ベースの手法の代わりに、強化学習で訓練された軽量なポリシーネットワークを用い、どのトークンを復号するかを決定することで、効率性と品質の両面での向上が期待できます。
何が起きたか
Appleの研究者チームが、拡散型言語モデル(dLLM)における改善された学習手法を報告しました。従来の信頼度しきい値などの経験則に代わり、強化学習で訓練された軽量なポリシーを用いて、各ステップでどのトークン(文字の単位)を復号するかを決定する方法を提案しています。
なぜ重要か
dLLMは複数トークンを並列に復号できる点で自己回帰型モデルよりも効率的とみられていますが、既存の経験則はマニュアル調整が必要で、大規模なブロック処理では性能が低下する課題がありました。訓練ベースのアプローチは、これらの制限を改善する可能性があります。
注目点
新手法は、セミ自動回帰生成では最先端の経験則と同等の性能を達成し、完全拡散設定ではそれを上回る結果が得られたとのことです。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
AIが現在、いわゆるヤコビアン予想を含む長年の数学問題の解決を支援しており、トップ数学者たちはこれが最終的に良いことなのか悪いことなのか深く迷っている

15の言語モデルを対象に、出典付きの2件の依頼でベンチマークを実施

ラムリサーチがオレゴン州ツアラティンでAI半導体向け研究開発センターの着工を発表した

セールスフォースの株価は木曜日に23%近く急騰し、2020年以来の大幅な上昇を記録した

KDDIと道のりホールディングスは2026年8月28日、9月1日からAIによる自動運転バス向け通信品質の自動最適化実証を実施すると発表した

KDDIとみちのりホールディングスは、自動運転バスの通信品質をAIで自律最適化する実証実験を実施する
