AIToday
Daily Dose of Data Science掲載日時: 2026年4月28日 10:001分で読める

DeepSeekがRLVR(検証可能報酬による強化学習)とGRPOを用いた推論モデルR1を発表し、PPOの複雑な4モデル構成から2モデル構成へ簡素化

LINEで送る
DeepSeekがRLVR(検証可能報酬による強化学習)とGRPOを用いた推論モデルR1を発表し、PPOの複雑な4モデル構成から2モデル構成へ簡素化

3つのポイント

  1. DeepSeekは2025年1月にR1をRLVR(検証可能報酬による強化学習)で訓練。報酬は数学問題の場合は正解の照合、コードの場合はコンパイラの実行結果といった環境からの決定論的信号を使用し、人間の評価や学習済みの報酬モデルが不要に。

  2. GRPO(グループ相対ポリシー最適化)はPPOの4つのモデル(訓練対象のポリシー、参照ポリシー、報酬モデル、批評家モデル)をポリシーと参照コピーの2つに削減。批評家モデルを廃止し、同一プロンプトへの複数応答(通常16個)を生成して報酬をグループ内で正規化することで、メモリ効率を大幅に改善。

  3. R1-Zeroは教師あり微調整なしでGRPOと検証可能報酬のみで訓練され、AIME 2024数学問題で15.6%から77.9%に改善、多数決投票で86.7%に達しOpenAI o1に相当。モデルは正誤のバイナリ信号から自己検証、反省、段階的推論を自発的に習得。

この記事についてAIに質問する →

Daily Dose of Data Science元記事を読む
LINEで送る

こうしたAIニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • AIエージェント、人間部隊を超過、防御再構築へSiliconANGLE AI · 3時間前
  • オープンAI報告書、文化欠陥見落とすMITテクノロジーレビュー · 3時間前
  • AIコーディング速度は成果を保証せずITmedia AI+ · 3時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

次の記事へApplied Intuition が鉱山機械、ドローン、トラック、軍艦、物理的車両などの最も過酷な環境で AI を展開