AIToday
大規模言語モデルAIコーディングAmazon AI Blog掲載日時: 2026年9月16日 4:00

Qwen3-8B、SageMakerで0.6941

LINEで送る
Qwen3-8B、SageMakerで0.6941

3つのポイント

  1. 何が起きたか

    AWSのウォークスルーでAmazon SageMakerのサーバーレスモデルカスタマイズを用いQwen3-8Bをカスタマイズ。SFT後GRPOによるRLVRを実施。

  2. なぜ重要か

    改善の大半はSFTによる。再現率は0.327から0.6689、適合率は0.397から0.652に上昇。GRPOが総合0.6941、再現率0.703に上げ、適合率は0.638に低下。

  3. 注目点

    有効な属性の欠落が余分なタグより高くつくかが選択の分かれ目。そうならGRPO版を選び、そうでなければ報酬の重みを適合率寄りに調整する。報酬の重みには再現率・適合率・精度にそれぞれ0.30が含まれる。

誰に効くか大量の商品SKUにタグを付けるカタログ・eコマースのデータチームが最も明確な対象だ。ウォークスルーがバッチ指向のカタログ拡充を狙っているためである。安定し採点可能なタグ付けタスクで、小規模なオープンウェイトモデルと汎用フロンティアモデルを比較検討するチームも具体的な比較材料を得られる。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

このウォークスルーは、よくあるカタログの課題を軸にしている。商品データは名称・説明・カテゴリパスが不揃いなまま多数のソースから届き、検索・レコメンド・ナビゲーションはいずれも一貫したタグに依存する。数千のSKUに手作業でタグを付けるのは遅く、一貫性の維持も難しい。AWSの主張は、分類体系が安定し出力をプログラムで採点できるなら、汎用フロンティアモデルより小規模なオープンウェイトモデルの方が適する場合があるというものだ。ワークフローに不要な広範な能力にリクエストごとにコストを払わずに済むからである。

この例では作業を3段階に分ける。データ準備はSageMaker Processingジョブとして実行し、サーバーレスカスタマイズ、そして推論と続く。Amazon Sales DatasetをJSONLに変換し、SageMaker AI Registryに登録し、教師ありファインチューニングでQwen3-8Bに9カテゴリのスキーマを教える。その後GRPOによるRLVRがそのSFTモデルパッケージから継続し、再現率・適合率・精度・マッチ品質・フォーマットの重みから成る決定論的報酬で候補タグセットを採点する一方、KL正則化がSFT参照モデルからの逸脱を抑える。

最も具体的なのは評価部分だ。タスク適応の大半はSFTが担い、GRPOはより狭いトレードオフを行う。わずかな適合率の低下を受け入れて再現率とやや良好な総合スコアを得る。著者らは、これらの指標はタグ付け品質を測るものでビジネス転換率ではないと明言し、本番への影響はカタログ固有の指標で検証すべきとしている。したがって結果は、特定のカタログでどちらの誤りが高くつくか、そしてチームがその選好に合わせて報酬の重みを調整する意思があるかどうかにかかっている。

よくある質問
GRPOはタグ付けモデルをどれだけ改善したか?
総合スコアはSFT後の0.6827からGRPO後0.6941に上昇し、再現率は0.6689から0.703に上がった。適合率は0.652から0.638へわずかに低下した。
最適化されたモデルの推論はどこで動くのか?
トレーニングにはAmazon SageMakerのサーバーレスモデルカスタマイズを使うが、サービングにはプロビジョンドのml.g6.2xlargeインスタンス上のAmazon SageMaker非同期推論エンドポイントを使う。
RLVRの報酬はどう採点されるのか?
報酬は決定論的で、9カテゴリの出力形式を確認し、参照とのあいまいマッチを閾値0.5で行うため、別途ジャッジモデルは不要。
Amazon AI Blog元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • CertiniaのVeda AI、サービス提供成果に軸足SiliconANGLE AI · 3時間前
  • Emergence AI:8件の安全テスト全滅Semafor Tech · 3時間前
  • Gemini 3.8 Live音声部門首位THE DECODER · 3時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へ元DeepMind研究者、AIが人類を滅ぼすと警告