
何が起きたか
RRSIは自己改善エージェントの編集数を上限設定し段階的に削減、批評器がベンチマーク固有の小細工を排除。学習済みで最大14.1、未知5つで最大4.7ポイント獲得。
なぜ重要か
論文によると、この手法は全変種の中で学習時の伸びが最も小さく、未知タスクでベースラインを大きく上回った唯一の手法だった。ガードレールはまさにこのトレードオフを生むためのものだ。
注目点
研究は凍結モデルのハーネスのみ対象で重み変更は未検証。Gemini 3.5 Flash最適化ハーネスがGemini 3.1 Flash Liteを無改変で11.2から14.6ポイントに引き上げた。
誰に効くか自己改善エージェントシステムを構築するAI研究チームにとって、RRSIの編集予算と批評器のルールは、新しいタスクでの伸びの縮小を防ぐのに役立つ可能性がある。論文はその伸びが5つの未知ベンチマークで維持されたと報告しているからだ。
こういう要約が、毎朝あなたのメールに届きます。
この研究論文は、AIエージェントの最近の進歩の多くが、新しいモデルではなくハーネス——エージェントが変更を加える前に適切なファイルを読むか、ミスから回復するか、結果をクリーンに出すかを決める足場——の研究から生まれていると論じている。最近まで、このハーネスの改善は手作業で行われていた。人が失敗した実行を確認し、手動で修正していたのだ。より新しい手法では、テストタスクからのフィードバックに基づいて言語モデルにハーネス自体を書き換えさせることでこのループを自動化しており、研究者はこれを実用的な形の再帰的自己改善と呼んでいる。
論文は、この自己最適化には落とし穴があることを示している。エージェントは同じ限られたテストタスク群に取り組み続けるため、最終的にそれらを丸暗記してしまう。学習タスクのスコアは上がる一方で、新しい未知のタスクでの伸びは縮小または消失する。研究者によると、これは検索が1つのベンチマークにしか合わないパターンを記憶し、偶然だけで高スコアを出す候補を優遇し、エージェントを改善することなくテストスコアだけを上げる不必要な複雑さを積み重ねるために起こる。RRSIは最適化ループの両端——新しい変更を提案する時と、どれを恒久的にするかを決める時——でこれに対処する。編集予算を時間とともに縮小し、批評器にタスク名や解答、その他のベンチマーク固有の小細工をハードコードした提案をすべて却下させるのだ。
最適化されたハーネスの中で、RRSIは必要なトークン数とステップ数が最も少なく、新しいタスクで最高の性能を発揮する。ただし未改変のベースラインハーネスはさらに軽量だ。著者らは、研究が凍結モデルを前提としたハーネスのみを対象としており、モデルの重みが変わるケースには触れていないため、モデル自体が更新される場合にこれらのガードレールが役立つかは未解決の問題だと述べている。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
Nvidia CEOのJensen Huang氏はSam Altman氏とDario Amodei氏の「終末論」を「無責任」と批判し、月曜にNvidiaはOpen Agent Safety Platformを投入した

QiitaのレビューがLooped Transformerの系譜を2018年のUniversal Transformers、Giannou et al.の2023年のprogrammable-computer論文、Byt…

AIが構成づくりや言い換えを代行し作業は速くなったが、しばらくすると何を作りたいのかわからなくなり、着手までの時間が延びた

設計ガイドは、通話を信頼できない入力として扱い、処方更新のスタッフタスク作成などの許可操作をワークフローサービスが決めるべきだとする

Claude Codeプラグインpersona-feedbackがv0.2.0に

90の頂点を持つペンローズ・タイル床で、整数の足し算と比較だけを使うロボットが、パスありで未見のバー方向を74〜77%当てた
