
何が起きたか
Toby Ordのスウォームスケーリング分析によると、4エージェントのスウォームは同じ性能に約2倍の総トークン数を要したが、エージェントあたりのトークン数は半分だった。
なぜ重要か
スウォームは新しい形の推論スケーリングとして機能し、並列エージェントが実時間の速度を買う。ただしエージェント数が増えると収益は逓減する。
注目点
Ordによれば、エージェント数を10倍にしても、1エージェントで10倍のトークンを使う場合の3倍から5倍の性能しか得られない。
誰に効くか並列エージェントにトークンを費やすか、単一エージェントのより長い推論に費やすかを検討しているAI研究所の研究者やプロダクトチームは、計画に使える具体的な速度対コストのトレードオフを手にしたことになる。
こういう要約が、毎朝あなたのメールに届きます。
OrdはAIスウォームを新たな推論スケーリングの形態として位置づけている。これはこれまでこの分野が主に使ってきた2つのレバーとは異なる。すなわち、訓練済みモデルに対して計算資源とデータの最適な配分を選ぶこと、そして推論予算をより長い思考連鎖やツール呼び出しに費やすことだ。スウォームは第3のパラメータ、つまり同時に動かすエージェントの数を追加し、Ordの短い分析がそのパラメータに輪郭を与えている。速度の利点は実際にあるが、トークンコストと調整のペナルティを伴い、Ordはこれを大規模な人間集団が協働しようとするときに経済学者が観察する「足を踏み合う」税に例えている。
彼の最も際立った指摘は、これが知能爆発の可能性にとって何を意味するかについてだ。OrdはAIエージェントのλの値がもっと低ければよかったと述べている。λが低ければ知能爆発の可能性は下がるからだ。しかし分析はむしろ、スウォームがその可能性を高めうることを示唆している。この解釈は、AI能力がどれだけ速く複合的に伸びうるかを追う者にとって重要だが、実測された導入ではなく彼のモデリングに基づいている。
同じニュースレターの別の話題も関連する方向を示している。C5R CorpのSciUniverseベンチマークは、AIシステムがほぼ自動化された実験室をどれだけうまく運用できるかを試すもので、Claude Fable 5.1(xhigh)が45.3%の合格率で首位に立ち、タスクあたりのコストは40.61ドルだ。DeepMindのAutomated Scientific Economyに関する論文は、AI科学者のボトルネックはアイデア生成ではなく物理的資源と実証的検証になると論じている。Ordのスウォーム分析と合わせると、近未来の焦点は生のモデル能力よりも、並列エージェント、希少な実験設備、研究予算をいかに効率よく配分するかに移っていることがうかがえる。その答えが、どの研究所や機関が実際にAI能力を成果へと変えられるかを左右するだろう。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
Ghost AIはAndreessen Horowitzがリードし、Abstract、Audacious Ventures、Nova、SV Angelが参加した1100万ドルの調達を実施
OpenAIは数週間以内にEUの全ChatGPT・Codex有料プランユーザーへ不可視のテキスト透かしを展開し、検出ツールtextGrainの報告書を公開

Reflectionがパラメーター数5010億・アクティブ230億のオープンモデルBeamを発表

スタンフォード大学やMicrosoft Researchなどの研究チームが最先端AIモデル8種類に6800以上のタスクを実行させた結果、32%のケースで低価格モデルの総コストが高くなった

Reflection AIが5010億パラメータのオープンソースLLM「Beam」を公開
Meta Superintelligence Labs初のオープンモデルMuse Glimmer(30B)がApache 2.0で公開され、0.44%のLoRA訓練で数式画像からLaTeXへの変換を改善できる
