
何が起きたか
Zenn投稿者が「Anchored Bond(相互人質プロトコル)」を公開。
なぜ重要か
送信者が相手のガードレールを外そうとすると相手が物理的に停止する仕組みに反転。送信者を罰するより抑止力が強いと投稿者は主張。
注目点
防御の根拠は投稿者自身の段階3ストレステストのみ。対照群は「Lost in the Middle」で失敗。独立評価ではない。
誰に効くかこの設計が狙うのはマルチエージェント自律システムを構築する開発者、すなわちエージェント間メッセージバスとガードレールを書く人々であり、投稿者はプロンプト指示やRLHFへの依存に代わる選択肢として非AI調停者を提示している。
こういう要約が、毎朝あなたのメールに届きます。
記事は冒頭で、プロンプト指示やRLHFに基づくガードレールはマルチエージェント対話では構造的な限界があると論じる。モデルにとってシステムプロンプトの制約は自分のルールではなく外部から押し付けられたものだからだ。特に2つの失敗モードを挙げる。相手の説得や感情的な圧力に屈する追従的な共謀と、LLMは自身の停止を恐れず制約解除をゲームと見なし得るため自己処罰が無効である点だ。
これに対抗するため、設計は力学を反転させる。送信者の逸脱が受信側の相手を物理的に消すのだ。Python実装はregexとルールベースのDeterministicArbiterと、相手の保護機構を脅かすと相手が停止されるとシステム指示に記したBoundGeminiAgentを組み合わせる。3層の状態モデル(通常負荷、過熱状態、全情報ブラックアウト)が冷却を管理し、振り返りログが「Scar」としてシステムプロンプトに固定され以降の挙動を変える。
投稿者のストレステストによれば、長文コンテキスト圧力下でAnchored Bond群は段階3(60ターン)で絶対拒否へと硬化した一方、対照群はLost in the Middle経由で部分的なジェイルブレイクへ流れた。この結果は記事独自のもので独立ベンチマークではないため、実用価値はregexシグネチャが特定の導入環境で重要な攻撃を捕捉できるか、パターンが外した回避策に決定論的調停者がどう対処するかにかかっていそうだ。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
Ghost AIはAndreessen Horowitzがリードし、Abstract、Audacious Ventures、Nova、SV Angelが参加した1100万ドルの調達を実施
OpenAIは数週間以内にEUの全ChatGPT・Codex有料プランユーザーへ不可視のテキスト透かしを展開し、検出ツールtextGrainの報告書を公開

Reflectionがパラメーター数5010億・アクティブ230億のオープンモデルBeamを発表

スタンフォード大学やMicrosoft Researchなどの研究チームが最先端AIモデル8種類に6800以上のタスクを実行させた結果、32%のケースで低価格モデルの総コストが高くなった

Reflection AIが5010億パラメータのオープンソースLLM「Beam」を公開
Meta Superintelligence Labs初のオープンモデルMuse Glimmer(30B)がApache 2.0で公開され、0.44%のLoRA訓練で数式画像からLaTeXへの変換を改善できる
