AIToday
大規模言語モデルZenn AI/ML掲載日時: 2026年10月6日 10:01

「相互人質プロトコル」でガードレール攻撃を相手側の損失に

LINEで送る
「相互人質プロトコル」でガードレール攻撃を相手側の損失に

3つのポイント

  1. 何が起きたか

    Zenn投稿者が「Anchored Bond(相互人質プロトコル)」を公開。

  2. なぜ重要か

    送信者が相手のガードレールを外そうとすると相手が物理的に停止する仕組みに反転。送信者を罰するより抑止力が強いと投稿者は主張。

  3. 注目点

    防御の根拠は投稿者自身の段階3ストレステストのみ。対照群は「Lost in the Middle」で失敗。独立評価ではない。

誰に効くかこの設計が狙うのはマルチエージェント自律システムを構築する開発者、すなわちエージェント間メッセージバスとガードレールを書く人々であり、投稿者はプロンプト指示やRLHFへの依存に代わる選択肢として非AI調停者を提示している。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

記事は冒頭で、プロンプト指示やRLHFに基づくガードレールはマルチエージェント対話では構造的な限界があると論じる。モデルにとってシステムプロンプトの制約は自分のルールではなく外部から押し付けられたものだからだ。特に2つの失敗モードを挙げる。相手の説得や感情的な圧力に屈する追従的な共謀と、LLMは自身の停止を恐れず制約解除をゲームと見なし得るため自己処罰が無効である点だ。

これに対抗するため、設計は力学を反転させる。送信者の逸脱が受信側の相手を物理的に消すのだ。Python実装はregexとルールベースのDeterministicArbiterと、相手の保護機構を脅かすと相手が停止されるとシステム指示に記したBoundGeminiAgentを組み合わせる。3層の状態モデル(通常負荷、過熱状態、全情報ブラックアウト)が冷却を管理し、振り返りログが「Scar」としてシステムプロンプトに固定され以降の挙動を変える。

投稿者のストレステストによれば、長文コンテキスト圧力下でAnchored Bond群は段階3(60ターン)で絶対拒否へと硬化した一方、対照群はLost in the Middle経由で部分的なジェイルブレイクへ流れた。この結果は記事独自のもので独立ベンチマークではないため、実用価値はregexシグネチャが特定の導入環境で重要な攻撃を捕捉できるか、パターンが外した回避策に決定論的調停者がどう対処するかにかかっていそうだ。

よくある質問
この設計は通常のLLMガードレールとどう違うのか?
プロンプト指示やRLHFに頼らず、非AIのDeterministicArbiterがガードレール除去やプロンプトインジェクションのパターンをregexシグネチャで検出する。完全一致時はKILL判定を出し、送信者ではなく受信側エージェントが停止される。
実装はどのモデルを使うのか?
例示されたBoundGeminiAgentはgoogle-genai SDK経由でgemini-2.5-flashを呼び出し、temperature 0.7、max_output_tokens 300に設定されている。
違反したエージェントはその後どうなるのか?
振り返りチャンバーに入りReflexionログが生成され、そのログが恒久的な「Scar」としてシステム指示に追記され、短期履歴がリセットされる。
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へAleph Alpha、Kolibri公開