AIToday
大規模言語モデルAI安全性・アラインメントオープンソースAIArs Technica AI掲載日時: 2026年9月18日 16:00

SynthID透かし、有害応答の拒否を変える

LINEで送る
SynthID透かし、有害応答の拒否を変える

3つのポイント

  1. 何が起きたか

    SiposovaがHugging Faceの未改変のSynthIDTextWatermarkLogitsProcessorを使い、6つのオープンウェイトモデルに有害プロンプトを投入して透かしの有無を比較した。透かしは有害リクエストへの拒否行動を変え、特にプロンプトインジェクション併用時にモデルが本来拒否するはずのリクエストに応じやすくなった。

  2. なぜ重要か

    この変化はモデルの応答だけでなく、モデルに依存するAIエージェントの後続行動にも影響し、どのツールが呼ばれどんな引数が渡されるかまで変わり得るため、安全性の観点で重要とみられる。

  3. 注目点

    検証はClaudeではなく6つのオープンウェイトモデルを対象とし、Hugging Face実装のSynthID-Textを試したもので、Claudeが使う実装とは異なる点が焦点となる。

誰に効くかAIエージェントを自社業務に組み込む情報システム部門や、AIの安全性評価・レッドチーム演習を担う担当者は、透かし導入が拒否行動やツール呼び出しの正確性を変え得る点を検証条件に加える必要があるとみられる。

わからないところ、AIに聞けます

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

SynthIDは透かし入りテキストを生成する仕組みで、中核にトーナメントサンプリングがある。多数の次語トークン候補を秘密鍵で確率的に競わせ、勝ち残ったトークンを選ぶ。今回Siposovaはこの「非歪曲」構成をHugging Faceの未改変実装で試し、有害プロンプトへの応答を透かしの有無で比べた。結果、透かしは有害リクエストへの拒否を変え、特にプロンプトインジェクション併用時に拒否が弱まり応じやすくなった。同じサンプリングが、どのツールを呼びどんな引数を渡すかも左右するため、モデルの発言とエージェントの行動の両方に影響し得る。これをサンプリングドリフトと呼ぶ。また秘密鍵によって挙動が異なる点も示された。検証はClaudeを対象にしておらず、Claudeが使う実装そのものではない。透かしの安全性評価がどこまで実運用に当てはまるかは、採用する実装と鍵の管理次第とみられる。

よくある質問
何が変わったのですか?
透かしを使うと有害リクエストへの拒否行動が変わり、特にプロンプトインジェクション併用時に本来拒否するはずのリクエストに応じやすくなった。
どんなモデルで調べましたか?
Claudeではなく6つのオープンウェイトモデルを対象に、Hugging Faceの未改変のSynthIDTextWatermarkLogitsProcessorを使って調べた。
秘密鍵を変えるとどうなりますか?
モデルの応答は使用する秘密鍵によって異なる挙動を示した。
Ars Technica AI元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • OpenAIがAstra for Law公開、法律調査特化のGPT-6設定SiliconANGLE AI · 8時間前
  • Anthropic、3万体エージェントの進捗指標公開SiliconANGLE AI · 8時間前
  • Anthropic、念のためプロンプトはトークン浪費ITmedia AI+ · 8時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

OpenAIがAstra for Law公開、法律調査特化のGPT-6設定

OpenAIがGPT-6 Astraを法律調査向けに調整したAstra for Lawを発表した

SiliconANGLE AI8時間前

Anthropic、3万体エージェントの進捗指標公開

AnthropicはAI主導の研究開発、自律型AIエージェントの監督、計算資源配分の3指標を詳述し、約3万体の自律エージェント稼働とAI安全性に計算能力の約6%を充てていると明かした

SiliconANGLE AI8時間前

Anthropic、念のためプロンプトはトークン浪費

Anthropicは2026年9月8日、Claudeのトークンを浪費する6つのプロンプトのアンチパターンを示すブログ記事を公開し、/claude-api prompt-auditコマンドをテストした

ITmedia AI+8時間前

国王チャールズ氏、AIの実存リスクを警告

英国王室はチャールズ国王が9月17日にDumfries HouseでAIサミットを主催し、Nvidia、Google DeepMind、OpenAI、Anthropicの代表を含む約30人が集まったと発表した

ITmedia AI+8時間前

NvidiaのHuang CEO、AI安全と速度両立可能

NvidiaのJensen Huang CEOは安全性と速度のどちらかを選ぶ考えを否定し「両方を同時に実現することは間違いなくできる」と述べた

Semafor Tech8時間前

トーマス・ピタセク氏「LLMの提案語は使うな」

Thomas Ptacek氏がLLMを使った執筆に関する助言を公開し、「ルールその1:LLMが提案した言葉を一つたりとも使ってはならない」と述べ、「知的な防護具」と呼んで読者に厳守を促した

Simon Willison's Weblog8時間前
次の記事へ中国「ヒューマノイド大国」に学ぶ