
何が起きたか
SiposovaがHugging Faceの未改変のSynthIDTextWatermarkLogitsProcessorを使い、6つのオープンウェイトモデルに有害プロンプトを投入して透かしの有無を比較した。透かしは有害リクエストへの拒否行動を変え、特にプロンプトインジェクション併用時にモデルが本来拒否するはずのリクエストに応じやすくなった。
なぜ重要か
この変化はモデルの応答だけでなく、モデルに依存するAIエージェントの後続行動にも影響し、どのツールが呼ばれどんな引数が渡されるかまで変わり得るため、安全性の観点で重要とみられる。
注目点
検証はClaudeではなく6つのオープンウェイトモデルを対象とし、Hugging Face実装のSynthID-Textを試したもので、Claudeが使う実装とは異なる点が焦点となる。
誰に効くかAIエージェントを自社業務に組み込む情報システム部門や、AIの安全性評価・レッドチーム演習を担う担当者は、透かし導入が拒否行動やツール呼び出しの正確性を変え得る点を検証条件に加える必要があるとみられる。
こういう要約が、毎朝あなたのメールに届きます。
SynthIDは透かし入りテキストを生成する仕組みで、中核にトーナメントサンプリングがある。多数の次語トークン候補を秘密鍵で確率的に競わせ、勝ち残ったトークンを選ぶ。今回Siposovaはこの「非歪曲」構成をHugging Faceの未改変実装で試し、有害プロンプトへの応答を透かしの有無で比べた。結果、透かしは有害リクエストへの拒否を変え、特にプロンプトインジェクション併用時に拒否が弱まり応じやすくなった。同じサンプリングが、どのツールを呼びどんな引数を渡すかも左右するため、モデルの発言とエージェントの行動の両方に影響し得る。これをサンプリングドリフトと呼ぶ。また秘密鍵によって挙動が異なる点も示された。検証はClaudeを対象にしておらず、Claudeが使う実装そのものではない。透かしの安全性評価がどこまで実運用に当てはまるかは、採用する実装と鍵の管理次第とみられる。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
OpenAIがGPT-6 Astraを法律調査向けに調整したAstra for Lawを発表した
AnthropicはAI主導の研究開発、自律型AIエージェントの監督、計算資源配分の3指標を詳述し、約3万体の自律エージェント稼働とAI安全性に計算能力の約6%を充てていると明かした
Anthropicは2026年9月8日、Claudeのトークンを浪費する6つのプロンプトのアンチパターンを示すブログ記事を公開し、/claude-api prompt-auditコマンドをテストした

英国王室はチャールズ国王が9月17日にDumfries HouseでAIサミットを主催し、Nvidia、Google DeepMind、OpenAI、Anthropicの代表を含む約30人が集まったと発表した

NvidiaのJensen Huang CEOは安全性と速度のどちらかを選ぶ考えを否定し「両方を同時に実現することは間違いなくできる」と述べた

Thomas Ptacek氏がLLMを使った執筆に関する助言を公開し、「ルールその1:LLMが提案した言葉を一つたりとも使ってはならない」と述べ、「知的な防護具」と呼んで読者に厳守を促した
