
非公式オンラインクイズで、読者は透かし入りAIテキストを特定できず、2回のテストでランダム推測に近いスコアだった。
結果は透かしがテキスト品質を検出可能な形で劣化させたり、人間の読者に目立ったりしないことを示す。
著者はレンタルしたGPU(約2ドル)でQwen-30B-A3B-Instruct-2507を使い回答を生成した。
何が起きたか
278人を対象にしたクイズで、各問題に3つのAI生成回答(1つはSynthID-Textで秘密裏に透かしが入り、Qwen-30B-A3B-Instruct-2507を使用、残り2つは非透かし)を提示。平均点は3.92/10だった。透かし入り回答が10問中6問で選択肢Aになっていた位置バイアスを修正するためクイズを並べ替えた後、73人が参加した第2ラウンドの平均点は3.4/10だった。
なぜ重要か
完全なランダム推測なら3.33/10になる。両ラウンドともこの基準に近い値で、読者は透かし入り出力を非透かし出力と並べて読んでも確実には見分けられないことを示唆する。この実証結果は、AI透かしが人間が知覚できる形でテキスト品質を損なわないという主張を裏付ける。国内のAI利用企業は、透かし入り文書の品質低下を読者が知覚しない可能性がある点を踏まえた導入判断が求められるとみられる。
注目点
著者はこれを対照研究ではなく、カジュアルで非科学的なテスト(アナリティクスからの訪問者数集計で、簡単に偽装可能だが非公式な検証には許容できる)だと認めている。サンプル数は278人と73人と控えめだが、著者は両ラウンドで結果が一貫していることから十分だと判断している。
このクイズは、AI透かしに関する懸念は誇張されている(テキスト品質を損なわず、出力を検出可能なほど悪化させない)という著者の幅広い主張から生まれた。この主張を実証的に検証するため、著者はオンラインクイズを作成し、同じプロンプトへの3つの回答を並べて提示して、どれが透かし入りか読者に尋ねた。第1ラウンドでは6/10にスコアの第2のピークが見られ、著者はこれを方法論上の問題(透かし入り回答が10問中6問で選択肢Aだったため、常に最初の選択肢を選んだ参加者がそのスコアを獲得した)に起因すると特定した。透かし入り回答を全選択肢にランダムに配置するよう並べ替えた後、第2ラウンドのスコアは純粋なランダム推測にかなり近づき、読者が実際の質的差異を検出するのではなく推測していたという仮説を裏付けた。著者はこのテストの限界(サンプルサイズが控えめ、LinkedInとHacker News経由の自己選択参加、管理された測定ではなくアナリティクスによる集計)を明示的に指摘しているが、両ラウンド間の一貫性は調査結果に自信を持つのに十分だと主張している。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
AIが現在、いわゆるヤコビアン予想を含む長年の数学問題の解決を支援しており、トップ数学者たちはこれが最終的に良いことなのか悪いことなのか深く迷っている

15の言語モデルを対象に、出典付きの2件の依頼でベンチマークを実施

数十人の抗議者が木曜、オースティンのベンチャーキャピタル企業8VCの外に集まり、医療分野におけるパランティアのAI技術に抗議した

非営利の患者安全団体ECRIが、報告制度の対象を医療現場での人工知能関連の誤りにまで拡大している

看護師100人以上が8月27日、パロアルトのPalantir旧本社前で交通を遮断し、病院経営陣と当局者に同社との関係断絶を求めて抗議した

AIシステムが、ワシントン州東部で危険物輸送列車を大災害へ突入させかけたとTri-City Heraldが報じた
