AIToday

AI生成文はNGワード排除後も「AI臭さ」が残る

Hacker News3時間前LINEで送る
AI生成文はNGワード排除後も「AI臭さ」が残る

要点

開発者がlogit_biasというAPIフィーチャーをテストし、AI生成記事から「AI臭い」単語を抑制して人間らしくすることに挑戦した。DeepSeek V4 Flashを使用した結果、監視単語の約3分の1を削除したが、不自然な代替表現や意図しない意味変更を防げず、APIレベルでのトークンブラックリスト強制が一つの問題(認識可能なAI単語)を別の問題(文法的に疑わしい編集)と引き換えにしていることが判明した。主要なLLMプロバイダのほとんどがこのフィーチャーをサポートしていないか、現在のモデルで無効化している。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    開発者がlogit_biasというAPIパラメータを使い、AI生成テキストに頻出する単語にペナルティを与えて8本の記事をDeepSeek V4 Flashで編集した。-8のペナルティで監視対象264単語中84単語の出現を削減したが、8本中6本が品質審査に合格し、制御グループ(バイアスなし)と同じ合格率だった。

  • なぜ重要か

    この実験はAIテキストを人間らしく見せる根本的なトレードオフを浮き彫りにしている。プロンプトベースのブラックリストは簡単だが無視されるか文字通りに従って意味や文法が損なわれる可能性がある。一方logit_biasはAPIレベルでトークン抑制を強制するが、除外単語が正しい文脈かどうか判別できず、モデルが不自然な代替表現を選ぶか文を予測不可能に変える。いずれのアプローチもリスクなしにAI散文の質を確実に向上させられない。

  • 注目点

    現在のOpenAIモデル(テスト対象のGPT-5.2~GPT-5.6)はAPIスキーマに残っていてもlogit_biasをサポートしていない。OpenRouterは2026年7月29日時点でDeepSeek V4 FlashやLlama 3.3 70Bを含む115モデルがlogit_bias対応を謳っているが、プロバイダによってサポートが異なり、静かに失敗するか無視される可能性もある。実際のエンドポイントでのテストが必須。

詳細

開発者はOpenAI APIパラメータのlogit_biasを使用してAI生成記事をより人間らしく聞かせることで、AI散文に異常に頻出する単語を抑制できるかテストした。このアプローチは従来のプロンプトベース単語リストと異なっていた。logit_biasは次のトークンをサンプリングする前にモデルのスコアリングプロセスに数値ペナルティを直接挿入するのであり、モデルが無視する可能性のある指示を与えるのではない。

この仕組みはロジット(モデルがすべての可能な次トークンに割り当てる数値スコア)の修正による。OpenAIのChat Completions APIは各トークンIDに対して-100から100の値を許可している。負の値は選択される可能性を低下させる。重要なことに、一旦代替表現が強制されると、新しいトークンは以降のすべてのトークンスコアリングのコンテキストになり、潜在的に下流の文全体を変形させる。開発者はまた、単語が単一トークンに綺麗に対応していないことを発見した。「 crucial」と「Crucial」は異なるトークンIDを持つ可能性があり、一部の単語は複数トークンにまたがるため、一つのトークンにペナルティを与えると意図しない単語を誤って抑制することもある。

アプローチをテストするため、開発者は8本の完全なAI生成記事をDeepSeek V4 Flash(安定したサポートを確保するためOpenRouterを経由しCloudflareプロバイダにピン留め)に送り、すべての事実、名前、数字、結論を保持しながら編集するよう求めた。各記事は2度処理された。制御として何のバイアスもない場合と、AI臭い単語のブラックリストのトークンIDに-8のペナルティを適用した場合である。ソース記事は監視単語264回の出現を含んでいた。ブラックリスト有効な編集は180回保持し、84回削除した。平均5グラムオーバーラップ(5単語シーケンスの共有度を測定)は制御で0.982から偏りのある編集で0.896に低下し、より多くのテキスト代替が起きたことを示している。

開発者が-100(ほぼ完全禁止)を別の強制禁止テストでテストすると、監視単語は完全に消えたがモデルは同じテキストを出力制限に達するまで繰り返した。実用的でない結果だった。-8設定がより実用的であることが判明した。8本のブラックリスト有効な編集7本がソース事実、固有名詞、確実性レベルを保持した。1本は「appears」というヘッジを削除し固有名詞を変更し、限定観察を直接主張に変えた。3本のブラックリスト有効な編集はソースより優れていると判定された。4本は同等、1本は悪化(「That details why…」のような文法的に誤った構文を導入)していた。意味を変更するか散文を悪化させるいずれかの記事を却下した場合、8本中6本のブラックリスト有効な編集が合格した。制御は8本中7本と比べ、小さなコストだった。

比較として、開発者はlogit_biasをサポートしないGPT-5.6 Solを使ってプロンプトベースのアプローチをテストした。5本の制御記事は通常編集指示を使用。5本の実験呼び出しは同じタスク加えて明示的な93単語抑制リストをプロンプトに含めた。プロンプトリストは監視単語の出現を11から1に減らしたが、実験記事5本中2本が情報を削除・変更した一方で制御記事5本は全て意味を保持していた。API レベルメソッドが同じようには課さなかった。しかし開発者は異なるモデルとソースセットのため直接比較ではないと指摘した。

logit_biasのサポートはプロバイダ全体でばらばらである。テスト対象のすべてのOpenAIモデル(GPT-5.2 Chatからカバーし、GPT-5.6 Luna)がunsupported_parameterエラーを返した。AnthropicのMessages APIはパラメータをまったく欠いている。OpenRouterのModels APIは2026年7月29日時点でlogit_biasサポートを謳う115モデルIDをリストアップしており、DeepSeek V4 Flash、GLM 5.2、Llama 3.3 70B、Mistral Small 3.2 24B、Qwen 3.6 27Bを含む。しかしOpenRouterのリストは動作サポートの証拠ではない。一部プロバイダは未知パラメータを無視し、別のプロバイダは受け入れるが無視し、ルーティングルールはプロバイダ間の移動で互換性を破壊することもある。開発者はDeepSeek V4 FlashがCloudflareプロバイダだけで機能すること、require_parameters有効、フォールバック無効を確認した。

核となる洞察はlogit_biasとプロンプトブラックリストが正反対に失敗することである。プロンプト版は柔軟でコンテキストを認識して意味を保持できるが、モデルはそれを無視するか機械的に従うことで不自然なテキストを作成できる。API版は、除外単語が実際にコンテキストで正しいかどうかの知識なしに直接トークン選択に圧力をかけ、より低能なモデルから来たように見える代替表現につながる。ペナルティを-4から-12に増やすことは一貫して結果を改善しなかった。繰り返しまたは文法的に誤った出力のリスクを増やしただけだった。いずれのメソッドも何らかのコストなしに信頼性を持って人間らしい散文を作成できず、本当に問題を修正することはトークンブラックリストではなく再トレーニングまたはファインチューニングを必要とすることを示唆している。

背景と解説

開発者の実験は、AI臭い散文を削除する現在のアプローチが根本的な限界に直面していることを示している。logit_biasによるトークンレベル抑制は数学的に強制されるもので、-100のペナルティは単語を確実に禁止できるが、モデルはその除外単語が正しい選択だったかどうかを知る方法がない。「appears」のような単語は不確実な主張を留保して保持すべきか、単なる埋め草か、APIパラメータには区別できない。同様に多くの単語は複数の形式でトークン化され(「 crucial」対「 Crucial」)、一つのフラグメントにペナルティを与えると異なる単語を誤って抑制することもある。別の方法としてプロンプト内にブラックリストを埋め込めば、モデルに優先度が競合する場合に無視する裁量を与えられるが、その柔軟性には代償がある。監視単語とはいえ保持されたり、リストに厳格に従って不自然な同義語を導入したり基の意味を損なったりする。

テスト結果は清潔な解決策がないことを示唆している。OpenAIが現在モデルからlogit_biasを削除したことは、このフィーチャーが保守に要する工学的努力ほど有用でないと判断された可能性をほのめかしている。OpenRouterのオープンおよびホストモデル全体にわたる広範なサポートは更なる実験の場を提供するが、プロバイダルーティングルールとパラメータ処理の不一致があり、ユーザーが各エンドポイントを個別にテストしない限りサポートは保証されない。開発者の知見は、AIの文章を人間らしく聞かせるにはおそらくAPIレベルで特定単語を抑制するのではなく、代わりにモデルを再トレーニングまたはファインチューニングして異なる表現スタイルを学習させる必要があることを示唆している。これはトークンブラックリストが解決できるより遙かに難しい問題である。

よくある質問

logit_biasとプロンプト内の単語ブラックリストの違いは?
logit_biasはAPIレベルで動作し、除外単語に対して数値ペナルティを加えてから次のトークンを選ぶため、それらの単語が選ばれるのは非常に難しくなるが完全ではない。プロンプトブラックリストはモデルへの指示であり、他の指示がより重要だと判断すれば無視またはオーバーライドできる。GPT-5.6 Solを使った実験ではプロンプトリスト方式で監視単語の出現を11から1に減らしたが、実験記事5本中2本が情報を削除・変更した一方、制御グループ5本は全て意味を保持した。
どの主要AIプロバイダがlogit_biasをサポートしているか?
テスト対象のOpenAI現在モデル(GPT-5.2~GPT-5.6を含む)はlogit_biasをサポートしておらず、unsupported_parameterエラーを返す。AnthropicのMessages APIはネイティブlogit_biasサポートを持たない。OpenRouterは2026年7月29日時点で115モデルがサポートしていると表示しており、DeepSeek V4 Flash、Llama 3.3 70B、Mistral Small 3.2 24Bを含むが、実際のサポートはプロバイダによって異なり、失敗することもある。
AI臭い単語を削除することで記事は改善したのか?
ブラックリスト有効な編集8本中6本が審査に合格(事実、固有名詞、文法を保持)し、制御グループの8本中7本と同じ合格率だった。バイアスは監視単語出現の約3分の1を削除したが、場合によっては不自然な代替表現(例:「That detail matters because…」を文法的に誤った「That details why…」に変更)をもたらし、散文がより高度に見えるよりむしろ低能に見える結果となった。

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます