AIToday
大規模言語モデルAI安全性・アラインメントZenn AI/ML掲載日時: 2026年10月4日 22:00

OpenAIが精神健康AI評価基準

LINEで送る
OpenAIが精神健康AI評価基準

3つのポイント

  1. 何が起きたか

    OpenAIが新モデルGPT-6.1 SolとともにMentalHealthBenchを公開。22カ国・19言語の専門家チームに80人超の心理学者・精神科医が参加した。

  2. なぜ重要か

    知識ではなく振る舞いを採点し、ユーザーの感情を読み文脈を尋ねる応答を高評価、押し付けや過度な指示を減点する。人に寄り添うAIエージェント評価への第一歩とされる。

  3. 注目点

    著者の『AI業界の転換点になる』との主張は意見でありOpenAIの発言ではない。AIがエージェント役割へ進む中、この評価手法が業界に広まるかが焦点だ。

誰に効くかこれはAI企業でアシスタント型モデルの評価方法を決めるプロダクト・安全チーム、そしてAI秘書やコーチ、チューターを構築するチームに影響する。そこでは能力のスコアよりもユーザーへの応答の振る舞いの方が重要になりうる。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

GPT-6.1 SolとMentalHealthBenchが同時期に公開されたことで、著者が対比する能力とインパクトの構図が生まれた。これまで生成AIの評価は、数学を解く、コードを書く、事実に正確に答える、推論するなど、モデルの賢さが中心だった。著者はその競争が成熟段階に入る一方、AIの社会的影響は単純な問答を超えたと論じる。

OpenAI自身、人間関係の悩み、ストレス対処、家族の問題、難しい決断などAIが使われる状況を列挙し、ChatGPTのユーザーは週10億人を超えるとしている。すると問いは答えが正しかったかではなく、その会話が人に何をもたらしたかになる。著者は人がAIに打ち明ける理由も挙げる。判断しない、いつでも応答する、関係に利害がなさそうに見えるからだ。

そう見ると、ユーザーの自律性を重んじるこのベンチマークは、有害コンテンツや幻覚の防止を超えたAI安全研究の次のテーマを指し示す。これが業界標準になるかは未知数で、歴史はモデルよりベンチマークを評価するという著者の判断も一つの見解にすぎない。だが示す方向性は、人と密接に働くAIエージェントを構築・導入する者にとって最も重要になりそうだ。

よくある質問
MentalHealthBenchは具体的に何を測るのか?
安全性、文脈理解、ユーザーの自律性の尊重、適切な支援といった振る舞いを採点する。感情を認識しユーザーが大切にすることを探る応答は高得点、結論を押し付けたり感情を決めつけたりする応答は減点される。
誰が構築したのか?
OpenAIが80人超の心理学者・精神科医と構築し、22カ国・19言語にわたる専門家チームを編成した。
OpenAIはなぜ作成したと説明しているか?
メンタルヘルスに関する会話をAIがどれだけうまく扱えるかを評価することが表向きの目的だ。記事の著者は、人の自立を損なわずに寄り添うAIエージェントの準備という、より広い狙いがあると論じる。
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へTSMC売上高1430億ドル