AIToday
大規模言語モデルヘルスケアAIAI安全性・アラインメントOpenAI Blog掲載日時: 2026年9月24日 6:00

OpenAIがMentalHealthBench公開

LINEで送る
OpenAIがMentalHealthBench公開

3つのポイント

  1. 何が起きたか

    OpenAIは、22カ国の80人超の公認メンタルヘルス専門家と共同で作成したオープンベンチマークMentalHealthBenchを公開。合成会話をもとに構築し、GPT‑5.6 Solが採点する。

  2. なぜ重要か

    AIがメンタルヘルスの状況を支援する能力が着実に向上していることを結果が示すとOpenAIは説明。研究者に専門家の知見を反映した共通の安全・有用性評価手段を提供する。

  3. 注目点

    このベンチマークは専門的なケアの代替ではなく、個人的な会話のすべてを捉えるベンチマークは存在しないとOpenAIは述べており、スコアが実世界の安全策を反映しない可能性がある。

誰に効くかOpenAIの公開により、メンタルヘルス研究者、臨床医、AI開発者はモデルの応答をテストし比較する共通手段を得た。別途実施したユーザー分析は、感情支援にAIを使う人々が何を重視するかを加えている。

わからないところ、AIに聞けます

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

MentalHealthBenchは、OpenAIが以前に臨床医の知見を得て取り組んだHealthBenchとHealthBench Professionalの成果を土台としている。会話は実世界の利用パターンを反映するようプライバシー保護技術を用いて作成され、一部のシナリオには家族の最近の死別といった背景情報が含まれ、モデルが文脈を適切に活用するかを試せるようにしている。各会話は少なくとも3人の専門家が確認し、基準は少なくとも2人が同意し3人目が否定しなかった場合にのみ採用された。したがってルーブリックは個人の意見ではなく専門家の共通判断を反映している。

ベンチマークは非急性・高急性・緊急のシナリオにわたり、成人、13〜17歳のティーン、介護者、臨床医を対象とする。OpenAIは別途、メンタルヘルスや感情支援にAIを使った16カ国の成人44人による分析も実施し、彼らの基準と専門家の指針を比較した。この分析はベンチマークの最終的な採点基準を変更しておらず、基準は専門家の合意に基づいたままである。

成否は、他の研究者や開発者がこのオープンベンチマークを使って課題を特定するかどうかにかかっている。OpenAIはこれを、助成金、Partnership on AIとの専門家招集、Transluceのメンタルヘルス評価への支援、危機対応リソースの拡充やTrusted Contact、ChatGPT for TeensといったChatGPTの変更と並ぶ広範な取り組みの一部と位置づける。単一のベンチマークがモデルの微妙な個人的会話への対応を変えられるかは、コミュニティがどれだけ広く採用するかにかかりそうだ。

よくある質問
MentalHealthBenchは誰が作成したか?
22カ国の80人超の公認メンタルヘルス専門家が共同で作成した。19言語を話す心理学者や精神科医が含まれる。
モデルの応答はどのように採点されるか?
自動採点器GPT‑5.6 Solが、専門家が作成した基準に照らして応答を評価する。各基準は臨床的な重要性に応じて-10から+10の重みが付けられている。
有用性についてユーザーと専門家の見解は一致したか?
ユーザーは実践的な次のステップと語調を重視した一方、専門家は文脈の収集と曖昧な状況の解釈をより重視した。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Gemini 3.8 Flash TTS 音声生成ITmedia AI+ · 2時間前
  • OpenAI、GPT-6 Astra公開Last Week in AI · 2時間前
  • Kavukcuoglu氏、Gemini 4は「大幅に前倒し」で投入へThe Verge AI · 2時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

大規模言語モデルの中では、どれくらい大きい話?
この記事では、MentalHealthBenchが大規模言語モデル全体の中でどれほどの位置づけ・規模を持つかという比較は示されていません。記事で言及されているのは、OpenAIが22カ国・80人超の専門家と共同でこのオープンベンチマークを作成したこと、そして複数のモデルを評価した結果が示されているという点です。ただし、評価対象となった各モデルの具体的な名前や規模の比較、業界全体での相対的な位置づけについては記述がありません。この記事には書かれていませんが、関連情報として「AIのメンタルヘルス対応能力が着実に向上していることを結果が示す」とOpenAIが説明している点は挙げられます。

AITodayのAIによる回答AKIRA6時間前

関連記事

次の記事へソフトバンク110億ドル調達