
何が起きたか
OpenAIは、22カ国の80人超の公認メンタルヘルス専門家と共同で作成したオープンベンチマークMentalHealthBenchを公開。合成会話をもとに構築し、GPT‑5.6 Solが採点する。
なぜ重要か
AIがメンタルヘルスの状況を支援する能力が着実に向上していることを結果が示すとOpenAIは説明。研究者に専門家の知見を反映した共通の安全・有用性評価手段を提供する。
注目点
このベンチマークは専門的なケアの代替ではなく、個人的な会話のすべてを捉えるベンチマークは存在しないとOpenAIは述べており、スコアが実世界の安全策を反映しない可能性がある。
誰に効くかOpenAIの公開により、メンタルヘルス研究者、臨床医、AI開発者はモデルの応答をテストし比較する共通手段を得た。別途実施したユーザー分析は、感情支援にAIを使う人々が何を重視するかを加えている。
こういう要約が、毎朝あなたのメールに届きます。
MentalHealthBenchは、OpenAIが以前に臨床医の知見を得て取り組んだHealthBenchとHealthBench Professionalの成果を土台としている。会話は実世界の利用パターンを反映するようプライバシー保護技術を用いて作成され、一部のシナリオには家族の最近の死別といった背景情報が含まれ、モデルが文脈を適切に活用するかを試せるようにしている。各会話は少なくとも3人の専門家が確認し、基準は少なくとも2人が同意し3人目が否定しなかった場合にのみ採用された。したがってルーブリックは個人の意見ではなく専門家の共通判断を反映している。
ベンチマークは非急性・高急性・緊急のシナリオにわたり、成人、13〜17歳のティーン、介護者、臨床医を対象とする。OpenAIは別途、メンタルヘルスや感情支援にAIを使った16カ国の成人44人による分析も実施し、彼らの基準と専門家の指針を比較した。この分析はベンチマークの最終的な採点基準を変更しておらず、基準は専門家の合意に基づいたままである。
成否は、他の研究者や開発者がこのオープンベンチマークを使って課題を特定するかどうかにかかっている。OpenAIはこれを、助成金、Partnership on AIとの専門家招集、Transluceのメンタルヘルス評価への支援、危機対応リソースの拡充やTrusted Contact、ChatGPT for TeensといったChatGPTの変更と並ぶ広範な取り組みの一部と位置づける。単一のベンチマークがモデルの微妙な個人的会話への対応を変えられるかは、コミュニティがどれだけ広く採用するかにかかりそうだ。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Googleは9月23日、Gemini 3.8 Flash TTSとFlash-Lite TTSを発表した

Basecamp ResearchはS32主導のシリーズCで$140mを調達

OpenAIがGPT-6 Astraを公開

DeepMindトップ就任後初のメディア出演でKoray Kavukcuoglu氏はThe Informationに対し、Gemini 4は改良段階にあり年末より大幅に前倒しでの投入を目指すと語った

Croftは全アプリに応答時間追跡、エラーグループ化、7日間のログ、アラート、MCPツールを追加

ZuckerbergはConnectで、Museにデジタルアバターとのリアルタイムビデオ通話、スマートグラス連携、Mac上でのアプリ操作代行、専用メールアドレス取得を追加すると発表した
