米OpenAIはメンタルヘルスに関するAI応答を評価する新たなオープンベンチマーク「MentalHealthBench」を発表した。
22か国の専門家80人超と開発し、安全性や主体性への配慮などを多面的に測定する。
専門家80人超とAIの心の支援を評価
OpenAIが2026年9月23日に発表したMentalHealthBenchは、メンタルヘルスに関する実際の状況を想定し、AIがどの程度適切に応答できるかを測定するオープンベンチマーク(※)である。
従来の評価は緊急事態で禁止された応答を避けられるかという安全面に重点を置く傾向があり、日常的な悩みから深刻な危機までを横断した評価は十分ではなかった。
開発には22か国から集まった有資格の心理職や精神科医など80人超が参加し、19言語、約20の専門領域をカバーした。
成人、13〜17歳の若者、介護・養育者、臨床家という4種類の利用者を想定した合成会話を用い、非急性、高い緊急度、緊急事態という幅広い状況を収録している。
専門家は各会話について、モデルが含めるべき対応と避けるべき対応を採点基準として定義した。
各対話は少なくとも3人が確認し、全員が承認した基準のみを採用しており、モデルの応答はGPT-5.6 Solを用いて自動採点される。
OpenAIは利用者側の視点も分析した。16か国、14言語の成人44人を対象に非急性の会話を評価した結果、利用者は実践的な次の一歩や口調を重視する一方、臨床家は状況把握や曖昧な情報の慎重な解釈をより重視する傾向が確認された。
同社は同時に、ChatGPTがセラピーや専門的な医療・ケアの代替にはならないと明示している。
さらに、繊細な会話への応答強化や危機対応リソースへのアクセス拡充、信頼できる連絡先、若年層向け保護機能を備えたChatGPT for Teensなども進めている。
※オープンベンチマーク:AIモデルの性能や挙動を共通条件で比較・検証するため、評価方法やデータなどを研究者や開発者が利用できる形で公開した評価基盤。
AI相談の質向上へ、評価基盤の活用が焦点
MentalHealthBenchの意義は、AIが危険な回答を避けるだけでなく、利用者の状況に応じて適切な支援につながる応答をどこまで実現できるかを詳細に確認できる点にある。
総合スコアに加え、メンタルヘルス専門家が定義した10の行動領域へ分解して評価できるため、モデルごとの強みや改善点を把握しやすくなる。
特に重要なのは、専門家が望ましい対応を一律に定めるだけでなく、利用者が実際に何を有用と感じるかも比較対象に含めている点だ。
臨床的な妥当性と、相談相手としての分かりやすさや実用性には必ずしも一致しない部分があり、今後のモデル開発では両者をどう両立するかが課題となる。
一方、ベンチマークはAIによる応答の質を測る共通基準にはなるものの、個人ごとの背景や文化、置かれた環境まで完全に捉えられるわけではない。
高得点を得たモデルであっても、現実の専門家による診断や治療、緊急時の支援を代替できることを意味しない点には注意が必要だ。
MentalHealthBenchが公開されたことで、OpenAI以外の研究者やモデル提供元も同じ枠組みを用いた検証を進めやすくなる。
今後は第三者による評価や改善点の発見が積み重なることで、AIによるメンタルヘルス支援の安全性と有用性を継続的に高められるかが焦点となりそうだ。
関連記事:
熊本市が「悩み相談AI」導入 24時間対応でメンタル支援はどう変わるか

OpenAI、計算生物学AIの新ベンチマーク発表 研究「センス」を測るGeneBench-Pro

オープンAI、健康アプリ連携で「チャットGPTヘルス」提供開始
