OpenAI、メンタルヘルス関連の対話を評価する基準「MentalHealthBench」を公開

記事
IT・テクノロジー
OpenAIは2026年9月23日、AIモデルによるメンタルヘルス関連の対応を評価するための基準「MentalHealthBench」を公開したと発表した。22か国から参加した資格を持つメンタルヘルスの専門家80人超(約20の専門分野、19言語)と共同で開発したという。

このベンチマークは、日常的なストレスに関する会話から、緊急性の高い深刻な相談まで、3段階の緊急度にまたがる合成対話(実在の相談ではなく評価用に作成された会話)を対象とする。評価対象には成人だけでなく、13〜17歳の未成年者、家族等の介護者、臨床従事者向けの会話も含まれる。評価の観点としては、本人の意思決定の尊重、状況・背景の丁寧な確認、安全性への配慮、状況に応じた具体的な行動支援などが挙げられている。

採点の仕組みは、専門家が作成した採点基準(マイナス10からプラス10までの重み付け)に基づく。各会話は少なくとも3人の専門家がレビューし、2人以上が一致し、かつ3人目が明確に反対していない基準のみを採点に採用したという。実際の自動採点には、OpenAIの別モデル「GPT-5.6 Sol」が使われているとされる。

これとは別に、16か国・14言語の利用経験者44人を対象にした調査も紹介されている。この調査は、利用者と専門家それぞれの視点を比較する目的で、緊急性の低い日常会話を対象に実施されたもので、利用者は専門家よりも「具体的な次の一歩」や「話し方・トーン」を重視する傾向が見られたという。ただし、この調査結果によってベンチマーク自体の最終的な採点基準が変更されたわけではないと明記されている。

OpenAIは、ChatGPTは専門的な治療やケアの代替ではないと説明している。この評価が測るのは、合成会話の最後のユーザー発言に対するモデルの応答であり、実際の治療成績や長期的な健康への影響ではない。

同社は研究者が検証・活用できるオープンなベンチマークとして案内し、論文を公開している。ただし、今回の確認ではデータセットと採点コードの具体的な配布先を特定できなかった。

出典(2026年9月24日確認)

OpenAI公式発表「Introducing MentalHealthBench」(2026年9月23日)

OpenAI論文「MentalHealthBench: A Comprehensive Benchmark of AI Capabilities in Realistic Mental Health Conversations」
サービス数40万件のスキルマーケット、あなたにぴったりのサービスを探す