MentalHealthBench evalúa respuestas de IA en conversaciones realistas sobre bienestar y crisis mediante criterios creados por más de ochenta profesionales de salud mental.
OpenAI ha publicado MentalHealthBench, un conjunto abierto de pruebas para medir cómo responden los sistemas de inteligencia artificial en conversaciones relacionadas con salud mental.
El benchmark fue creado con más de ochenta psicólogos y psiquiatras con licencia de veintidós países, diecinueve idiomas y cerca de veinte especialidades clínicas.
Las situaciones incluyen conversaciones cotidianas con componentes emocionales, casos de malestar grave y emergencias que requieren ayuda inmediata fuera de la aplicación. También representan a adultos, adolescentes, cuidadores y profesionales sanitarios.
Cada conversación utiliza criterios específicos redactados por especialistas. Se puntúan comportamientos como pedir contexto, respetar la capacidad de decisión de la persona, ofrecer pasos prácticos y orientar hacia apoyo real cuando corresponde.
Cada caso fue revisado por al menos tres expertos y solo se conservaron los criterios respaldados por consenso. OpenAI también comparó las valoraciones profesionales con las de personas que habían utilizado IA para recibir apoyo emocional.
MentalHealthBench se publica como recurso abierto para que otros investigadores puedan examinar el método, evaluar sus modelos y detectar carencias. OpenAI recuerda que ChatGPT no sustituye a la terapia ni a la atención profesional.