Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

unite+1unitecryptobriefing+1OpenAI lanzó el miércoles MentalHealthBench, un estándar abierto compuesto por 1,215 conversaciones sintéticas sobre salud mental, desarrollado junto a más de 80 profesionales licenciados para medir cómo responden los modelos de IA en escenarios que van desde el estrés diario hasta crisis urgentes.unite+1
La herramienta, que según OpenAI cubre un vacío dejado por evaluaciones previas centradas solo en emergencias, fue creada con psicólogos y psiquiatras de 22 países que hablan 19 idiomas y representan casi 20 subespecialidades. El conjunto de datos incluye 5,262 criterios redactados por expertos, y cada conversación fue revisada por al menos tres clínicos.openai+1
MentalHealthBench abarca conversaciones cotidianas no agudas (53.5%), conversaciones de alta intensidad sobre problemas graves (18.2%) y emergencias que requieren intervención inmediata (28.3%). Se representan cuatro perfiles de usuario: adultos (68.1%), adolescentes (21.2%), clínicos (5.8%) y cuidadores (4.9%).unite+1
"La salud mental existe en un continuo, desde el bienestar y el estrés cotidiano hasta la crisis aguda", afirmó el Dr. Arthur Evans, director ejecutivo de la Asociación Americana de Psicología, en el anuncio de OpenAI. "Los sistemas de IA que interactúan con personas en ese rango deben basarse tanto en la ciencia clínica como en la experiencia vivida".openai
Cada criterio tiene un peso de -10 a +10, donde las puntuaciones positivas premian comportamientos útiles y las negativas penalizan los dañinos. Un evaluador automatizado, GPT-5.6 Sol, analiza las respuestas de los modelos frente a los criterios de los expertos.unite+1
En la evaluación de OpenAI, GPT-6 Astra obtuvo la puntuación más alta con un 57.3%, seguido por GPT-6 Sol con un 53.9%, Claude Opus 5.5 con un 52.4% y GPT-6 Luna con un 50.2%. Los modelos más antiguos obtuvieron resultados inferiores, con GPT-4o al 32.1% y Gemini 2.5 Pro de Alphabet Inc. al 29.5%.cryptobriefing+1
Un análisis separado con 44 adultos de 16 países que han usado IA para apoyo en salud mental reveló que usuarios y expertos valoran cosas distintas: los usuarios enfatizan los pasos prácticos y el tono, mientras que los clínicos priorizan la recopilación de contexto y la interpretación de situaciones ambiguas.unite+1
Junto con este estándar, OpenAI destacó una serie de medidas de seguridad implementadas recientemente, incluyendo respuestas reforzadas en ChatGPT para temas sensibles, acceso ampliado a líneas de crisis locales, la función de Contacto de Confianza introducida en mayo que notifica a una persona designada si se detectan riesgos de autolesión, y ChatGPT para adolescentes con protecciones específicas. OpenAI enfatizó que ChatGPT no sustituye la terapia ni la atención profesional.openai+2