Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

unite+1unitecryptobriefing+1OpenAI a lancé mercredi MentalHealthBench, un référentiel ouvert composé de 1 215 conversations synthétiques sur la santé mentale, élaboré avec plus de 80 professionnels agréés pour mesurer la manière dont les modèles d'IA réagissent dans des scénarios allant du stress quotidien aux crises urgentes.unite+1
L'outil, qui selon OpenAI comble une lacune des évaluations existantes centrées principalement sur les urgences, a été co-créé avec des psychologues et psychiatres de 22 pays parlant 19 langues et représentant près de 20 sous-spécialités. Le jeu de données comprend 5 262 critères rédigés par des experts, chaque conversation ayant été examinée par au moins trois cliniciens.openai+1
MentalHealthBench couvre les conversations quotidiennes non aiguës (53,5 %), les conversations à haute intensité impliquant des problèmes graves (18,2 %) et les urgences nécessitant une intervention immédiate (28,3 %). Quatre profils d'utilisateurs sont représentés : adultes (68,1 %), adolescents (21,2 %), cliniciens (5,8 %) et aidants (4,9 %).unite+1
"La santé mentale s'inscrit dans un continuum, allant de l'épanouissement au stress quotidien jusqu'à la crise aiguë", a déclaré le Dr Arthur Evans, PDG de l'American Psychological Association, dans l'annonce d'OpenAI. "Les systèmes d'IA qui interagissent avec les gens sur cette échelle doivent être fondés à la fois sur la science clinique et sur l'expérience vécue".openai
Chaque critère est pondéré de -10 à +10, les scores positifs récompensant les comportements utiles et les scores négatifs pénalisant les comportements nuisibles. Un évaluateur automatisé, GPT-5.6 Sol, analyse les réponses des modèles par rapport aux critères des experts.unite+1
Dans l'évaluation d'OpenAI, GPT-6 Astra a obtenu le score le plus élevé avec 57,3 %, suivi de GPT-6 Sol avec 53,9 %, Claude Opus 5.5 avec 52,4 % et GPT-6 Luna avec 50,2 %. Les modèles plus anciens ont obtenu des scores inférieurs, avec GPT-4o à 32,1 % et Gemini 2.5 Pro d'Alphabet Inc. à 29,5 %.cryptobriefing+1
Une analyse distincte menée auprès de 44 adultes de 16 pays ayant utilisé l'IA pour un soutien en santé mentale a révélé une divergence entre les utilisateurs et les experts : les utilisateurs privilégient les étapes pratiques et le ton, tandis que les cliniciens donnent la priorité à la collecte de contexte et à l'interprétation des situations ambiguës.unite+1
Parallèlement à ce référentiel, OpenAI a souligné une série de mesures de sécurité déployées ces derniers mois, notamment le renforcement des réponses de ChatGPT dans les conversations sensibles, l'accès élargi aux lignes d'urgence locales, la fonction Contact de confiance introduite en mai qui avertit une personne désignée en cas de risque d'automutilation, et ChatGPT pour les adolescents avec des protections spécifiques. OpenAI a souligné que ChatGPT ne remplace pas une thérapie ou des soins professionnels.openai+2