Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

unite+1unitecryptobriefing+1OpenAI hat am Mittwoch MentalHealthBench veröffentlicht, einen offenen Benchmark aus 1 215 synthetischen Gesprächen zur psychischen Gesundheit. Das Tool wurde mit über 80 lizenzierten Fachleuten entwickelt, um zu messen, wie KI-Modelle auf eine Reihe von Szenarien reagieren, die von alltäglichem Stress bis hin zu akuten Krisen reichen.unite+1
Der Benchmark, den OpenAI als Ergänzung zu bestehenden Bewertungen sieht, die sich primär auf Notfallszenarien konzentrieren, wurde gemeinsam mit Psychologen und Psychiatern aus 22 Ländern erstellt. Diese sprechen zusammen 19 Sprachen und decken fast 20 Teilgebiete der psychischen Gesundheit ab. Der Datensatz umfasst 5 262 von Experten verfasste Kriterien, wobei jedes Gespräch von mindestens drei Klinikern überprüft wurde.openai+1
MentalHealthBench deckt nicht-akute Alltagsgespräche (53,5 Prozent), hochakute Gespräche mit ernsthaften psychischen Problemen (18,2 Prozent) und Notfälle ab, die ein sofortiges Eingreifen erfordern (28,3 Prozent). Es sind vier Nutzerprofile vertreten: Erwachsene (68,1 Prozent), Teenager (21,2 Prozent), Kliniker (5,8 Prozent) und Betreuer (4,9 Prozent).unite+1
"Psychische Gesundheit existiert auf einem Kontinuum, von Wohlbefinden über Alltagsstress bis hin zur akuten Krise", sagte Dr. Arthur Evans, CEO der American Psychological Association, in der Ankündigung von OpenAI. "KI-Systeme, die Menschen in diesem Bereich unterstützen, müssen sowohl in der klinischen Wissenschaft als auch in der gelebten Erfahrung verankert sein."openai
Jedes Kriterium ist mit einem Gewicht von -10 bis +10 versehen, wobei positive Werte hilfreiches Verhalten belohnen und negative Werte schädliche Antworten bestrafen. Ein automatisierter Bewerter, GPT-5.6 Sol, beurteilt die Antworten der Modelle anhand der von Experten erstellten Kriterien.unite+1
In der Auswertung von OpenAI erzielte GPT-6 Astra mit 57,3 Prozent das höchste Ergebnis, gefolgt von GPT-6 Sol mit 53,9 Prozent, Claude Opus 5.5 mit 52,4 Prozent und GPT-6 Luna mit 50,2 Prozent. Ältere Modelle schnitten schlechter ab, mit GPT-4o bei 32,1 Prozent und Googles Gemini 2.5 Pro bei 29,5 Prozent.cryptobriefing+1
Eine separate Analyse mit 44 Erwachsenen aus 16 Ländern, die KI zur Unterstützung bei psychischen Problemen genutzt hatten, ergab, dass Nutzer und Experten unterschiedliche Prioritäten setzen: Nutzer legten Wert auf praktische nächste Schritte und den Tonfall, während Kliniker die Erfassung von Kontext und die Interpretation mehrdeutiger Situationen priorisierten.unite+1
Neben dem Benchmark verwies OpenAI auf eine Reihe von Sicherheitsmaßnahmen, die in den letzten Monaten eingeführt wurden. Dazu gehören verbesserte ChatGPT-Antworten bei sensiblen Gesprächen, ein erweiterter Zugang zu lokalen Krisen-Hotlines, die im Mai eingeführte Funktion "Trusted Contact", die eine benannte Person bei Anzeichen von ernsthafter Selbstgefährdung informiert, sowie Schutzmaßnahmen für Teenager in Bereichen wie Selbstverletzung und Essstörungen. OpenAI betont, dass ChatGPT kein Ersatz für eine Therapie oder professionelle Behandlung ist.openai+2