Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

unite+1unitecryptobriefing+1OpenAI lanserade på onsdagen MentalHealthBench, ett öppet riktmärke bestående av 1 215 syntetiska samtal om psykisk hälsa. Verktyget har tagits fram tillsammans med över 80 legitimerade experter för att mäta hur AI-modeller svarar i scenarier som sträcker sig från vardaglig stress till akuta kriser.unite+1
Riktmärket, som OpenAI beskriver som ett sätt att fylla ett tomrum efter befintliga utvärderingar som främst fokuserar på nödsituationer, har skapats i samarbete med psykologer och psykiatriker från 22 länder. Dessa talar totalt 19 språk och representerar nästan 20 olika subspecialiteter inom psykisk hälsa. Datasetet innehåller 5 262 expertkriterier, och varje samtal har granskats av minst tre kliniker.openai+1
MentalHealthBench täcker icke-akuta vardagssamtal (53,5 procent), samtal om allvarliga psykiska hälsoproblem (18,2 procent) och nödsituationer som kräver omedelbar säkerhetsåtgärd (28,3 procent). Fyra användarprofiler finns representerade: vuxna (68,1 procent), tonåringar (21,2 procent), kliniker (5,8 procent) och vårdgivare (4,9 procent).unite+1
"Psykisk hälsa existerar på ett kontinuum, från välmående till vardagsstress och akuta kriser," säger Dr. Arthur Evans, VD för American Psychological Association, i OpenAIs tillkännagivande. "AI-system som interagerar med människor över hela detta spektrum måste vara förankrade i både klinisk vetenskap och levd erfarenhet."openai
Varje kriterium i bedömningsmallen har en vikt från -10 till +10, där positiva poäng belönar hjälpsamma beteenden och negativa poäng bestraffar skadliga sådana. En automatiserad granskare, GPT-5.6 Sol, bedömer modellernas svar utifrån expertkriterierna.unite+1
I OpenAIs utvärdering fick GPT-6 Astra högst poäng med 57,3 procent, följt av GPT-6 Sol med 53,9 procent, Claude Opus 5.5 med 52,4 procent och GPT-6 Luna med 50,2 procent. Äldre modeller presterade lägre, med GPT-4o på 32,1 procent och Googles Gemini 2.5 Pro på 29,5 procent.cryptobriefing+1
En separat analys med 44 vuxna från 16 länder som använt AI för stöd vid psykisk ohälsa visade att användare och experter värderade olika saker: användare betonade praktiska nästa steg och tonläge, medan kliniker prioriterade att samla in kontext och tolka tvetydiga situationer.unite+1
Vid sidan av riktmärket lyfter OpenAI fram en rad säkerhetsåtgärder som införts under de senaste månaderna. Detta inkluderar förstärkta svar i ChatGPT vid känsliga samtal, utökad tillgång till lokala krislinjer, funktionen Trusted Contact som introducerades i maj för att meddela en utsedd person vid tecken på allvarlig självskada, samt skydd för tonåringar gällande ätstörningar och självskadebeteende. OpenAI betonar att ChatGPT inte är en ersättning för terapi eller professionell vård.openai+2