Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

unite+1unitecryptobriefing+1OpenAI lanserte onsdag MentalHealthBench, en åpen testmetodikk bestående av 1 215 syntetiske samtaler om psykisk helse. Verktøyet er utviklet sammen med over 80 autoriserte fagfolk for å måle hvordan AI-modeller responderer i alt fra hverdagslige utfordringer til akutte kriser.unite+1
Testen er utviklet for å tette et gap i eksisterende evalueringer, som ofte kun fokuserer på akutte nødsituasjoner. Den er skapt i samarbeid med psykologer og psykiatere fra 22 land som til sammen snakker 19 språk og representerer nesten 20 ulike fagfelt innen psykisk helse. Datasettet inneholder 5 262 ekspertvurderte kriterier, der hver samtale er vurdert av minst tre klinikere.openai+1
MentalHealthBench dekker ikke-akutte hverdagssamtaler (53,5 prosent), samtaler om alvorlige psykiske helseutfordringer (18,2 prosent) og nødsituasjoner som krever umiddelbar inngripen (28,3 prosent). Fire brukerprofiler er representert: voksne (68,1 prosent), tenåringer (21,2 prosent), klinikere (5,8 prosent) og omsorgspersoner (4,9 prosent).unite+1
"Psykisk helse eksisterer på et kontinuum, fra trivsel til hverdagslig stress og akutte kriser," uttalte Dr. Arthur Evans, administrerende direktør i American Psychological Association, i forbindelse med lanseringen. "AI-systemer som skal kommunisere med mennesker i dette spekteret må være forankret i både klinisk vitenskap og levd erfaring."openai
Hvert kriterium i vurderingsskjemaet er vektet fra -10 til +10, der positive poeng belønner hjelpsom atferd og negative poeng straffer skadelige svar. En automatisert sensor, GPT-5.6 Sol, vurderer modellens svar opp mot ekspertkriteriene.unite+1
I OpenAIs evaluering oppnådde GPT-6 Astra høyest score med 57,3 prosent, etterfulgt av GPT-6 Sol med 53,9 prosent, Claude Opus 5.5 med 52,4 prosent og GPT-6 Luna med 50,2 prosent. Eldre modeller skåret lavere, med GPT-4o på 32,1 prosent og Googles Gemini 2.5 Pro på 29,5 prosent.cryptobriefing+1
En separat analyse med 44 voksne fra 16 land som har brukt AI for støtte ved psykiske plager, viste at brukere og eksperter vektlegger ulike ting: Brukere prioriterte praktiske råd og tonefall, mens klinikere prioriterte å innhente kontekst og tolke tvetydige situasjoner.unite+1
Sammen med den nye testen peker OpenAI på en rekke sikkerhetstiltak som er innført de siste månedene. Dette inkluderer forbedrede svar i ChatGPT ved sensitive samtaler, utvidet tilgang til lokale krisetelefoner, funksjonen "Trusted Contact" som varsler en utpekt person ved tegn til alvorlig selvskading, samt egne beskyttelsestiltak for tenåringer knyttet til spiseforstyrrelser og selvskading. OpenAI understreker at ChatGPT ikke er en erstatning for terapi eller profesjonell helsehjelp.openai+2