Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

unite+1unitecryptobriefing+1OpenAI julkaisi keskiviikkona MentalHealthBench-työkalun, joka sisältää 1 215 synteettistä mielenterveyskeskustelua. Se on kehitetty yhteistyössä yli 80 laillistetun mielenterveysalan ammattilaisen kanssa mittaamaan, miten tekoälymallit vastaavat tilanteisiin arjen stressistä akuutteihin kriiseihin.unite+1
Työkalu, jonka OpenAI kuvailee täyttävän aiemmin vain hätätilanteisiin keskittyneissä arvioinneissa olleen aukon, luotiin yhdessä 22 maasta kotoisin olevien psykologien ja psykiatrien kanssa. He edustavat 19 kieltä ja lähes 20 mielenterveyden erikoisalaa. Aineisto sisältää 5 262 asiantuntijoiden laatimaa kriteeriä, ja jokaisen keskustelun on tarkistanut vähintään kolme kliinikkoa.openai+1
MentalHealthBench kattaa ei-akuutit arkipäivän keskustelut (53,5 %), vakavia mielenterveysongelmia koskevat keskustelut (18,2 %) ja välitöntä turvallisuusinterventiota vaativat hätätilanteet (28,3 %). Mukana on neljä käyttäjäprofiilia: aikuiset (68,1 %), teini-ikäiset (21,2 %), kliinikot (5,8 %) ja omaishoitajat (4,9 %).unite+1
"Mielenterveys on jatkumo, joka ulottuu hyvinvoinnista ja arjen stressistä akuuttiin kriisiin", sanoi American Psychological Associationin toimitusjohtaja tohtori Arthur Evans OpenAI:n tiedotteessa. "Tekoälyjärjestelmien, jotka kohtaavat ihmisiä tällä välillä, on perustuttava sekä kliiniseen tieteeseen että elettyyn kokemukseen."openai
Jokaisella kriteerillä on -10 ja +10 välillä oleva painoarvo, jossa positiiviset pisteet palkitsevat hyödyllisestä toiminnasta ja negatiiviset pisteet rankaisevat haitallisesta. Automaattinen arvioija, GPT-5.6 Sol, pisteyttää mallien vastaukset asiantuntijoiden kirjoittamien kriteerien perusteella.unite+1
OpenAI:n arvioinnissa GPT-6 Astra sai korkeimmat pisteet (57,3 %), seuraavina olivat GPT-6 Sol (53,9 %), Claude Opus 5.5 (52,4 %) ja GPT-6 Luna (50,2 %). Vanhemmat mallit pärjäsivät heikommin: GPT-4o sai 32,1 % ja Alphabet Inc:n Gemini 2.5 Pro 29,5 %.cryptobriefing+1
Erillinen tutkimus, johon osallistui 44 aikuista 16 maasta, osoitti käyttäjien ja asiantuntijoiden arvostavan eri asioita: käyttäjät painottivat käytännön askelia ja sävyä, kun taas kliinikot pitivät tärkeimpänä kontekstin keräämistä ja epäselvien tilanteiden tulkintaa.unite+1
Vertailukohdan ohella OpenAI nosti esiin viime kuukausina käyttöön otettuja turvatoimia, kuten ChatGPT:n vahvistetut vastaukset arkaluonteisissa keskusteluissa, laajennetun pääsyn paikallisiin kriisipuhelimiin, toukokuussa esitellyn Trusted Contact -ominaisuuden, joka ilmoittaa nimetylle henkilölle vakavista itsetuhoisuuden merkeistä, sekä teini-ikäisille suunnatun ChatGPT:n suojaukset. OpenAI korosti, ettei ChatGPT korvaa terapiaa tai ammatillista hoitoa.openai+2