Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

unite+1unitecryptobriefing+1Trečiadienį „OpenAI“ pristatė „MentalHealthBench“ – atvirą 1 215 sintetinių psichinės sveikatos pokalbių vertinimo sistemą, sukurtą bendradarbiaujant su daugiau nei 80 licencijuotų psichikos sveikatos specialistų. Sistema skirta įvertinti, kaip dirbtinio intelekto modeliai reaguoja į įvairias situacijas – nuo kasdienio streso iki skubių krizių.unite+1
Ši vertinimo sistema, kurią „OpenAI“ apibūdino kaip spragą užpildantį įrankį, nes ankstesni vertinimai daugiausia dėmesio skyrė tik skubios pagalbos scenarijams, buvo sukurta kartu su licencijuotais psichologais ir psichiatrais iš 22 šalių. Jie kalba 19 kalbų ir atstovauja beveik 20 psichikos sveikatos subspecialybių. Duomenų rinkinį sudaro 5 262 ekspertų parengti vertinimo kriterijai, o kiekvieną pokalbį peržiūrėjo bent trys klinicistai.openai+1
„MentalHealthBench“ apima neūmius kasdienius pokalbius (53,5 proc.), didelio intensyvumo pokalbius dėl rimtų psichinės sveikatos problemų (18,2 proc.) ir skubios pagalbos atvejus, reikalaujančius nedelsiant įsikišti dėl saugumo (28,3 proc.). Atstovaujami keturi vartotojų profiliai: suaugusieji (68,1 proc.), paaugliai (21,2 proc.), klinicistai (5,8 proc.) ir globėjai (4,9 proc.).unite+1
„Psichinė sveikata egzistuoja kontinuume – nuo klestėjimo iki kasdienio streso ir ūmios krizės“, – „OpenAI“ pranešime teigė Amerikos psichologų asociacijos generalinis direktorius dr. Arthuras Evansas. „Dirbtinio intelekto sistemos, bendraujančios su žmonėmis šiame diapazone, turi būti pagrįstos tiek klinikiniu mokslu, tiek gyvenimiška patirtimi.“openai
Kiekvienas vertinimo kriterijus turi svorį nuo -10 iki +10, kur teigiami balai skatina naudingą elgesį, o neigiami – baudžia už žalingą. Automatizuotas vertintojas „GPT-5.6 Sol“ vertina modelių atsakymus pagal ekspertų nustatytus kriterijus.unite+1
„OpenAI“ vertinimu, „GPT-6 Astra“ surinko daugiausiai taškų (57,3 proc.), po jos sekė „GPT-6 Sol“ (53,9 proc.), „Claude Opus 5.5“ (52,4 proc.) ir „GPT-6 Luna“ (50,2 proc.). Senesni modeliai surinko mažiau taškų: „GPT-4o“ – 32,1 proc., o „Alphabet Inc.“ „Gemini 2.5 Pro“ – 29,5 proc.cryptobriefing+1
Atskira analizė, kurioje dalyvavo 44 suaugusieji iš 16 šalių, naudoję dirbtinį intelektą psichinės sveikatos palaikymui, parodė, kad vartotojų ir ekspertų vertinimai skiriasi: vartotojai pabrėžė praktinius tolesnius veiksmus ir toną, o klinicistai pirmenybę teikė konteksto rinkimui ir dviprasmiškų situacijų interpretavimui.unite+1
Kartu su vertinimo sistema „OpenAI“ pabrėžė pastaraisiais mėnesiais įdiegtas saugumo priemones, įskaitant sustiprintus „ChatGPT“ atsakymus jautriuose pokalbiuose, išplėstą prieigą prie vietinių krizių linijų, gegužę pristatytą „Trusted Contact“ funkciją, kuri praneša paskirtam asmeniui, jei aptinkama rimtų minčių apie savižalą, bei „ChatGPT for Teens“ su apsaugos priemonėmis, apimančiomis savižalos ir valgymo sutrikimų sritis. „OpenAI“ pabrėžė, kad „ChatGPT“ nėra terapijos ar profesionalios priežiūros pakaitalas.openai+2