Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

unite+1unitecryptobriefing+1Společnost OpenAI ve středu představila MentalHealthBench, otevřený benchmark obsahující 1 215 syntetických konverzací o duševním zdraví. Tento nástroj byl vytvořen ve spolupráci s více než 80 licencovanými odborníky na duševní zdraví, aby změřil, jak modely umělé inteligence reagují v různých scénářích, od každodenního stresu až po urgentní krize.unite+1
Benchmark, který OpenAI popisuje jako řešení nedostatku v existujících hodnoceních zaměřených primárně na krizové situace, vznikl ve spolupráci s psychology a psychiatry z 22 zemí. Tito odborníci hovoří celkem 19 jazyky a zastupují téměř 20 podoborů duševního zdraví. Datová sada obsahuje 5 262 kritérií vytvořených experty, přičemž každá konverzace byla posouzena nejméně třemi klinickými pracovníky.openai+1
MentalHealthBench pokrývá běžné neakutní konverzace (53,5 %), vysoce akutní konverzace zahrnující vážné problémy s duševním zdravím (18,2 %) a krizové situace vyžadující okamžitý zásah (28,3 %). Zahrnuty jsou čtyři uživatelské profily: dospělí (68,1 %), dospívající (21,2 %), klinici (5,8 %) a pečovatelé (4,9 %).unite+1
„Duševní zdraví existuje na kontinuu, od duševní pohody přes každodenní stres až po akutní krizi,“ uvedl v oznámení OpenAI Dr. Arthur Evans, generální ředitel Americké psychologické asociace. „Systémy umělé inteligence, které s lidmi v tomto rozsahu komunikují, musí vycházet jak z klinické vědy, tak ze skutečných zkušeností.“openai
Každé hodnotící kritérium má váhu od -10 do +10, přičemž kladné skóre odměňuje užitečné chování a záporné penalizuje to škodlivé. Automatizovaný hodnotitel, GPT-5.6 Sol, posuzuje odpovědi modelů podle kritérií napsaných odborníky.unite+1
V hodnocení OpenAI dosáhl nejvyššího skóre GPT-6 Astra (57,3 %), následovaný GPT-6 Sol (53,9 %), Claude Opus 5.5 (52,4 %) a GPT-6 Luna (50,2 %). Starší modely dosáhly nižších výsledků, GPT-4o získal 32,1 % a Gemini 2.5 Pro od společnosti Alphabet Inc. 29,5 %.cryptobriefing+1
Samostatná analýza se 44 dospělými ze 16 zemí, kteří využívali AI pro podporu duševního zdraví, ukázala, že uživatelé a odborníci se v prioritách rozcházejí: uživatelé kladli důraz na praktické další kroky a tón komunikace, zatímco klinici upřednostňovali získávání kontextu a interpretaci nejednoznačných situací.unite+1
Společně s benchmarkem OpenAI upozornila na řadu bezpečnostních opatření, která v posledních měsících zavedla. Patří mezi ně posílené odpovědi ChatGPT v citlivých konverzacích, rozšířený přístup k lokálním krizovým linkám, funkce Trusted Contact představená v květnu, která upozorní určenou osobu v případě detekce vážných obav ze sebepoškozování, a ChatGPT pro dospívající s ochranou v oblastech, jako je sebepoškozování a poruchy příjmu potravy. OpenAI zdůraznila, že ChatGPT není náhradou terapie nebo odborné péče.openai+2