Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

unite+1unitecryptobriefing+1OpenAI, Çarşamba günü, yapay zeka modellerinin günlük stresten acil krizlere kadar çeşitli senaryolarda nasıl yanıt verdiğini ölçmek için 80'den fazla lisanslı ruh sağlığı uzmanıyla birlikte oluşturulan 1,215 sentetik ruh sağlığı konuşmasından oluşan açık bir kıyaslama aracı olan MentalHealthBench'i yayınladı.unite+1
OpenAI'ın, öncelikle acil durum senaryolarına odaklanan mevcut değerlendirmelerin bıraktığı boşluğu doldurduğunu belirttiği bu kıyaslama aracı, 19 dilde konuşan ve yaklaşık 20 ruh sağlığı alt uzmanlık alanını temsil eden 22 ülkeden lisanslı psikologlar ve psikiyatristlerle birlikte oluşturuldu. Veri seti 5,262 uzman tarafından yazılmış kriteri içeriyor ve her konuşma en az üç klinisyen tarafından gözden geçirildi.openai+1
MentalHealthBench, akut olmayan günlük konuşmaları (%53.5), ciddi ruh sağlığı sorunlarını içeren yüksek yoğunluklu konuşmaları (%18.2) ve acil güvenlik müdahalesi gerektiren durumları (%28.3) kapsıyor. Dört kullanıcı profili temsil ediliyor: yetişkinler (%68.1), gençler (%21.2), klinisyenler (%5.8) ve bakım verenler (%4.9).unite+1
OpenAI'ın duyurusunda Amerikan Psikoloji Derneği CEO'su Dr. Arthur Evans, "Ruh sağlığı, gelişmekten günlük strese ve akut krize kadar bir süreklilik üzerinde var olur" dedi. "İnsanlarla bu aralıkta etkileşime giren yapay zeka sistemlerinin hem klinik bilime hem de yaşanmış deneyime dayandırılması gerekiyor."openai
Her kriter -10 ile +10 arasında bir ağırlığa sahip; pozitif puanlar yararlı davranışları ödüllendirirken negatif puanlar zararlı olanları cezalandırıyor. Otomatik bir derecelendirici olan GPT-5.6 Sol, model yanıtlarını uzmanlar tarafından yazılan kriterlere göre değerlendiriyor.unite+1
OpenAI'ın değerlendirmesinde GPT-6 Astra %57.3 ile en yüksek puanı alırken, onu %53.9 ile GPT-6 Sol, %52.4 ile Claude Opus 5.5 ve %50.2 ile GPT-6 Luna takip etti. Daha eski modeller daha düşük puanlar aldı; GPT-4o %32.1 ve Google'ın Alphabet Inc. Gemini 2.5 Pro modeli %29.5 puan elde etti.cryptobriefing+1
Ruh sağlığı desteği için yapay zeka kullanan 16 ülkeden 44 yetişkinle yapılan ayrı bir analiz, kullanıcılar ve uzmanların değer verdikleri konularda ayrıştığını ortaya koydu: kullanıcılar pratik adımlara ve tona önem verirken, klinisyenler bağlam toplamaya ve belirsiz durumları yorumlamaya öncelik verdi.unite+1
Kıyaslama aracıyla birlikte OpenAI, son aylarda kullanıma sunduğu bir dizi ilgili güvenlik önlemine dikkat çekti. Bunlar arasında hassas konuşmalarda güçlendirilmiş ChatGPT yanıtları, yerel kriz hatlarına erişimin genişletilmesi, ciddi bir kendine zarar verme endişesi tespit edildiğinde belirlenen bir kişiyi bilgilendiren Mayıs ayında tanıtılan Güvenilir Kişi özelliği ve kendine zarar verme ile yeme bozuklukları gibi alanlarda koruma sağlayan Gençler için ChatGPT yer alıyor. OpenAI, ChatGPT'nin terapi veya profesyonel bakımın yerini tutmadığını vurguladı.openai+2