Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

unite+1unitecryptobriefing+1ოთხშაბათს OpenAI-მ გამოუშვა MentalHealthBench, 1,215 სინთეზური ფსიქიკური ჯანმრთელობის საუბრისგან შემდგარი ღია ბენჩმარკი, რომელიც 80-ზე მეტ ლიცენზირებულ სპეციალისტთან ერთად შეიქმნა, რათა გაიზომოს, თუ როგორ რეაგირებენ ხელოვნური ინტელექტის მოდელები სხვადასხვა სცენარზე, ყოველდღიური სტრესიდან დაწყებული კრიზისული სიტუაციებით დამთავრებული.unite+1
ბენჩმარკი, რომელიც OpenAI-ს თქმით ავსებს არსებულ შეფასებებში არსებულ ხარვეზს, რადგან ისინი ძირითადად მხოლოდ გადაუდებელ შემთხვევებზეა ორიენტირებული, შეიქმნა 22 ქვეყნის ლიცენზირებული ფსიქოლოგებისა და ფსიქიატრების მიერ, რომლებიც საუბრობენ 19 ენაზე და წარმოადგენენ ფსიქიკური ჯანმრთელობის თითქმის 20 ქვესპეციალობას. მონაცემთა ბაზა მოიცავს 5,262 ექსპერტულ კრიტერიუმს, ხოლო თითოეული საუბარი შემოწმდა მინიმუმ სამი კლინიცისტის მიერ.openai+1
MentalHealthBench მოიცავს არააქუტურ ყოველდღიურ საუბრებს (53.5%), მაღალი რისკის მქონე საუბრებს ფსიქიკური ჯანმრთელობის სერიოზულ პრობლემებზე (18.2%) და გადაუდებელ შემთხვევებს, რომლებიც მოითხოვს უსაფრთხოების დაუყოვნებლივ ზომებს (28.3%). წარმოდგენილია მომხმარებლის ოთხი პროფილი: მოზრდილები (68.1%), მოზარდები (21.2%), კლინიცისტები (5.8%) და მომვლელები (4.9%).unite+1
„ფსიქიკური ჯანმრთელობა არის კონტინუუმი, ყვავილობიდან დაწყებული ყოველდღიური სტრესითა და მწვავე კრიზისით დამთავრებული“, – განაცხადა ამერიკის ფსიქოლოგიური ასოციაციის აღმასრულებელმა დირექტორმა, დოქტორმა არტურ ევანსმა OpenAI-ს განცხადებაში. „ხელოვნური ინტელექტის სისტემები, რომლებიც ადამიანებთან ამ დიაპაზონში ურთიერთობენ, უნდა ეფუძნებოდეს როგორც კლინიკურ მეცნიერებას, ისე ცხოვრებისეულ გამოცდილებას.“openai
თითოეულ კრიტერიუმს აქვს წონა -10-დან +10-მდე, სადაც დადებითი ქულები აჯილდოებს სასარგებლო ქცევას, ხოლო უარყოფითი ქულები სჯის მავნე ქცევას. ავტომატური შემფასებელი, GPT-5.6 Sol, აფასებს მოდელის პასუხებს ექსპერტების მიერ დაწერილ კრიტერიუმებთან მიმართებაში.unite+1
OpenAI-ს შეფასებით, GPT-6 Astra-მ ყველაზე მაღალი შედეგი აჩვენა 57.3%-ით, მას მოჰყვება GPT-6 Sol 53.9%-ით, Claude Opus 5.5 52.4%-ით და GPT-6 Luna 50.2%-ით. ძველმა მოდელებმა უფრო დაბალი ქულები მიიღეს, GPT-4o-მ 32.1%, ხოლო Google-ის Alphabet Inc.-ის Gemini 2.5 Pro-მ 29.5%.cryptobriefing+1
ცალკეულმა ანალიზმა, რომელშიც მონაწილეობდა 16 ქვეყნის 44 ზრდასრული ადამიანი, რომლებმაც გამოიყენეს ხელოვნური ინტელექტი ფსიქიკური ჯანმრთელობის მხარდაჭერისთვის, აჩვენა, რომ მომხმარებლებისა და ექსპერტების შეხედულებები განსხვავდება: მომხმარებლები ხაზს უსვამდნენ პრაქტიკულ ნაბიჯებსა და ტონს, ხოლო კლინიცისტები პრიორიტეტს ანიჭებდნენ კონტექსტის შეგროვებასა და ორაზროვანი სიტუაციების ინტერპრეტაციას.unite+1
ბენჩმარკთან ერთად, OpenAI-მ მიუთითა უსაფრთხოების მთელ რიგ ზომებზე, რომლებიც მან ბოლო თვეებში დანერგა, მათ შორის ChatGPT-ის გაძლიერებულ პასუხებზე მგრძნობიარე საუბრებში, ადგილობრივ კრიზისულ ცხელ ხაზებზე წვდომის გაფართოებაზე, მაისში დანერგილ Trusted Contact ფუნქციაზე, რომელიც აცნობებს დანიშნულ პირს თვითდაზიანების სერიოზული რისკის აღმოჩენის შემთხვევაში, და ChatGPT მოზარდებისთვის, რომელიც მოიცავს დაცვას ისეთ სფეროებში, როგორიცაა თვითდაზიანება და კვებითი აშლილობები. OpenAI-მ ხაზგასმით აღნიშნა, რომ ChatGPT არ არის თერაპიის ან პროფესიული ზრუნვის შემცვლელი.openai+2