Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

unite+1unitecryptobriefing+1Η OpenAI κυκλοφόρησε την Τετάρτη το MentalHealthBench, ένα ανοιχτό πρότυπο αξιολόγησης που περιλαμβάνει 1.215 συνθετικές συζητήσεις ψυχικής υγείας, οι οποίες δημιουργήθηκαν σε συνεργασία με περισσότερους από 80 αδειούχους επαγγελματίες ψυχικής υγείας για να μετρηθεί ο τρόπος με τον οποίο τα μοντέλα τεχνητής νοημοσύνης ανταποκρίνονται σε ένα ευρύ φάσμα σεναρίων, από το καθημερινό άγχος έως τις επείγουσες κρίσεις.unite+1
Το πρότυπο, το οποίο η OpenAI περιέγραψε ως μια προσπάθεια κάλυψης του κενού που αφήνουν οι υπάρχουσες αξιολογήσεις οι οποίες εστιάζουν κυρίως σε καταστάσεις έκτακτης ανάγκης, δημιουργήθηκε από κοινού με ψυχολόγους και ψυχιάτρους από 22 χώρες, οι οποίοι μιλούν συνολικά 19 γλώσσες και εκπροσωπούν σχεδόν 20 υποειδικότητες της ψυχικής υγείας. Το σύνολο δεδομένων περιλαμβάνει 5.262 κριτήρια αξιολόγησης που συντάχθηκαν από ειδικούς, ενώ κάθε συζήτηση εξετάστηκε από τουλάχιστον τρεις κλινικούς ιατρούς.openai+1
Το MentalHealthBench καλύπτει μη οξείες καθημερινές συζητήσεις (53,5%), συζητήσεις υψηλής έντασης που αφορούν σοβαρά ζητήματα ψυχικής υγείας (18,2%) και επείγοντα περιστατικά που απαιτούν άμεση παρέμβαση για λόγους ασφαλείας (28,3%). Αντιπροσωπεύονται τέσσερα προφίλ χρηστών: ενήλικες (68,1%), έφηβοι (21,2%), κλινικοί ιατροί (5,8%) και φροντιστές (4,9%).unite+1
"Η ψυχική υγεία υπάρχει σε ένα συνεχές, από την ευημερία και το καθημερινό άγχος έως την οξεία κρίση", δήλωσε ο Δρ. Arthur Evans, διευθύνων σύμβουλος της Αμερικανικής Ψυχολογικής Εταιρείας, στην ανακοίνωση της OpenAI. "Τα συστήματα τεχνητής νοημοσύνης που αλληλεπιδρούν με ανθρώπους σε αυτό το φάσμα πρέπει να βασίζονται τόσο στην κλινική επιστήμη όσο και στη βιωματική εμπειρία".openai
Κάθε κριτήριο αξιολόγησης φέρει στάθμιση από -10 έως +10, με τις θετικές βαθμολογίες να επιβραβεύουν τις υποστηρικτικές συμπεριφορές και τις αρνητικές να τιμωρούν τις επιβλαβείς. Ένας αυτοματοποιημένος βαθμολογητής, το GPT-5.6 Sol, αξιολογεί τις απαντήσεις του μοντέλου με βάση τα κριτήρια που έχουν συντάξει οι ειδικοί.unite+1
Στην αξιολόγηση της OpenAI, το GPT-6 Astra σημείωσε την υψηλότερη βαθμολογία με 57,3%, ακολουθούμενο από το GPT-6 Sol με 53,9%, το Claude Opus 5.5 με 52,4% και το GPT-6 Luna με 50,2%. Τα παλαιότερα μοντέλα σημείωσαν χαμηλότερες επιδόσεις, με το GPT-4o στο 32,1% και το Gemini 2.5 Pro της Alphabet Inc. στο 29,5%.cryptobriefing+1
Μια ξεχωριστή ανάλυση με 44 ενήλικες από 16 χώρες που είχαν χρησιμοποιήσει τεχνητή νοημοσύνη για υποστήριξη ψυχικής υγείας διαπίστωσε ότι οι χρήστες και οι ειδικοί διέφεραν ως προς το τι θεωρούσαν σημαντικό: οι χρήστες έδιναν έμφαση στα πρακτικά επόμενα βήματα και στον τόνο της συζήτησης, ενώ οι κλινικοί ιατροί έδιναν προτεραιότητα στη συλλογή πλαισίου και στην ερμηνεία ασαφών καταστάσεων.unite+1
Παράλληλα με το πρότυπο αξιολόγησης, η OpenAI επεσήμανε μια σειρά από σχετικά μέτρα ασφαλείας που έχει εφαρμόσει τους τελευταίους μήνες, συμπεριλαμβανομένων των ενισχυμένων απαντήσεων του ChatGPT σε ευαίσθητες συζητήσεις, της διευρυμένης πρόσβασης σε τοπικές γραμμές βοήθειας για κρίσεις, της λειτουργίας Trusted Contact που εισήχθη τον Μάιο και ειδοποιεί ένα ορισμένο πρόσωπο εάν εντοπιστούν σοβαρές ανησυχίες για αυτοτραυματισμό, καθώς και του ChatGPT για εφήβους με προστασίες που καλύπτουν τομείς όπως ο αυτοτραυματισμός και οι διατροφικές διαταραχές. Η OpenAI τόνισε ότι το ChatGPT δεν υποκαθιστά τη θεραπεία ή την επαγγελματική φροντίδα.openai+2