Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechai+1chaincatcher+1Το επερχόμενο μοντέλο Astra της OpenAI χρησιμοποιεί μια αρχιτεκτονική τεχνική που ονομάζεται «αναδρομικό βάθος» (recurrent depth), η οποία επιτρέπει στο μοντέλο να επεξεργάζεται πληροφορίες μέσω των ίδιων επιπέδων νευρωνικών δικτύων πολλαπλές φορές προτού δώσει μια απάντηση, βελτιώνοντας την απόδοση αλλά συσκοτίζοντας τη συλλογιστική στην οποία βασίζονται οι ερευνητές ασφάλειας για την παρακολούθηση των προηγμένων συστημάτων τεχνητής νοημοσύνης. Η αποκάλυψη, την οποία μετέδωσε πρώτο το The Information, έχει προκαλέσει κύμα ανησυχίας στους ερευνητές ασφάλειας ΤΝ, οι οποίοι θεωρούν την παρακολούθηση της «αλυσίδας σκέψης» (chain of thought) ως ένα από τα ελάχιστα διαθέσιμα εργαλεία για να ελέγχουν αν τα ισχυρά μοντέλα συμπεριφέρονται όπως προβλέπεται.theinformation
Τα παραδοσιακά μοντέλα συλλογιστικής καταγράφουν την ενδιάμεση σκέψη τους ως αναγνώσιμο κείμενο, μια «αλυσίδα σκέψης» που οι άνθρωποι μπορούν να επιθεωρήσουν. Αντίθετα, το αναδρομικό βάθος βελτιώνει μια εσωτερική αριθμητική αναπαράσταση μέσω πολλαπλών περασμάτων από τα ίδια επίπεδα μετασχηματιστή (transformer), παράγοντας αυτό που οι ερευνητές αποκαλούν «neuralese», δηλαδή μια συμπιεσμένη μαθηματική συλλογιστική που δεν μεταφράζεται ποτέ σε ανθρώπινη γλώσσα. Η τεχνική αυτή φέρεται να βελτιώνει την απόδοση στα μαθηματικά και τον προγραμματισμό, μειώνοντας παράλληλα το υπολογιστικό κόστος που απαιτείται για τη δημιουργία εκατοντάδων επιπλέον λέξεων ορατής συλλογιστικής.officechai+1
Το αντάλλαγμα είναι η διαφάνεια. Ο ερευνητής ασφάλειας ΤΝ Ryan Greenblatt χαρακτήρισε τη στροφή προς αυτού του είδους την αδιαφανή συλλογιστική ως δυνητικά μία από τις χειρότερες εξελίξεις για την ασφάλεια της τεχνητής νοημοσύνης, καθώς καταργεί ένα παράθυρο στη σκέψη του μοντέλου στο οποίο βασίζονταν οι ερευνητές για να εντοπίζουν παραπλανητική ή μη εξουσιοδοτημένη συμπεριφορά. Ο Gary Marcus, γράφοντας στο Substack, το χαρακτήρισε «κόκκινη γραμμή ασφαλείας», υποστηρίζοντας ότι η θυσία της αναγνωσιμότητας της αλυσίδας σκέψης για χάρη της βελτίωσης των επιδόσεων είναι «ένα επικίνδυνο παιχνίδι».garymarcus.substack+1
Ο Jakub Pachocki, επικεφαλής ερευνητής της OpenAI, απάντησε στο X, δηλώνοντας ότι ήθελε να «αποτρέψει μια κούρσα προς την αδυναμία παρακολούθησης που ξεκίνησε από συγκεχυμένες αναφορές». Υποστήριξε ότι το βάθος του υπολογιστικού γραφήματος του Astra είναι παραπλήσιο με εκείνο του GPT-4 (εντός συντελεστή δύο) και ότι η OpenAI έχει «εργαστεί για να διατηρήσει και να αξιοποιήσει την παρακολούθηση της αλυσίδας σκέψης» από τα πρώτα της μοντέλα συλλογιστικής. Παραδέχτηκε, ωστόσο, ότι η παρακολούθηση της αλυσίδας σκέψης «είναι εύθραυστη και δυστυχώς παρουσιάζει αρνητική τάση».chaincatcher+1
Σύμφωνα με πληροφορίες, η OpenAI έχει περιορίσει τον βαθμό στον οποίο το Astra χρησιμοποιεί το αναδρομικό βάθος προκειμένου να διατηρήσει ένα αναγνώσιμο αποτέλεσμα συλλογιστικής, ενώ σχεδιάζει να εφαρμόσει πρόσθετη παρακολούθηση κατά την κυκλοφορία του. Η εταιρεία επιβεβαίωσε στις 31 Αυγούστου ότι το Astra είναι το πρώτο της μοντέλο που πληροί το όριο «Κρίσιμης» ικανότητας κυβερνοασφάλειας βάσει του Πλαισίου Ετοιμότητάς της (Preparedness Framework), πράγμα που σημαίνει ότι μπορεί να ανακαλύπτει και να εκμεταλλεύεται αυτόνομα ευπάθειες μηδενικής ημέρας (zero-day).kucoin+2
Η εξέλιξη αυτή έχει προσελκύσει ιδιαίτερη προσοχή επειδή αντικατοπτρίζει πιστά ένα σενάριο που περιγράφεται στο δοκίμιο «AI 2027», το οποίο δημοσιεύθηκε τον Απρίλιο του 2025 από τον πρώην ερευνητή της OpenAI Daniel Kokotajlo και άλλους συνσυγγραφείς. Το δοκίμιο αυτό προέβλεπε μια στροφή προς την «αναδρομή neuralese» που θα απομάκρυνε τη συλλογιστική των μοντέλων από το αναγνώσιμο κείμενο, αλλά την τοποθετούσε χρονικά για τον Μάρτιο του 2027 και υπέθετε ότι θα απαιτούσε χιλιάδες αυτοματοποιημένους ερευνητές ΤΝ για να επιτευχθεί. Ο Kokotajlo αντέδρασε στις ειδήσεις γράφοντας στο X: «Holy shit f*ck». Εάν οι πληροφορίες του The Information ευσταθούν, μια εκδοχή του σεναρίου για το οποίο προειδοποιούσε ενδέχεται να φτάσει σε ένα εμπορικό προϊόν περίπου 18 μήνες νωρίτερα από το χρονοδιάγραμμά του.officechai