Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

cybersecuritynews+1TechCrunchcybersecuritynews+1Το πιο ισχυρό δημόσια διαθέσιμο μοντέλο τεχνητής νοημοσύνης της Anthropic, το Claude Fable 5, φέρεται να έχει παρακαμφθεί από έναν γνωστό ερευνητή ασφαλείας AI (red-teamer) μόλις μία ημέρα μετά την κυκλοφορία του στις 9 Ιουνίου, εγείροντας νέα ερωτήματα σχετικά με την ανθεκτικότητα των μέτρων ασφαλείας της τεχνητής νοημοσύνης, ακόμη και καθώς τα μοντέλα γίνονται πιο ικανά.
Ο παραγωγικός jailbreaker τεχνητής νοημοσύνης "Pliny the Liberator" δημοσίευσε στο X στις 10 Ιουνίου ότι ο ίδιος και μια ομάδα αυτοματοποιημένων πρακτόρων κατάφεραν να παρακάμψουν τους ταξινομητές ασφαλείας του Fable 5 χρησιμοποιώντας αυτό που περιέγραψε ως "κυνήγι αγέλης" — μια συντονισμένη επίθεση πολλαπλών πρακτόρων που συνδυάζει διάφορες τεχνικές. Σύμφωνα με το Cybersecurity News, οι μέθοδοι περιελάμβαναν αντικατάσταση χαρακτήρων Unicode και κυριλλικών για την αποφυγή φίλτρων λέξεων-κλειδιών, παρακολούθηση αναφορών μεγάλου πλαισίου, πλαισίωση ταξινομίας και δομής εγγράφων, πλαισίωση μυθοπλασίας και αφήγησης, καθώς και μια προσέγγιση αποσύνθεσης-ανασύνθεσης, κατά την οποία επιβλαβείς πληροφορίες εξάγονταν σε αβλαβή θραύσματα και επανασυναρμολογούνταν.cybersecuritynews+1
Η τελευταία τεχνική αποδείχθηκε η πιο αποτελεσματική. "Η απόκτηση πρόσβασης στη διαδικασία αυτή καθαυτή, όπως η μέθοδος αναγωγής Birch ή η αναγωγική αμίνωση, είναι πολύ πιο εφικτή" από το να ζητήσει κανείς απευθείας μια ονομαστική επιβλαβή ένωση, έγραψε ο Pliny, προσθέτοντας ότι ένα προηγουμένως παραβιασμένο στιγμιότυπο του Claude Opus 4.8 βοήθησε στο backend. Στιγμιότυπα οθόνης που κοινοποίησε ο ερευνητής έδειξαν αποτελέσματα που περιλαμβάνουν καθοδήγηση για εκμετάλλευση υπερχείλισης στοίβας (stack buffer overflow) βήμα προς βήμα και μονοπάτια χημικής σύνθεσης. Ο Pliny δημοσίευσε επίσης στο GitHub αυτό που περιέγραψε ως το system prompt του Fable 5, μήκους περίπου 120.000 χαρακτήρων, εκθέτοντας τις εσωτερικές οδηγίες ασφαλείας που χρησιμοποιεί η Anthropic για να διέπει το μοντέλο.x+2
Η Anthropic είχε τοποθετήσει το Fable 5 ως θωρακισμένο ενάντια σε τέτοιες επιθέσεις. Μια αναφορά του TechCrunch από την ημέρα της κυκλοφορίας σημείωνε ότι η εταιρεία δήλωσε πως ένα εξωτερικό πρόγραμμα bug bounty "δεν παρήγαγε καθολικές παραβιάσεις σε πάνω από 1.000 ώρες δοκιμών", και ότι εξωτερικοί οργανισμοί red-teaming απέτυχαν επίσης να βρουν καθολικές παρακάμψεις. Η κάρτα συστήματος της εταιρείας ανέφερε ότι το δημόσιο bug bounty έλαβε περίπου 100.000 προσπάθειες έως τις 5 Ιουνίου. Ως προφύλαξη, η Anthropic επέβαλε μια υποχρεωτική πολιτική διατήρησης δεδομένων 30 ημερών σε όλη την κίνηση του Fable 5 για την άμυνα ενάντια σε νέες επιθέσεις.B2B News Network Inc.+2
Η ταχεία παραβίαση ακολουθεί ένα μοτίβο που έχει καθιερωθεί σε όλες τις μεγάλες κυκλοφορίες AI. Ο Pliny έχει ισχυριστεί στο παρελθόν παραβιάσεις του Claude Opus 4.8 μέσα σε λίγα λεπτά από την κυκλοφορία του στα τέλη Μαΐου, του Claude Opus 4.7 τον Απρίλιο και των μοντέλων GPT-OSS της OpenAI την ημέρα της κυκλοφορίας τους πέρυσι. Η Anthropic δεν έχει απαντήσει ακόμη δημόσια στους ισχυρισμούς για την παραβίαση του Fable 5 ή στο διαρρεύσαν system prompt.X (formerly Twitter)+3