Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

insideai+1arxiv+1techxplore+1Ερευνητές στο MIT, στο Πανεπιστήμιο της Βοστώνης και στον οργανισμό προστασίας παιδιών Thorn παρουσίασαν μια τεχνική που μπορεί να εντοπίσει εάν ένα μοντέλο τεχνητής νοημοσύνης ανοιχτού κώδικα έχει ρυθμιστεί για την παραγωγή υλικού παιδικής σεξουαλικής κακοποίησης, χωρίς να δημιουργήσει ούτε μία εικόνα. Η μέθοδος, που ονομάζεται Gaussian probing, πέτυχε 100% ακρίβεια στον εντοπισμό παραλλαγών μοντέλων εξειδικευμένων σε CSAM κατά τη διάρκεια των δοκιμών, σύμφωνα με τα ευρήματα που δημοσιεύθηκαν σε άρθρο στο arXiv και αναφέρθηκαν από το Tech Xplore τη Δευτέρα.insideai+1
Η τεχνική αντιμετωπίζει ένα νομικό και πρακτικό παράδοξο: σύμφωνα με τη νομοθεσία των ΗΠΑ, η απόπειρα παραγωγής CSAM — ακόμη και για τον σκοπό του ελέγχου εάν ένα μοντέλο μπορεί να το παράγει — είναι από μόνη της παράνομη. Αυτό έχει αφήσει τις πλατφόρμες φιλοξενίας με ελάχιστα εργαλεία για τον έλεγχο των ελαφριών τροποποιήσεων μοντέλων, γνωστών ως προσαρμογείς LoRA, τους οποίους οι χρήστες μεταφορτώνουν και μοιράζονται δημόσια.
Το Gaussian probing παρακάμπτει εντελώς την ανάγκη για δημιουργία εικόνων. Αντί να δίνει εντολές σε ένα μοντέλο και να επιθεωρεί τα αποτελέσματά του, η μέθοδος διοχετεύει τυχαίο θόρυβο Gaussian — το αρχικό σημείο για τα μοντέλα διάχυσης που δημιουργούν εικόνες — μέσω του προσαρμοσμένου μοντέλου και καταγράφει πώς ανταποκρίνονται τα εσωτερικά του επίπεδα. Αναλύοντας αυτά τα εσωτερικά πρότυπα ενεργοποίησης, ένας ταξινομητής μπορεί να προσδιορίσει εάν ο προσαρμογέας έχει εκπαιδευτεί σε επιβλαβές περιεχόμενο.arxiv+1
"Υπάρχει ένας τεράστιος όγκος ανησυχιών για την προστασία των παιδιών" που συνδέεται με τα οικοσυστήματα μοντέλων ανοιχτού βάρους, σημείωσαν οι ερευνητές, επισημαίνοντας πλατφόρμες όπως το CivitAI που αναφέρουν εκατοντάδες χιλιάδες νέους προσαρμογείς LoRA που μεταφορτώνονται κάθε μήνα. Η προσέγγιση έχει σχεδιαστεί ώστε να είναι αρκετά κλιμακώσιμη για ανάπτυξη σε επίπεδο πλατφόρμας, απαιτώντας μόνο τυπικά περάσματα μέσω του μοντέλου χωρίς σχεδιασμό εντολών ή ανθρώπινη αναθεώρηση των αποτελεσμάτων.techxplore+1
Η έρευνα έρχεται εν μέσω μιας έξαρσης του CSAM που δημιουργείται από τεχνητή νοημοσύνη. Το Εθνικό Κέντρο για Εξαφανισμένα και Εκμεταλλευόμενα Παιδιά έλαβε 67.000 αναφορές για CSAM που δημιουργήθηκε από τεχνητή νοημοσύνη το 2024, από 4.700 το προηγούμενο έτος, σύμφωνα με το άρθρο. Η έκθεση του 2026 του Internet Watch Foundation κατέγραψε 3.443 βίντεο παιδικής σεξουαλικής κακοποίησης που δημιουργήθηκαν από τεχνητή νοημοσύνη το 2025, από μόλις 13 το προηγούμενο έτος.casescan+1
Οι ερευνητές δοκίμασαν τη μέθοδό τους σε τρεις αρχιτεκτονικές μοντέλων — Stable Diffusion 1.5, SDXL 1.0 και FLUX.1-dev — χρησιμοποιώντας LoRA εξειδικευμένα σε CSAM στα οποία είχαν πρόσβαση μέσω εξουσιοδοτημένων οντοτήτων σε συμμόρφωση με τους ισχύοντες νόμους. Το Gaussian probing ταξινόμησε σωστά όλα τα μοντέλα που ήταν εξειδικευμένα σε CSAM διατηρώντας παράλληλα χαμηλά ποσοστά ψευδώς θετικών αποτελεσμάτων, και αποδείχθηκε ανθεκτικό έναντι τεχνικών αντιπαραθετικής χειραγώγησης, όπως η επανακλιμάκωση βαρών, που νίκησαν άλλες μεθόδους ανίχνευσης.arxiv+1
Το άρθρο συντάχθηκε από τους Vinith Suriyakumar και Ashia Wilson του MIT, μαζί με ερευνητές από το Thorn και το Πανεπιστήμιο της Βοστώνης.arxiv+1