Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

insideai+1arxiv+1techxplore+1Forscher am MIT, der Boston University und der Kinderschutzorganisation Thorn haben eine Technik vorgestellt, die identifizieren kann, ob ein Open-Source-KI-Modell darauf feinabgestimmt wurde, Material über sexuellen Missbrauch von Kindern (CSAM) zu produzieren, ohne dabei ein einziges Bild zu generieren. Die Methode, genannt Gaussian Probing, erreichte bei Tests eine Genauigkeit von 100 % bei der Identifizierung von auf CSAM spezialisierten Modellvarianten, wie aus Ergebnissen hervorgeht, die in einem Artikel auf arXiv veröffentlicht und am Montag von Tech Xplore berichtet wurden.insideai+1
Die Technik adressiert ein rechtliches und praktisches Paradoxon: Nach US-Recht ist der Versuch, CSAM zu generieren — selbst zum Zweck der Prüfung, ob ein Modell dazu in der Lage ist — an sich rechtswidrig. Dies hat Hosting-Plattformen mit wenigen Werkzeugen zurückgelassen, um die leichten Modellmodifikationen, bekannt als LoRA-Adapter, zu überprüfen, die Benutzer öffentlich hochladen und teilen.
Gaussian Probing umgeht die Notwendigkeit der Bildgenerierung vollständig. Anstatt ein Modell mit Prompts zu versehen und dessen Ausgaben zu untersuchen, speist die Methode zufälliges Gaußsches Rauschen — den natürlichen Ausgangspunkt für bildgenerierende Diffusionsmodelle — durch das angepasste Modell und zeichnet auf, wie dessen interne Schichten reagieren. Durch die Analyse dieser internen Aktivierungsmuster kann ein Klassifikator bestimmen, ob der Adapter mit schädlichen Inhalten trainiert wurde.arxiv+1
"Es gibt eine riesige Menge an Kinderschutzbedenken", die mit Ökosystemen offener Modelle verbunden sind, bemerkten die Forscher und verwiesen auf Plattformen wie CivitAI, die monatlich Hunderttausende neuer LoRA-Adapter-Uploads melden. Der Ansatz ist so konzipiert, dass er skalierbar genug für den Einsatz auf Plattformebene ist und nur Standard-Vorwärtsdurchläufe durch das Modell erfordert, ohne Prompt-Design oder menschliche Überprüfung der Ausgaben.techxplore+1
Die Forschung kommt inmitten eines Anstiegs von KI-generiertem CSAM. Das National Center for Missing and Exploited Children erhielt 2024 67.000 Berichte über KI-generiertes CSAM, gegenüber 4.700 im Vorjahr, so der Bericht. Der Bericht der Internet Watch Foundation für 2026 dokumentierte 3.443 KI-generierte Videos mit sexuellem Missbrauch von Kindern, die 2025 identifiziert wurden, gegenüber nur 13 im Vorjahr.casescan+1
Die Forscher testeten ihre Methode über drei Modellarchitekturen hinweg — Stable Diffusion 1.5, SDXL 1.0 und FLUX.1-dev — unter Verwendung von CSAM-spezialisierten LoRAs, auf die über autorisierte Stellen in Übereinstimmung mit geltendem Recht zugegriffen wurde. Gaussian Probing klassifizierte alle CSAM-spezialisierten Modelle korrekt, behielt dabei niedrige Falsch-Positiv-Raten bei und erwies sich als robust gegenüber gegnerischen Manipulationstechniken wie Gewichtsskalierung, die alternative Erkennungsmethoden überlisteten.arxiv+1
Der Artikel wurde von Vinith Suriyakumar und Ashia Wilson vom MIT sowie Forschern von Thorn und der Boston University verfasst.arxiv+1