Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

insideai+1arxiv+1techxplore+1Forskare vid MIT, Boston University och barnrättsorganisationen Thorn har introducerat en teknik som kan identifiera om en AI-modell med öppen källkod har finjusterats för att producera material om sexuella övergrepp mot barn, allt utan att generera en enda bild. Metoden, kallad Gaussian probing, uppnådde 100 % noggrannhet vid identifiering av CSAM-specialiserade modellvarianter under testning, enligt resultat publicerade i en artikel på arXiv och rapporterade av Tech Xplore på måndagen.insideai+1
Tekniken adresserar en juridisk och praktisk paradox: enligt amerikansk lag är det olagligt att försöka generera CSAM, även i syfte att testa om en modell kan producera det. Detta har lämnat värdplattformar med få verktyg för att granska de lätta modelländringar, kända som LoRA-adaptrar, som användare laddar upp och delar offentligt.
Gaussian probing kringgår behovet av bildgenerering helt. Istället för att ge en modell instruktioner och inspektera dess utdata, matar metoden in slumpmässigt Gaussiskt brus — den naturliga startpunkten för bildgenererande diffusionsmodeller — genom den anpassade modellen och registrerar hur dess interna lager reagerar. Genom att analysera dessa interna aktiveringsmönster kan en klassificerare avgöra om adaptern har tränats på skadligt innehåll.arxiv+1
"Det finns en enorm mängd barnsäkerhetsproblem" kopplade till ekosystem med öppna modeller, noterade forskarna, och pekade på plattformar som CivitAI som rapporterar hundratusentals nya LoRA-adaptrar som laddas upp varje månad. Metoden är utformad för att vara skalbar nog för driftsättning på plattformsnivå, och kräver endast standard framåtriktade körningar genom modellen utan behov av instruktionsdesign eller mänsklig granskning av utdata.techxplore+1
Forskningen kommer mitt i en våg av AI-genererat CSAM. National Center for Missing and Exploited Children tog emot 67 000 rapporter om AI-genererat CSAM under 2024, upp från 4 700 året innan, enligt artikeln. Internet Watch Foundations rapport för 2026 dokumenterade 3 443 AI-genererade videor med sexuella övergrepp mot barn som identifierades 2025, upp från bara 13 året innan.casescan+1
Forskarna testade sin metod över tre modellarkitekturer — Stable Diffusion 1.5, SDXL 1.0 och FLUX.1-dev — med hjälp av CSAM-specialiserade LoRA-adaptrar som nåddes via auktoriserade enheter i enlighet med tillämplig lagstiftning. Gaussian probing klassificerade korrekt alla CSAM-specialiserade modeller samtidigt som den bibehöll låga frekvenser av falska positiva, och visade sig vara robust mot antagonistiska manipulationstekniker som viktomskalning som besegrade alternativa detektionsmetoder.arxiv+1
Artikeln författades av Vinith Suriyakumar och Ashia Wilson från MIT, tillsammans med forskare från Thorn och Boston University.arxiv+1