Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

insideai+1arxiv+1techxplore+1Výzkumníci z MIT, Bostonské univerzity a organizace pro bezpečnost dětí Thorn představili techniku, která dokáže identifikovat, zda byl model AI s otevřeným zdrojovým kódem vyladěn k vytváření materiálu se sexuálním zneužíváním dětí (CSAM), a to vše bez vygenerování jediného obrázku. Metoda, nazvaná Gaussian probing, dosáhla při testování 100% přesnosti při identifikaci variant modelů specializovaných na CSAM, uvádí se v článku publikovaném na arXiv a pondělní zprávě Tech Xplore.insideai+1
Technika řeší právní a praktický paradox: podle amerických zákonů je pokus o generování CSAM — i za účelem testování, zda jej model dokáže vytvořit — sám o sobě nezákonný. To zanechalo hostingové platformy s minimem nástrojů pro prověřování lehkých úprav modelů, známých jako adaptéry LoRA, které uživatelé veřejně nahrávají a sdílejí.
Gaussian probing zcela obchází potřebu generování obrázků. Místo toho, aby model vyzval k akci a kontroloval jeho výstupy, metoda propouští náhodný Gaussovský šum — nativní výchozí bod pro difuzní modely generující obrázky — upraveným modelem a zaznamenává, jak reagují jeho vnitřní vrstvy. Analýzou těchto vnitřních aktivačních vzorců může klasifikátor určit, zda byl adaptér trénován na škodlivém obsahu.arxiv+1
„Existuje obrovské množství obav o bezpečnost dětí“ spojených s ekosystémy modelů s otevřenými vahami, poznamenali výzkumníci a poukázali na platformy jako CivitAI, které hlásí stovky tisíc nových adaptérů LoRA nahraných každý měsíc. Přístup je navržen tak, aby byl dostatečně škálovatelný pro nasazení na úrovni platformy, vyžaduje pouze standardní průchody modelem bez nutnosti návrhu výzev nebo lidské kontroly výstupů.techxplore+1
Výzkum přichází uprostřed nárůstu CSAM generovaného AI. Národní centrum pro pohřešované a zneužívané děti obdrželo v roce 2024 67 000 hlášení o CSAM generovaném AI, což je nárůst oproti 4 700 v předchozím roce, uvádí článek. Zpráva Internet Watch Foundation z roku 2026 zdokumentovala 3 443 videí se sexuálním zneužíváním dětí generovaných AI identifikovaných v roce 2025, oproti pouhým 13 v předchozím roce.casescan+1
Výzkumníci testovali svou metodu na třech architekturách modelů — Stable Diffusion 1.5, SDXL 1.0 a FLUX.1-dev — s použitím LoRA specializovaných na CSAM, ke kterým byl přístup prostřednictvím autorizovaných subjektů v souladu s platnými zákony. Gaussian probing správně klasifikoval všechny modely specializované na CSAM při zachování nízké míry falešně pozitivních výsledků a ukázal se jako odolný vůči technikám nepřátelské manipulace, jako je změna měřítka vah, které porazily alternativní detekční metody.arxiv+1
Spoluautory článku jsou Vinith Suriyakumar a Ashia Wilson z MIT spolu s výzkumníky z Thorn a Bostonské univerzity.arxiv+1