Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

x+1alignment.anthropicalignment.anthropicSpolečnost Anthropic a její výzkumný partner AE Studio ve středu zveřejnili metodu pro izolaci nebezpečných znalostí v rámci modelů AI do diskrétních, odstranitelných modulů – přístup, který by mohl změnit způsob, jakým průmysl řídí rizika dvojího užití, aniž by obětoval celkový výkon modelu.
Technika nazvaná Gradient-Routed Auxiliary Modules (GRAM) přidává během tréninku k jazykovému modelu malé pomocné neuronové oddíly, přičemž každý oddíl je věnován kategorii citlivých znalostí, jako je virologie, kybernetická bezpečnost nebo jaderná fyzika. Když je modul smazán, model se chová, jako by na těchto datech nebyl nikdy trénován. Když je modul aktivován, znalosti jsou plně dostupné.x+1
GRAM modifikuje standardní architekturu transformátoru rozšířením šířky každé vrstvy MLP o malé pomocné moduly – jeden pro každou citlivou doménu. Během tréninku, když model narazí na data z kategorie dvojího užití, podílí se na učení spolu s obecnými vahami modelu pouze odpovídající modul. V době inference odstranění modulu odstraní přidruženou schopnost.alignment.anthropic
Výzkumníci testovali GRAM na modelech v rozsahu od 50 milionů do 5 miliard parametrů, přičemž trénovali model s 800 miliony parametrů na webových textech, kódu a vědeckých pracích spolu se čtyřmi doménami dvojího užití: virologií, kybernetickou bezpečností, jadernou fyzikou a specializovaným kódem. Data dvojího užití tvořila přibližně 0,25 % tréninkových dat na doménu.alignment.anthropic
Výsledky ukázaly, že ablace modulů GRAM odstranila schopnosti „téměř stejně efektivně, jako kdyby se na datech vůbec netrénovalo“, uvádí výzkumný blog, zatímco celkový výkon zůstal blízko základní linie všech dat. Přístup se také ukázal jako robustní vůči adverznímu doladění – na rozdíl od metod post-hoc odnaučování, o kterých výzkumníci zjistili, že znalosti pouze potlačují, místo aby je skutečně odstranily.alignment.anthropic
Výzkum přichází v napjaté době pro správu AI. V červnu Trumpova administrativa dočasně uvalila vývozní kontroly na nejpokročilejší modely Anthropic, Fable 5 a Mythos 5, s odvoláním na obavy o národní bezpečnost související s možnou zranitelností typu „jailbreak“. Tato omezení byla zrušena 30. června poté, co Anthropic spolupracoval s ministerstvem obchodu na řešení rizik.arstechnica+2
GRAM nabízí potenciální střední cestu v politické debatě: namísto omezování celých modelů nebo spoléhání se na behaviorální mantinely, které lze obejít, umožňuje granulární kontrolu přístupu podle schopností. Prověřená laboratoř pro biologickou bezpečnost by mohla obdržet model s neporušenými znalostmi virologie, zatímco obecné nasazení by mělo tento modul zcela odstraněn.alignment.anthropic
Výzkumníci varovali, že tato práce je „předběžná a nebyla aplikována na produkční modely ve společnosti Anthropic“. Zůstávají klíčové nejistoty ohledně toho, zda technika škáluje na modely velikosti frontier a zda by propletené schopnosti – kde se obecné biologické znalosti překrývají s nebezpečnými virologickými znalostmi – mohly omezit čisté oddělení. Práci vedli výzkumníci z AE Studio ve spolupráci s Cemem Anilem a Alexem Cloudem z Anthropic.alignment.anthropic