Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

x+1alignment.anthropicalignment.anthropicAnthropic ja tutkimuskumppani AE Studio julkaisivat keskiviikkona menetelmän vaarallisen tiedon eristämiseksi tekoälymalleista erillisiin, poistettaviin moduuleihin – lähestymistapa, joka voisi muuttaa tapaa, jolla ala hallitsee kaksoiskäyttöriskejä vaarantamatta mallin yleistä suorituskykyä.
Gradient-Routed Auxiliary Modules (GRAM) -niminen tekniikka lisää kielimalliin koulutuksen aikana pieniä ylimääräisiä hermoverkkokomponentteja, joista kukin on omistettu tietylle arkaluontoisen tiedon luokalle, kuten virologialle, kyberturvallisuudelle tai ydinfysiikalle. Kun moduuli poistetaan, malli käyttäytyy ikään kuin sitä ei olisi koskaan koulutettu kyseisellä datalla. Kun moduuli aktivoidaan, tieto on täysin käytettävissä.x+1
GRAM muokkaa standardia transformer-arkkitehtuuria laajentamalla jokaisen MLP-kerroksen leveyttä pienillä apumoduuleilla – yksi kutakin arkaluontoista aluetta kohden. Koulutuksen aikana, kun malli kohtaa kaksoiskäyttöluokkaan kuuluvaa dataa, vain vastaava moduuli osallistuu oppimiseen mallin yleiskäyttöisten painoarvojen rinnalla. Päättelyvaiheessa moduulin poistaminen poistaa siihen liittyvän kyvykkyyden.alignment.anthropic
Tutkijat testasivat GRAM-menetelmää malleilla, joiden koko vaihteli 50 miljoonasta 5 miljardiin parametriin. He kouluttivat 800 miljoonan parametrin mallin verkkoaineistolla, koodilla ja tieteellisillä artikkeleilla neljän kaksoiskäyttöalueen rinnalla: virologia, kyberturvallisuus, ydinfysiikka ja erikoiskoodi. Kaksoiskäyttödata muodosti noin 0,25 % koulutusdatasta per alue.alignment.anthropic
Tulokset osoittivat, että GRAM-moduulien poistaminen poisti kyvykkyydet "lähes yhtä tehokkaasti kuin jos mallia ei olisi koskaan koulutettu kyseisellä datalla", tutkimusblogikirjoituksen mukaan, samalla kun yleinen suorituskyky pysyi lähellä kaiken datan vertailutasoa. Lähestymistapa osoittautui myös kestäväksi vastakkaiselle hienosäädölle – toisin kuin post-hoc-oppimisen poistomenetelmät, joiden tutkijat havaitsivat vain tukahduttavan tietoa sen sijaan, että ne todella poistaisivat sen.alignment.anthropic
Tutkimus julkaistaan tekoälyn hallinnon kannalta kriittisellä hetkellä. Kesäkuussa Trumpin hallinto asetti väliaikaisia vientirajoituksia Anthropicin edistyneimmille Claude-malleille, Fable 5:lle ja Mythos 5:lle, vedoten kansallisen turvallisuuden huoliin, jotka liittyivät mahdolliseen jailbreak-haavoittuvuuteen. Rajoitukset kumottiin 30. kesäkuuta sen jälkeen, kun Anthropic teki yhteistyötä kauppaministeriön kanssa riskien hallitsemiseksi.arstechnica+2
GRAM tarjoaa mahdollisen keskitien poliittisessa keskustelussa: sen sijaan, että rajoitettaisiin kokonaisia malleja tai luotettaisiin käyttäytymisen rajoittimiin, joita voidaan kiertää, se mahdollistaa hienojakoisen, kyvykkyyskohtaisen pääsynhallinnan. Varmennettu bioturvallisuuslaboratorio voisi saada mallin, jossa virologian tiedot ovat tallella, kun taas yleisessä käytössä kyseinen moduuli olisi poistettu kokonaan.alignment.anthropic
Tutkijat varoittivat, että tämä työ on "alustavaa, eikä sitä ole sovellettu Anthropicin tuotantomalleihin". Keskeisiä epävarmuustekijöitä on edelleen siitä, skaalautuuko tekniikka huipputason malleihin ja voisivatko kietoutuneet kyvykkyydet – joissa yleinen biologian tieto menee päällekkäin vaarallisen virologian tiedon kanssa – rajoittaa puhdasta erottelua. Työtä johtivat AE Studion tutkijat yhteistyössä Anthropicin Cem Anilin ja Alex Cloudin kanssa.alignment.anthropic