Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

x+1alignment.anthropicalignment.anthropicAnthropic og rannsóknarfélaginn AE Studio birtu á miðvikudag aðferð til að einangra hættulega þekkingu innan gervigreindarlíkana í aðskildar, fjarlægjanlegar einingar — nálgun sem gæti breytt því hvernig iðnaðurinn stýrir tvíþættri áhættu án þess að fórna almennri frammistöðu líkansins.
Tæknin, sem kallast Gradient-Routed Auxiliary Modules (GRAM), bætir litlum aukataugahólfum við málalíkan meðan á þjálfun stendur, þar sem hvert hólf er tileinkað flokki viðkvæmrar þekkingar eins og veirufræði, netöryggi eða kjarnaeðlisfræði. Þegar eining er eytt hagar líkanið sér eins og það hafi aldrei verið þjálfað á þeim gögnum. Þegar eining er virkjuð er þekkingin að fullu tiltæk.x+1
GRAM breytir staðlaðri arkitektúr spenni-líkana (transformer) með því að auka breidd hvers MLP-lags með litlum aukaeiningum — einni fyrir hvert viðkvæmt svið. Meðan á þjálfun stendur, þegar líkanið rekst á gögn úr tvíþættum flokki, tekur aðeins samsvarandi eining þátt í náminu ásamt almennum þyngdum líkansins. Við ályktun (inference) fjarlægir eyðing einingarinnar tengda getu.alignment.anthropic
Rannsakendur prófuðu GRAM á líkönum sem spanna frá 50 milljónum upp í 5 milljarða færibreyta, og þjálfuðu 800 milljóna færibreyta líkan á veftexta, kóða og vísindagreinum ásamt fjórum tvíþættum sviðum: veirufræði, netöryggi, kjarnaeðlisfræði og sérhæfðum kóða. Tvíþættu gögnin námu um það bil 0,25% af þjálfunargögnum fyrir hvert svið.alignment.anthropic
Niðurstöður sýndu að brottnám GRAM-eininga fjarlægði getu „næstum jafn áhrifaríkt og að hafa aldrei þjálfað á gögnunum,“ samkvæmt bloggfærslu rannsóknarinnar, á meðan almenn frammistaða hélst nálægt grunnlínu allra gagna. Nálgunin reyndist einnig öflug gegn andstæðri fínstillingu — ólíkt post-hoc aðferðum til að gleyma, sem rannsakendur komust að að bæla aðeins niður þekkingu frekar en að fjarlægja hana í raun.alignment.anthropic
Rannsóknin kemur á erfiðum tíma fyrir stjórnarhætti gervigreindar. Í júní setti Trump-stjórnin tímabundið útflutningshöft á fullkomnustu Claude-líkön Anthropic, Fable 5 og Mythos 5, með vísan til þjóðaröryggisáhyggna tengdum hugsanlegum jailbreak-veikleika. Þeim höftum var aflétt 30. júní eftir að Anthropic vann með viðskiptaráðuneytinu að því að takast á við áhættuna.arstechnica+2
GRAM býður upp á hugsanlegan milliveg í stjórnmálaumræðunni: í stað þess að takmarka heil líkön eða treysta á hegðunarvarnir sem hægt er að komast framhjá, gerir það kleift að hafa fínstillta aðgangsstýringu eftir getu. Vottuð líföryggisrannsóknarstofa gæti fengið líkan með veirufræðiþekkingu óskerta, á meðan almenn dreifing myndi hafa þá einingu fjarlægða að fullu.alignment.anthropic
Rannsakendur vöruðu við því að þetta verk sé „frumstætt og hafi ekki verið beitt á framleiðslulíkön hjá Anthropic.“ Lykilóvissa er enn til staðar um hvort tæknin skali upp í landamæralíkön og hvort flókin geta — þar sem almenn líffræðiþekking skarast við hættulega veirufræðiþekkingu — gæti takmarkað hreinan aðskilnað. Verkið var leitt af rannsakendum hjá AE Studio í samvinnu við Cem Anil og Alex Cloud hjá Anthropic.alignment.anthropic