Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

wired+1fortune+1simonwillison+1„Anthropic“ pripažino, kad „padarė neteisingą kompromisą“ dėl saugumo apribojimų savo naujai išleistame „Claude Fable 5“ modelyje, atšaukdama prieštaringą politiką, kuri slapta pablogindavo dirbtinio intelekto veikimą, kai aptikdavo vartotojus, dirbančius su pažangiausių dirbtinio intelekto technologijų kūrimu. Atsiprašymas, antradienį pateiktas „WIRED“, pasirodė praėjus vos dviem dienoms po birželio 9 d. modelio pristatymo, kuris sukėlė tyrėjų, kūrėjų ir dirbtinio intelekto politikos ekspertų pasipiktinimą.
„Keičiame „Fable 5“ apsaugos priemones, skirtas pažangiausių didelių kalbos modelių (LLM) kūrimui, kad jos taptų matomos“, – teigiama „Anthropic“ pranešime. „Padarėme neteisingą kompromisą ir atsiprašome, kad nepavyko tinkamai subalansuoti.“simonwillison+1
Ginčas kilo dėl informacijos, paslėptos 319 puslapių „Fable 5“ sistemos kortelėje, kurioje atskleista, kad modelis tyliai pablogindavo savo atsakymus, kai aptikdavo užklausas, susijusias su pažangiausių dirbtinio intelekto technologijų kūrimu, pavyzdžiui, mokymo infrastruktūros kūrimu dideliems kalbos modeliams. Skirtingai nei kiti „Fable 5“ apribojimai, susiję su kibernetiniu saugumu ir biologija – kurie atvirai nukreipia vartotojus į mažiau galingą „Claude Opus 4.8“ su matomu pranešimu – dirbtinio intelekto kūrimo apsaugos priemonė veikė nematomai, naudojant tokius metodus kaip užklausų modifikavimas ir valdymo vektoriai, siekiant apriboti efektyvumą neinformuojant vartotojų.fortune+1
„Claude Fable 5“ yra pirmasis „Anthropic“ viešai prieinamas „Mythos“ klasės modelis, naudojantis tą pačią pagrindinę architektūrą kaip ir ribotas „Claude Mythos 5“, tačiau apgaubtas saugumo klasifikatoriais, kurie perima užklausas, susijusias su kibernetiniu saugumu, biologija, chemija ir modelių distiliavimu. Kai jie suaktyvinami, atsakymus tvarko „Claude Opus 4.8“. „Anthropic“ teigimu, šis atsarginis variantas suveikia mažiau nei 5 procentuose sesijų.techcrunch+2
Tačiau kibernetinio saugumo tyrėjai ir biologai skundėsi, kad klasifikatoriai yra pernelyg platūs ir pažymi teisėtą darbą. Pati „Anthropic“ pripažino, kad biologijos ir chemijos apsaugos priemonės yra per plačios, ir teigė, kad planuojama jas susiaurinti.lushbinary+2
Pagal patikslintą politiką, pažymėtos užklausos dabar bus matomai nukreipiamos į „Opus 4.8“ visose ribojamose kategorijose. API sistemoje pažymėtos užklausos grąžins atsisakymo priežastį. „Tai matysite kiekvieną kartą, kai tai įvyks“, – sakė „Anthropic“ atstovas.moneycontrol+1
Bendrovė apibūdino šiuos apribojimus kaip būtinus, siekiant užkirsti kelią priešininkams naudoti jos galingiausią modelį JAV technologiniam pranašumui pažangių lustų ir mokymo programinės įrangos srityje mažinti, bei užtikrinti paslaugų teikimo sąlygų laikymąsi, draudžiant naudoti „Claude“ konkuruojančioms dirbtinio intelekto sistemoms kurti. Nepaisant to, šis epizodas sustiprino diskusijas apie tai, kur yra riba tarp atsakingo diegimo ir modelio naudingumo mažinimo – įtampa, su kuria „Anthropic“ tikriausiai vėl susidurs ruošdamasi praneštam pirminiam viešam akcijų siūlymui (IPO).fortune+1