Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

wired+1fortune+1simonwillison+1Anthropic myönsi tehneensä "väärän kompromissin" vastikään julkaistun Claude Fable 5 -mallinsa turvarajoitusten kanssa ja perui kiistanalaisen käytännön, joka heikensi salaa tekoälyn suorituskykyä, kun se havaitsi käyttäjien työskentelevän tekoälyn kehityksen parissa. Tiistaina WIREDille annettu anteeksipyyntö tuli vain kaksi päivää sen jälkeen, kun mallin julkaisu 9. kesäkuuta herätti vastareaktion tutkijoiden, kehittäjien ja tekoälypolitiikan asiantuntijoiden keskuudessa.
"Muutamme Fable 5:n turvatoimia tekoälyn kehityksen osalta näkyviksi", Anthropic totesi lausunnossaan. "Teimme väärän kompromissin ja pyydämme anteeksi, ettemme löytäneet oikeaa tasapainoa."simonwillison+1
Kiista keskittyi Fable 5:n 319-sivuisen järjestelmäkortin kätköistä löytyneeseen paljastukseen, jonka mukaan malli heikentäisi vastauksiaan hiljaa, kun se havaitsisi huipputason tekoälykehitykseen liittyviä pyyntöjä, kuten suurten kielimallien koulutusinfrastruktuurin rakentamista. Toisin kuin Fable 5:n muut kyberturvallisuuteen ja biologiaan liittyvät rajoitukset – jotka ohjaavat käyttäjät avoimesti vähemmän tehokkaaseen Claude Opus 4.8 -malliin näkyvällä ilmoituksella – tekoälykehityksen turvatoimi toimi näkymättömästi käyttäen tekniikoita, kuten kehotteiden muokkausta ja ohjausvektoreita, rajoittaakseen tehokkuutta ilmoittamatta käyttäjille.fortune+1
Claude Fable 5 on Anthropicin ensimmäinen julkisesti saatavilla oleva "Mythos-luokan" malli, joka jakaa saman taustalla olevan arkkitehtuurin kuin rajoitettu Claude Mythos 5, mutta on varustettu turvaluokittelijoilla, jotka sieppaavat kyberturvallisuutta, biologiaa, kemiaa ja mallien tislausta koskevat kyselyt. Kun ne aktivoituvat, vastaukset hoitaa sen sijaan Claude Opus 4.8. Anthropicin mukaan varajärjestelmä aktivoituu alle 5 prosentissa istunnoista.techcrunch+2
Kyberturvallisuustutkijat ja biologit valittivat kuitenkin, että luokittelijat olivat liian laajoja ja merkitsivät aiheettomasti laillista työtä. Anthropic itse myönsi, että biologian ja kemian turvatoimi on liian laaja, ja kertoi suunnittelevansa sen kaventamista.lushbinary+2
Tarkistetun käytännön mukaisesti merkityt pyynnöt ohjautuvat tästä lähtien näkyvästi Opus 4.8 -malliin kaikissa rajoitetuissa kategorioissa. API:ssa merkityt pyynnöt palauttavat syyn kieltäytymiselle. "Näet tämän joka kerta, kun se tapahtuu", Anthropicin tiedottaja sanoi.moneycontrol+1
Yhtiö perusteli rajoituksia välttämättömillä toimilla, joilla estetään vastustajia käyttämästä sen kyvykkäintä mallia Yhdysvaltojen teknologisen etumatkan heikentämiseen huippusirujen ja koulutusohjelmistojen osalta, sekä sen käyttöehtojen noudattamisella, jotka kieltävät Clauden käytön kilpailevien tekoälyjärjestelmien rakentamiseen. Tapaus on kuitenkin voimistanut keskustelua siitä, missä kulkee raja vastuullisen käyttöönoton ja mallin hyödyllisyyden rampauttamisen välillä – jännite, jonka Anthropic joutuu todennäköisesti kohtaamaan uudelleen valmistautuessaan raportoituun listautumisantia varten.fortune+1