Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

cybersecuritynews+1TechCrunchcybersecuritynews+1Anthropicin tehokkaimman julkisesti saatavilla olevan tekoälymallin, Claude Fable 5:n, turvakaiteiden kerrotaan tulleen ohitetuiksi tunnetun tekoälytestaajan toimesta vain päivä sen 9. kesäkuuta tapahtuneen julkaisun jälkeen. Tämä herättää uusia kysymyksiä tekoälyn turvatoimien kestävyydestä mallien kehittyessä entistä kyvykkäämmiksi.
Tuottelias tekoälymurtautuja "Pliny the Liberator" kirjoitti X-palvelussa 10. kesäkuuta, että hän ja automatisoitujen agenttien tiimi olivat onnistuneet kiertämään Fable 5:n turvaluokittelijat käyttämällä menetelmää, jota hän kuvaili "laumajahdiksi" – koordinoiduksi moniagenttihyökkäykseksi, joka yhdistää useita tekniikoita. Cybersecurity Newsin mukaan menetelmiin kuuluivat Unicode- ja kyrillisten merkkien korvaaminen avainsanasuodattimien välttämiseksi, pitkän kontekstin viitteiden seuranta, taksonomia- ja dokumenttirakenteen kehystäminen, fiktio- ja narratiivikehystys sekä hajottamis-kokoamis-lähestymistapa, jossa haitallista tietoa uutettiin vaarattomina fragmentteina ja koottiin uudelleen.cybersecuritynews+1
Viimeinen tekniikka osoittautui tehokkaimmaksi. "Prosessin itsensä, kuten Birch-pelkistyksen tai reduktiivisen aminaation, ymmärtäminen on paljon helpompaa" kuin suoraan haitallisen yhdisteen pyytäminen, Pliny kirjoitti ja lisäsi, että aiemmin murrettu Claude Opus 4.8 -instanssi auttoi taustalla. Tutkijan jakamat kuvakaappaukset näyttivät tuloksia, jotka sisälsivät vaiheittaisia ohjeita puskurin ylivuodon hyödyntämiseen ja kemiallisiin synteesireitteihin. Pliny julkaisi myös GitHubissa noin 120 000 merkin mittaisen järjestelmäkehotteen, jonka hän väitti kuuluvan Fable 5:lle, paljastaen sisäiset turvaohjeet, joita Anthropic käyttää mallin hallintaan.x+2
Anthropic oli asemoinut Fable 5:n suojatuksi tällaisia hyökkäyksiä vastaan. Julkaisupäivänä julkaistussa TechCrunchin raportissa todettiin, että yrityksen mukaan ulkoinen bugipalkkio-ohjelma "ei tuottanut universaaleja murtoja yli 1 000 tunnin testauksessa", ja että ulkoiset testaajaorganisaatiot eivät myöskään löytäneet universaaleja ohituksia. Yrityksen järjestelmäkortissa todettiin, että julkinen bugipalkkio-ohjelma oli vastaanottanut noin 100 000 yritystä 5. kesäkuuta mennessä. Varotoimenpiteenä Anthropic asetti pakollisen 30 päivän tiedonsäilytyskäytännön kaikelle Fable 5 -liikenteelle suojautuakseen uusilta hyökkäyksiltä.B2B News Network Inc.+2
Nopea murto noudattaa suurten tekoälyjulkaisujen yhteydessä havaittua kaavaa. Pliny on aiemmin väittänyt murtaneensa Claude Opus 4.8:n minuuteissa sen toukokuun lopun julkaisun jälkeen, Claude Opus 4.7:n huhtikuussa ja OpenAI:n GPT-OSS-mallit niiden julkaisupäivänä viime vuonna. Anthropic ei ole vielä vastannut julkisesti Fable 5:n murtoa koskeviin väitteisiin tai vuotaneeseen järjestelmäkehotteeseen.X (formerly Twitter)+3