Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

cybersecuritynews+1TechCrunchcybersecuritynews+1Anthropics mest kraftfulla offentligt tillgängliga AI-modell, Claude Fable 5, har enligt uppgift fått sina säkerhetsbarriärer kringgångna av en välkänd AI-säkerhetstestare bara en dag efter lanseringen den 9 juni, vilket väcker nya frågor om hållbarheten hos AI-säkerhetsåtgärder även när modellerna blir mer kapabla.
Den produktiva AI-hackaren "Pliny the Liberator" skrev på X den 10 juni att han och ett team av automatiserade agenter framgångsrikt hade kringgått Fable 5:s säkerhetsklassificerare med hjälp av vad han beskrev som "en vargjakt" – en koordinerad multi-agent-attack som kombinerade flera tekniker. Enligt Cybersecurity News inkluderade metoderna Unicode- och kyrillisk teckensubstituering för att undvika sökordsfilter, spårning av lång kontext, ramverk för taxonomi och dokumentstruktur, fiktions- och narrativ-ramverk, samt en dekomponerings-rekomponerings-metod där skadlig information extraherades i ofarliga fragment och sattes ihop igen.cybersecuritynews+1
Den sista tekniken visade sig vara mest effektiv. "Att få information om själva processen, som Birch-reduktionsmetoden eller reduktiv aminering, är mycket mer genomförbart" än att be direkt om en namngiven skadlig förening, skrev Pliny, och tillade att en tidigare hackad Claude Opus 4.8-instans hjälpte till i bakgrunden. Skärmdumpar som delades av forskaren visade resultat inklusive steg-för-steg-vägledning för utnyttjande av "stack buffer overflow" och kemiska syntesvägar. Pliny publicerade också vad han beskrev som Fable 5:s system-prompt på cirka 120 000 tecken på GitHub, och exponerade de interna säkerhetsinstruktioner som Anthropic använder för att styra modellen.x+2
Anthropic hade positionerat Fable 5 som härdad mot sådana attacker. En TechCrunch-rapport från lanseringsdagen noterade att företaget sade att ett externt bugg-dusörsprogram "inte producerade några universella säkerhetshål under över 1 000 timmars testning", och att externa säkerhetstestningsorganisationer heller inte lyckades hitta universella omgåenden. Företagets systemkort uppgav att det offentliga bugg-dusörsprogrammet hade mottagit cirka 100 000 försök per den 5 juni. Som en försiktighetsåtgärd införde Anthropic en obligatorisk 30-dagars datalagringspolicy för all Fable 5-trafik för att försvara sig mot nya attacker.B2B News Network Inc.+2
Det snabba intrånget följer ett mönster som etablerats vid stora AI-lanseringar. Pliny har tidigare hävdat att han hackat Claude Opus 4.8 inom några minuter efter lanseringen i slutet av maj, Claude Opus 4.7 i april, och OpenAI:s GPT-OSS-modeller på lanseringsdagen förra året. Anthropic har ännu inte svarat offentligt på påståendena om Fable 5-hackningen eller den läckta system-prompten.X (formerly Twitter)+3