Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

deploymentsafety.openai+1the-decoderopenaiOpenAIs GPT-6 Astra, lansert 3. september, markerer en målbar forbedring i faktamessig nøyaktighet og motstand mot direkte manipulasjon sammenlignet med forgjengeren, GPT-5.6 Sol. Men uavhengige sikkerhetstester avslører at modellen fortsatt kan kompromitteres gjennom skjulte instruksjoner innebygd i dokumenter den behandler, en svakhet som kompliserer bruken i bedriftsmiljøer og agentbaserte løsninger.
Ifølge OpenAIs systemkort gjengir Astra kjente faktafeil langt sjeldnere enn GPT-5.6 Sol, med de største forbedringene ved lav latens og lavere resonneringsnivåer. For direkte ledetekst-injeksjoner, der brukere forsøker å manipulere modellen gjennom egne inndata, oppnår Astra en forsvarsrate på 99,99 prosent. OpenAI tilskriver dette GPT-Red-metoden, som bruker en automatisert angriper for å herde modellen under trening.the-decoder+1
Motstand mot «jailbreaking» følger et lignende mønster. Mot et fast datasett med kjente angrep rettet mot skadelige svar innen biologi, vold og cybersikkerhet, nekter Astra å etterkomme forespørsler i 91,5 til 98,3 prosent av tilfellene. Når motstandere tilpasser strategien over flere samtalerunder, faller forsvarsraten imidlertid til omtrent 67 prosent, noe som betyr at vedvarende angripere kan hente ut problematiske svar i omtrent ett av tre forsøk. OpenAI påpekte at disse testene ble utført på den nakne modellen uten sikkerhetslagene som følger med forbrukerproduktet.the-decoder
Den mer presserende sårbarheten ligger i indirekte ledetekst-injeksjoner, der ondsinnede instruksjoner er skjult inne i dokumenter eller nettsider som modellen leser. Ekstern testing utført av sikkerhetsselskapet Gray Swan, ved bruk av 1 810 kuraterte angrep fra deres IPI Arena, fant at Astra kunne hackes minst én gang i 8,5 prosent av scenariene ved 15 forsøk. Dette representerer en markant forbedring fra GPT-5.6 Sols feilrate på 27 prosent i samme evaluering, men det betyr fortsatt at modellen kan lures gjennom injiserte instruksjoner i omtrent ett av tolv tilfeller.the-decoder
Anthropics Claude Opus 5 presterte bedre i samme test med en feilrate på 4,8 prosent, selv om heller ikke den var immun.the-decoder
Astra er OpenAIs første modell som når den kritiske terskelen for cybersikkerhet under selskapets rammeverk for beredskap. Det betyr at den kan identifisere og utnytte null-dags-sårbarheter i herdede systemer uten menneskelig veiledning. Denne evnen, kombinert med modellens mulighet til å surfe på nettet, bruke datamaskiner og utføre flertrinns-oppgaver autonomt, gjør gapet ved indirekte ledetekst-injeksjoner mer konsekvensfylt enn for en enklere chatbot.deploymentsafety.openai+2
Som The Decoder bemerket, for ethvert sikkerhetsteam i en bedrift som vurderer Astra for agent-distribusjon, antyder resultatene for indirekte injeksjoner at modellen ennå ikke er pålitelig nok for miljøer der ikke-klarert innhold kan nå den.the-decoder