Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

deploymentsafety.openai+1the-decoderopenai3 Eylül'de piyasaya sürülen OpenAI GPT-6 Astra, selefi GPT-5.6 Sol'e kıyasla olgusal doğruluk ve doğrudan komut manipülasyonuna karşı direnç konusunda ölçülebilir bir gelişme kaydediyor. Ancak bağımsız güvenlik testleri, modelin işlediği belgelerin içine gömülü gizli talimatlarla hala manipüle edilebildiğini ortaya koyuyor; bu zayıflık, modelin kurumsal ve otonom ajan tabanlı dağıtımlarda kullanımını zorlaştırıyor.
OpenAI'ın sistem kartına göre Astra, bilinen olgusal hataları GPT-5.6 Sol'den çok daha az sıklıkla tekrarlıyor; en büyük kazanımlar düşük gecikme süresi ve düşük akıl yürütme seviyelerinde görülüyor. Kullanıcıların kendi girdileriyle modeli manipüle etmeye çalıştığı doğrudan komut enjeksiyonlarına karşı Astra, %99.99'luk bir savunma oranı elde ediyor. OpenAI bu sonucu, eğitim sırasında modeli güçlendirmek için otomatik bir saldırgan kullanan GPT-Red yöntemine bağlıyor.the-decoder+1
Jailbreak (kısıtlamaları aşma) direnci de benzer bir model izliyor. Biyoloji, şiddet ve siber güvenlik konularında zararlı yanıtları hedefleyen bilinen saldırı veri setlerine karşı Astra, vakaların %91.5 ila %98.3'ünde yanıt vermeyi reddediyor. Ancak saldırganlar stratejilerini birden fazla konuşma turunda uyarladıklarında, savunma oranı yaklaşık %67'ye düşüyor; bu da ısrarcı saldırganların her üç denemeden birinde sorunlu bir yanıt alabileceği anlamına geliyor. OpenAI, bu testlerin tüketici ürünüyle birlikte gelen güvenlik katmanları olmadan, modelin ham hali üzerinde yapıldığını belirtti.the-decoder
Daha acil olan zayıflık, kötü niyetli talimatların modelin okuduğu belgelerin veya web sayfalarının içine gömüldüğü dolaylı komut enjeksiyonlarında yatıyor. Güvenlik firması Gray Swan'ın IPI Arena'sından seçilen 1,810 saldırı ile yaptığı dış testler, Astra'nın 15 deneme verildiğinde vakaların en az %8.5'inde manipüle edilebildiğini gösterdi. Bu, GPT-5.6 Sol'ün aynı değerlendirmedeki %27'lik başarısızlık oranına göre belirgin bir iyileşme olsa da, modelin yaklaşık her on iki senaryodan birinde enjekte edilen talimatlarla kandırılabileceği anlamına geliyor.the-decoder
Anthropic'in Claude Opus 5 modeli aynı testte %4.8'lik başarısızlık oranıyla daha iyi performans gösterdi, ancak o da tamamen bağışık değildi.the-decoder
Astra, OpenAI'ın Hazırlık Çerçevesi kapsamında siber güvenlik yetenek eşiğinde "Kritik" seviyeye ulaşan ilk modeli; bu, modelin insan yardımı olmadan güçlendirilmiş sistemlerde sıfırıncı gün açıklarını tanımlayıp istismar edebileceği anlamına geliyor. Bu yetenek, modelin web'de gezinme, bilgisayar kullanma ve çok adımlı görevleri otonom olarak yürütme becerisiyle birleştiğinde, dolaylı komut enjeksiyonu açığını basit bir sohbet robotuna kıyasla çok daha önemli hale getiriyor.deploymentsafety.openai+2
The Decoder'ın belirttiği gibi, Astra'yı ajan dağıtımları için değerlendiren herhangi bir kurumsal güvenlik ekibi için dolaylı enjeksiyon sonuçları, modelin güvenilmeyen içeriğin ulaşabileceği ortamlar için henüz yeterince güvenilir olmadığını gösteriyor.the-decoder