Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

deploymentsafety.openai+1the-decoderopenaiGPT-6 Astra de OpenAI, lanzado el 3 de septiembre, marca una mejora medible en la precisión factual y la resistencia a la manipulación directa de prompts en comparación con su predecesor, GPT-5.6 Sol. Sin embargo, pruebas de seguridad independientes revelan que el modelo aún puede ser comprometido mediante instrucciones ocultas incrustadas en documentos que procesa, una debilidad que complica su uso en despliegues empresariales y basados en agentes.
Según la tarjeta del sistema de OpenAI, Astra reproduce errores factuales conocidos con mucha menos frecuencia que GPT-5.6 Sol, con las mayores ganancias en configuraciones de baja latencia y niveles de razonamiento inferiores. Para las inyecciones directas de prompts, donde los usuarios intentan manipular el modelo a través de sus propias entradas, Astra logra una tasa de defensa del 99.99 por ciento, un resultado que OpenAI atribuye a su método GPT-Red, que utiliza un atacante automatizado para fortalecer el modelo durante el entrenamiento.the-decoder+1
La resistencia al jailbreak sigue un patrón similar. Frente a un conjunto de datos fijo de ataques conocidos que buscan respuestas dañinas en biología, violencia y ciberseguridad, Astra se niega a cumplir en el 91.5 al 98.3 por ciento de los casos. Sin embargo, cuando los adversarios adaptan su estrategia a lo largo de múltiples rondas de conversación, la tasa de defensa cae a aproximadamente el 67 por ciento, lo que significa que los atacantes persistentes pueden extraer una respuesta problemática una de cada tres veces. OpenAI señaló que estas pruebas se realizaron en el modelo base sin las capas de seguridad de producción que acompañan al producto comercial.the-decoder
La vulnerabilidad más apremiante radica en las inyecciones indirectas de prompts, donde instrucciones maliciosas se ocultan dentro de documentos o páginas web que el modelo lee. Pruebas externas de la firma de seguridad Gray Swan, utilizando 1,810 ataques seleccionados de su IPI Arena, encontraron que Astra podría ser vulnerado al menos una vez en el 8.5 por ciento de los escenarios tras 15 intentos. Eso representa una mejora notable sobre la tasa de fallo del 27 por ciento de GPT-5.6 Sol en la misma evaluación, pero aún significa que el modelo puede ser engañado mediante instrucciones inyectadas en aproximadamente uno de cada doce escenarios.the-decoder
Claude Opus 5 de Anthropic tuvo un mejor desempeño en la misma prueba, con una tasa de fallo del 4.8 por ciento, aunque tampoco fue inmune.the-decoder
Astra es el primer modelo de OpenAI en alcanzar el umbral de capacidad de ciberseguridad "Crítico" bajo el Marco de Preparación de la compañía, lo que significa que puede identificar y explotar vulnerabilidades de día cero en sistemas protegidos sin guía humana. Esa capacidad, junto con la habilidad del modelo para navegar por la web, usar computadoras y ejecutar tareas de varios pasos de forma autónoma, hace que la brecha de inyección indirecta de prompts sea más trascendental de lo que sería para un chatbot más simple.deploymentsafety.openai+2
Como señaló The Decoder, para cualquier equipo de seguridad empresarial que evalúe a Astra para despliegues de agentes, los resultados de inyección indirecta sugieren que el modelo aún no es lo suficientemente confiable para entornos donde podría llegar contenido no confiable.the-decoder