Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

deploymentsafety.openai+1the-decoderopenaiGPT-6 Astra d'OpenAI, lancé le 3 septembre, marque une amélioration mesurable de la précision factuelle et de la résistance à la manipulation directe des prompts par rapport à son prédécesseur, GPT-5.6 Sol. Mais des tests de sécurité indépendants révèlent que le modèle peut toujours être compromis par des instructions cachées intégrées dans les documents qu'il traite, une faiblesse qui complique son utilisation dans les déploiements en entreprise et basés sur des agents.
Selon la fiche technique d'OpenAI, Astra reproduit les erreurs factuelles connues beaucoup moins fréquemment que GPT-5.6 Sol, les gains les plus importants apparaissant dans les paramètres à faible latence et aux niveaux de raisonnement inférieurs. Pour les injections directes de prompts, où les utilisateurs tentent de manipuler le modèle via leurs propres entrées, Astra atteint un taux de défense de 99,99 %, un résultat qu'OpenAI attribue à sa méthode GPT-Red, qui utilise un attaquant automatisé pour renforcer le modèle pendant l'entraînement.the-decoder+1
La résistance au jailbreak suit un modèle similaire. Face à un ensemble de données fixe d'attaques connues ciblant des réponses nuisibles en biologie, violence et cybersécurité, Astra refuse de se conformer dans 91,5 à 98,3 % des cas. Cependant, lorsque les adversaires adaptent leur stratégie sur plusieurs tours de conversation, le taux de défense chute à environ 67 %, ce qui signifie que des attaquants persistants peuvent obtenir une réponse problématique environ une fois sur trois. OpenAI a noté que ces tests ont été effectués sur le modèle brut sans les couches de sécurité de production qui accompagnent le produit grand public.the-decoder
La vulnérabilité la plus pressante réside dans les injections indirectes de prompts, où des instructions malveillantes sont dissimulées dans des documents ou des pages web que le modèle lit. Des tests externes de la société de sécurité Gray Swan, utilisant 1 810 attaques sélectionnées de son IPI Arena, ont révélé qu'Astra pouvait être compromis au moins une fois dans 8,5 % des scénarios sur 15 tentatives. Cela représente une amélioration marquée par rapport au taux d'échec de 27 % de GPT-5.6 Sol lors de la même évaluation, mais cela signifie toujours que le modèle peut être trompé par des instructions injectées dans environ un scénario sur douze.the-decoder
Claude Opus 5 d'Anthropic a obtenu de meilleurs résultats lors du même test, avec un taux d'échec de 4,8 %, bien qu'il ne soit pas immunisé non plus.the-decoder
Astra est le premier modèle d'OpenAI à atteindre le seuil de capacité de cybersécurité "Critique" selon le cadre de préparation de l'entreprise, ce qui signifie qu'il peut identifier et exploiter des vulnérabilités zero-day sur des systèmes renforcés sans aide humaine. Cette capacité, associée à celle du modèle à naviguer sur le web, à utiliser des ordinateurs et à exécuter des tâches en plusieurs étapes de manière autonome, rend la faille des injections indirectes plus lourde de conséquences que pour un chatbot plus simple.deploymentsafety.openai+2
Comme l'a noté The Decoder, pour toute équipe de sécurité d'entreprise évaluant Astra pour des déploiements d'agents, les résultats concernant les injections indirectes suggèrent que le modèle n'est pas encore assez fiable pour des environnements où du contenu non approuvé pourrait l'atteindre.the-decoder