Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

trendingtopics+1trendingtopicstrendingtopics+1Le GPT-6 Astra d'OpenAI, lancé le 3 septembre 2026, a suscité un désaccord rare parmi les évaluateurs indépendants : l'un le classe comme le meilleur modèle d'IA au monde, tandis qu'un autre le place au même niveau que son prédécesseur et derrière son rival Anthropic.
L'indice composite des capacités d'Epoch AI attribue à Astra un score de 169, le plaçant premier parmi 267 modèles, devant le Claude Fable 5.1 d'Anthropic (163). Artificial Analysis, une société d'analyse comparative basée à San Francisco, est arrivée à une conclusion différente. Son Intelligence Index évalue Astra à 61 points, égalant exactement le GPT-5.6 Sol d'OpenAI et de Microsoft Corporation , tandis que le Claude Fable 5.1 d'Anthropic le devance de cinq points avec 66. Pour les tâches de codage, le tableau est plus favorable : Astra a obtenu 67 sur l'indice des agents de codage d'Artificial Analysis, à peu près au même niveau que Claude Opus 5 et le Muse Spark 1.3 de Meta .trendingtopics+4
Ce désaccord provient en partie de ce que chaque indice mesure. Epoch AI agrège les scores en matière de raisonnement, de mathématiques, de sciences et de benchmarks d'agents en un seul chiffre, tandis qu'Artificial Analysis pondère différemment les connaissances, le raisonnement sur documents longs et la précision factuelle. Epoch AI a noté sur X que le record d'Astra se situait "dans la marge d'incertitude" des leaders précédents, suggérant que l'écart pourrait être plus faible que ne le laisse penser le chiffre principal.latent+1
L'organisation ARC Prize a fourni sa propre évaluation, testant Astra sur ARC-AGI-3, un benchmark interactif qui exige des agents qu'ils explorent des environnements inconnus, déduisent des objectifs et planifient des actions sans instructions explicites. Avec le harnais standard, Astra a obtenu 62,7 % pour un coût d'environ 26 000 dollars par exécution. Avec le Provider Adapter d'OpenAI, qui préserve l'état de raisonnement du modèle entre les requêtes, le score a grimpé à 99,9 % pour environ 19 000 dollars.arcprize
Une découverte marquante a été l'efficacité d'action d'Astra. Testé par rapport à une base de référence issue d'environ 500 participants humains, Astra a utilisé moins d'actions que la médiane humaine sur 96 % des niveaux et a utilisé en moyenne 51,7 % d'actions en moins par niveau au total. "C'est une étape importante", a écrit ARC Prize, ajoutant que le résultat "a égalé et dépassé la parité humaine" selon leur mesure de l'efficacité d'action.arcprize
Epoch AI a également rapporté que sur son nouveau benchmark FrontierMath Erdős, un ensemble de 68 problèmes ouverts posés par le mathématicien Paul Erdős, Astra était le seul modèle à en résoudre certains, produisant des preuves vérifiées par Lean pour deux problèmes avec un budget de 300 dollars par tentative. Trois solutions supplémentaires ont émergé d'exécutions non standardisées plus coûteuses dépassant 220 000 dollars, qu'Epoch a exclues du score officiel.the-decoder+1
Pour les développeurs, la performance a un prix. OpenAI a fixé les tarifs de l'API d'Astra à 10 dollars par million de jetons d'entrée et 50 dollars par million de jetons de sortie, soit une augmentation de 2,5 fois par rapport au GPT-5.6 Sol. Artificial Analysis a constaté que l'efficacité améliorée des jetons d'Astra compense les prix plus élevés pour les tâches de codage, mais rend le modèle environ 75 % plus cher par tâche pour les travaux d'intelligence générale.trendingtopics