Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

x+1openai+1morphllm+1OpenAI a annoncé mardi qu'elle retirait sa recommandation de SWE-Bench Pro en tant que mesure fiable de la capacité de codage de l'IA, citant un audit interne qui a révélé qu'environ 30 % des tâches du benchmark sont défectueuses et un plafond de bruit d'environ 70 % qui compromet son utilité pour évaluer les modèles de pointe.x+1
Ce retrait marque la deuxième fois en moins de six mois qu'OpenAI se détourne d'une évaluation de codage majeure. En février 2026, l'entreprise a cessé de rapporter les scores sur SWE-bench Verified — un benchmark qu'elle a aidé à créer en 2024 — après avoir découvert que 59,4 % des tâches auditées contenaient des cas de test défectueux et que la contamination des données d'entraînement avait rendu les scores dénués de sens.openai+1
À l'époque, OpenAI a orienté les chercheurs vers SWE-Bench Pro, un benchmark plus difficile développé par Scale AI qui comprend 1 865 tâches d'ingénierie logicielle à long terme dans 41 dépôts professionnels. Le benchmark a été conçu pour résister aux problèmes de contamination qui ont affecté son prédécesseur, et les meilleurs modèles de pointe n'ont initialement obtenu qu'environ 23 % sur celui-ci.morphllm+3
Mais les scores ont grimpé rapidement. Fin juin 2026, Claude Opus 4.8 a atteint 69,2 % sur les faisceaux agrégés par les fournisseurs et GPT-5.4 (xHigh) a obtenu 59,1 % sur l'ensemble public standardisé de Scale. L'audit d'OpenAI conclut désormais que les scores dans cette fourchette ne reflètent plus les différences de capacité réelles entre les modèles ; ils reflètent plutôt les limites du benchmark lui-même, notamment des spécifications de tâches défectueuses et une infrastructure de test bruyante.morphllm+3
L'entreprise a qualifié SWE-Bench Pro de "l'un des benchmarks de codage IA les plus utilisés" et a exhorté la communauté de recherche à se tourner vers de nouvelles méthodes d'évaluation.digg+1
L'annonce intensifie une crise de confiance croissante dans les évaluations de codage par IA. Les chercheurs ont noté que l'écart entre les performances des benchmarks et l'ingénierie logicielle du monde réel reste important, les modèles qui obtiennent de bons résultats lors d'évaluations structurées ayant souvent du mal avec des tâches nécessitant un véritable raisonnement architectural ou la construction complète de programmes à partir de zéro. OpenAI n'a pas encore nommé de benchmark de remplacement, laissant le domaine sans norme consensuelle pour mesurer les progrès du codage de pointe.tianpan+1