Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

benchlm+1anthropic+1techcrunchLes modèles d'IA Claude d'Anthropic occupent les premières places sur toutes les variantes majeures du benchmark de codage SWE-bench en septembre 2026, Claude Opus 5 atteignant 96 % sur SWE-bench Verified et Claude Fable 5.1 obtenant 81,2 % sur le plus exigeant SWE-bench Pro. Ces résultats soulignent l'avance croissante d'Anthropic dans l'ingénierie logicielle assistée par IA, alors même que ses rivaux d'OpenAI et de Google Alphabet Inc. continuent de réduire l'écart sur d'autres fronts.benchlm+2
SWE-bench, créé par des chercheurs de l'université de Princeton, teste si les modèles d'IA peuvent résoudre des problèmes GitHub réels en générant des correctifs qui réussissent à la fois les nouvelles suites de tests et les anciennes. Sur SWE-bench Verified, un sous-ensemble sélectionné de 500 problèmes, Claude Opus 5 est en tête avec 96 %, suivi de Claude Mythos 5 avec 95,5 % et de Claude Fable 5 avec 95 %. Sur SWE-bench Pro, qui couvre 1 865 problèmes dans 41 dépôts et teste des tâches d'ingénierie à plus long terme, Claude Fable 5.1 arrive en tête du classement avec 81,2 %.benchlm+4
La progression a été fulgurante. Début 2025, le modèle Claude 3.5 Sonnet d'Anthropic avait obtenu 49 % sur SWE-bench Verified. Fin 2025, Claude Sonnet 4.5 atteignait 77,2 %. Claude Opus 4.5 a porté ce score à 80,9 % début 2026, et chaque génération de modèle suivante (Opus 4.7, Opus 4.8, Mythos, ainsi que les familles Opus 5 et Fable 5) a encore creusé l'écart.dev+5
La domination d'Anthropic sur SWE-bench s'inscrit dans une course aux armements intensifiée dans le domaine du codage par IA. Cognition, la startup derrière l'assistant de codage Devin, vient de lever 2 milliards de dollars pour une valorisation de 48 milliards, avec un chiffre d'affaires annualisé passant de 492 à 900 millions de dollars en quatre mois. Amazon Web Services, filiale d'Amazon.com, Inc. , déploie son outil de codage Kiro auprès d'étudiants dans 132 universités à travers le monde. GPT-5.6 Sol d'OpenAI, son dernier fleuron, a atteint un niveau comparable à celui de Claude sur certains benchmarks généraux, mais reste à la traîne sur les tâches de codage agentique, avec un score de 37,3 % sur Terminal-Bench 4.0 contre 55,8 % pour Fable 5.1.techcrunch+3
Tout le monde ne considère pas les scores SWE-bench comme définitifs. Des recherches publiées sur arXiv ont révélé que les meilleurs modèles pouvaient identifier des chemins de fichiers bogués avec une précision allant jusqu'à 76 % en utilisant uniquement les descriptions des problèmes, ce qui soulève des questions sur la capacité réelle de raisonnement des modèles par rapport à une simple dépendance aux modèles statistiques des données. Anthropic elle-même a orienté ses benchmarks phares pour les nouveaux modèles vers des tâches agentiques à plus long terme comme Terminal-Bench, où Fable 5.1 a plus que doublé le score de son prédécesseur sur des problèmes de recherche scientifique. L'entreprise n'a même pas mis en avant un nouveau score SWE-bench pour Fable 5.1, suggérant qu'Anthropic elle-même considère que le benchmark approche de la saturation sur le segment haut de gamme.arxiv+2