Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

droid-life+1x+1x+1Google Alphabet Inc. a déployé mardi une mise à jour majeure d'Android Bench, son classement pour évaluer la capacité des modèles d'IA à gérer des tâches de développement Android réelles. Cette mise à jour ajoute huit nouveaux modèles au classement — menés par Claude Fable 5 d'Anthropic, qui s'est emparé de la première place avec un score de précision de 84,5 % — et migre le cadre sous-jacent du benchmark vers un nouveau système appelé Harbor.developer.android+1
Le classement mis à jour, publié le 8 juillet, place Claude Fable 5 en première position, suivi par GPT 5.5 d'OpenAI à 80,2 % et Claude Sonnet 5 à 76,2 %. Le propre Gemini 3.1 Pro Preview de Google s'est classé cinquième avec 73,7 %, derrière GPT 5.4 également. D'autres modèles récemment ajoutés incluent Qwen 3.7 Max, Qwen 3.7 Plus, GLM 5.2, Kimi K2.7 Code et MiniMax M3.developer.android
Les résultats poursuivent une tendance observée pour la première fois en mai, lorsque GPT 5.5 était en tête du classement et que Gemini suivait les modèles d'OpenAI d'environ deux points de pourcentage. Avec Fable 5 désormais dans la course, l'écart au sommet s'est encore creusé. Le modèle, publié par Anthropic en juin, a affiché des scores de premier plan sur plusieurs benchmarks de codage, dont 80,3 % sur SWE-Bench Pro.atlascloud+2
Au-delà de l'ajout de modèles, Google a migré le cadre Android Bench vers Harbor, qu'il a décrit comme permettant des tests de raisonnement par IA plus difficiles et plus proches de la réalité. Le benchmark évalue les modèles sur 100 cas de test exécutés 10 fois chacun, mesurant non seulement la précision mais aussi la latence et le coût par exécution — des dimensions que Google a introduites pour la première fois en mai.x+2
Google a également indiqué que les développeurs peuvent désormais contribuer directement au benchmark, un changement qui pourrait élargir l'éventail des défis de codage spécifiques à Android utilisés pour tester les modèles. Plusieurs modèles plus anciens, notamment Claude Opus 4.6, Claude Sonnet 4.5 et des variantes antérieures de GPT, ont été archivés lors de la mise à jour.developer.android+1
Les données sur le coût et la vitesse dans le nouveau classement offrent une perspective pratique au-delà de la simple précision brute. Deepseek V4 Flash, par exemple, obtient un score modeste de 54,7 % mais ne coûte que 1,50 $ par exécution de benchmark, tandis que le score le plus élevé de Claude Fable 5 coûte 133,20 $ par exécution. Ces compromis soulignent les choix auxquels sont confrontés les développeurs Android à mesure que les outils de codage assistés par IA s'intègrent dans les flux de travail quotidiens — et à mesure que les propres modèles de Google continuent de poursuivre leurs rivaux d'Anthropic et d'OpenAI sur le benchmark que Google a lui-même construit.developer.android