Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

droid-life+1x+1x+1Google Alphabet Inc. hat am Dienstag ein bedeutendes Update für Android Bench veröffentlicht, seine Bestenliste zur Bewertung der Leistung von KI-Modellen bei realen Android-Entwicklungsaufgaben. Die Aktualisierung fügt acht neue Modelle zu den Ranglisten hinzu – angeführt von Anthropics Claude Fable 5, das sich mit einer Genauigkeitsrate von 84,5 Prozent den Spitzenplatz sicherte – und stellt das zugrunde liegende Framework des Benchmarks auf ein neues System namens Harbor um.developer.android+1
Die aktualisierte Bestenliste vom 8. Juli führt Claude Fable 5 auf Platz 1, gefolgt von OpenAIs GPT 5.5 mit 80,2 Prozent und Claude Sonnet 5 mit 76,2 Prozent. Googles eigenes Gemini 3.1 Pro Preview belegte mit 73,7 Prozent den fünften Platz und lag damit auch hinter GPT 5.4. Zu den weiteren neu hinzugefügten Modellen gehören Qwen 3.7 Max, Qwen 3.7 Plus, GLM 5.2, Kimi K2.7 Code und MiniMax M3.developer.android
Die Ergebnisse setzen ein Muster fort, das erstmals im Mai festgestellt wurde, als GPT 5.5 die Bestenliste anführte und Gemini den Modellen von OpenAI um etwa zwei Prozentpunkte hinterherhinkte. Mit Fable 5 im Wettbewerb hat sich die Lücke an der Spitze weiter vergrößert. Das Modell, das im Juni von Anthropic veröffentlicht wurde, erzielte führende Ergebnisse bei mehreren Coding-Benchmarks, darunter 80,3 Prozent bei SWE-Bench Pro.atlascloud+2
Neben der Hinzufügung von Modellen migrierte Google das Android Bench-Framework zu Harbor, das laut Google anspruchsvollere, praxisnahe KI-Argumentationstests ermöglicht. Der Benchmark bewertet Modelle anhand von 100 Testfällen, die jeweils zehnmal ausgeführt werden, und misst dabei nicht nur die Genauigkeit, sondern auch die Latenz und die Kosten pro Durchlauf – Dimensionen, die Google erstmals im Mai einführte.x+2
Google gab zudem an, dass Entwickler nun direkt zum Benchmark beitragen können, eine Änderung, die das Spektrum der Android-spezifischen Programmieraufgaben zur Modellprüfung erweitern könnte. Mehrere ältere Modelle, darunter Claude Opus 4.6, Claude Sonnet 4.5 und frühere GPT-Varianten, wurden mit dem Update archiviert.developer.android+1
Die Kosten- und Geschwindigkeitsdaten in der neuen Bestenliste bieten eine praktische Perspektive jenseits der reinen Genauigkeit. Deepseek V4 Flash erzielt beispielsweise bescheidene 54,7 Prozent, kostet aber nur 1,50 US-Dollar pro Benchmark-Durchlauf, während die Spitzenleistung von Claude Fable 5 133,20 US-Dollar pro Durchlauf kostet. Diese Kompromisse unterstreichen die Entscheidungen, vor denen Android-Entwickler stehen, während KI-gestützte Programmiertools in den täglichen Arbeitsablauf integriert werden – und während Googles eigene Modelle weiterhin versuchen, die Konkurrenten von Anthropic und OpenAI auf dem von Google selbst entwickelten Benchmark einzuholen.developer.android