Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

benchlm+1anthropic+1techcrunchDie Claude KI-Modelle von Anthropic halten zum September 2026 die Spitzenpositionen in jeder wichtigen Variante des SWE-bench-Benchmarks, wobei Claude Opus 5 bei SWE-bench Verified 96 Prozent erreicht und Claude Fable 5.1 bei dem anspruchsvolleren SWE-bench Pro 81,2 Prozent erzielt. Die Ergebnisse unterstreichen den wachsenden Vorsprung von Anthropic im Bereich der KI-gestützten Softwareentwicklung, auch wenn Konkurrenten von OpenAI und Google Alphabet Inc. an anderen Fronten weiter aufholen.benchlm+2
SWE-bench, entwickelt von Forschern der Princeton University, testet, ob KI-Modelle reale GitHub-Probleme lösen können, indem sie Patches generieren, die sowohl neue als auch bestehende Testsuiten bestehen. Bei SWE-bench Verified, einer kuratierten Teilmenge von 500 Problemen, führt Claude Opus 5 mit 96 Prozent, gefolgt von Claude Mythos 5 mit 95,5 Prozent und Claude Fable 5 mit 95 Prozent. Bei SWE-bench Pro, das 1.865 Probleme in 41 Repositories umfasst und komplexere technische Aufgaben testet, führt Claude Fable 5.1 die Bestenliste mit 81,2 Prozent an.benchlm+4
Die Entwicklung verlief rasant. Anfang 2025 erzielte Anthropics Claude 3.5 Sonnet 49 Prozent bei SWE-bench Verified. Ende 2025 erreichte Claude Sonnet 4.5 77,2 Prozent. Claude Opus 4.5 steigerte dies bis Anfang 2026 auf 80,9 Prozent, und jede nachfolgende Modellgeneration – Opus 4.7, Opus 4.8, Mythos sowie die Opus 5- und Fable 5-Familien – baute den Vorsprung weiter aus.dev+5
Die Dominanz von Anthropic bei SWE-bench findet inmitten eines intensiven KI-Programmier-Wettlaufs statt. Cognition, das Startup hinter dem Programmierassistenten Devin, hat gerade 2 Milliarden Dollar bei einer Bewertung von 48 Milliarden Dollar aufgenommen, wobei der annualisierte Umsatz in vier Monaten von 492 Millionen auf 900 Millionen Dollar gestiegen ist. Amazon Web Services Amazon.com, Inc. bringt sein Programmiertool Kiro an 132 Universitäten weltweit zu Studenten. OpenAIs GPT-5.6 Sol, das neueste Flaggschiff, hat bei einigen allgemeinen Benchmarks zu Claude aufgeschlossen, liegt aber bei agentenbasierten Programmieraufgaben zurück und erreicht 37,3 Prozent bei Terminal-Bench 4.0 im Vergleich zu 55,8 Prozent bei Fable 5.1.techcrunch+3
Nicht jeder betrachtet SWE-bench-Ergebnisse als endgültig. Auf arXiv veröffentlichte Forschungsergebnisse ergaben, dass Spitzenmodelle fehlerhafte Dateipfade mit einer Genauigkeit von bis zu 76 Prozent allein anhand von Problembeschreibungen identifizieren konnten, was Fragen darüber aufwirft, ob die Modelle wirklich schlussfolgern oder sich teilweise auf Muster in den Daten verlassen. Anthropic selbst hat seine Haupt-Benchmarks für neuere Modelle auf längerfristige agentenbasierte Aufgaben wie Terminal-Bench verlagert, wo Fable 5.1 das Ergebnis seines Vorgängers bei wissenschaftlichen Forschungsproblemen mehr als verdoppelte. Das Unternehmen nannte für Fable 5.1 gar keine neue SWE-bench-Zahl mehr, was darauf hindeutet, dass selbst Anthropic den Benchmark am oberen Ende als gesättigt betrachtet.arxiv+2