Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

benchlm+1anthropic+1techcrunchAnthropics Claude AI-modeller innehar toppositionerna i varje större variant av kodningstestet SWE-bench per september 2026, där Claude Opus 5 når 96 procent på SWE-bench Verified och Claude Fable 5.1 får 81,2 procent på det mer krävande SWE-bench Pro. Resultaten understryker Anthropics växande försprång inom AI-assisterad mjukvaruutveckling, även om rivaler från OpenAI och Google Alphabet Inc. fortsätter att minska avståndet på andra fronter.benchlm+2
SWE-bench, skapat av forskare vid Princeton University, testar om AI-modeller kan lösa verkliga GitHub-problem genom att generera korrigeringar som klarar både nya och befintliga testsviter. På SWE-bench Verified, ett kurerat urval av 500 problem, leder Claude Opus 5 med 96 procent, följt av Claude Mythos 5 med 95,5 procent och Claude Fable 5 med 95 procent. På SWE-bench Pro, som omfattar 1 865 problem i 41 arkiv och testar mer långsiktiga ingenjörsuppgifter, toppar Claude Fable 5.1 resultatlistan med 81,2 procent.benchlm+4
Utvecklingen har varit brant. I början av 2025 fick Anthropics Claude 3.5 Sonnet 49 procent på SWE-bench Verified. Sent under 2025 nådde Claude Sonnet 4.5 77,2 procent. Claude Opus 4.5 pressade upp det till 80,9 procent i början av 2026, och varje efterföljande modellgeneration – Opus 4.7, Opus 4.8, Mythos samt familjerna Opus 5 och Fable 5 – har utökat försprånget ytterligare.dev+5
Anthropics dominans på SWE-bench kommer mitt i ett intensivt kapplöpningsrace inom AI-kodning. Cognition, startupen bakom kodningsassistenten Devin, tog nyligen in 2 miljarder dollar till en värdering på 48 miljarder dollar, med en årlig omsättning som vuxit från 492 miljoner till 900 miljoner dollar på fyra månader. Amazon Web Services Amazon.com, Inc. lanserar sitt kodningsverktyg Kiro för studenter vid 132 universitet världen över. OpenAIs GPT-5.6 Sol, deras senaste flaggskepp, har närmat sig Claude på vissa generella tester men ligger efter i agentbaserade kodningsuppgifter, med 37,3 procent på Terminal-Bench 4.0 jämfört med Fable 5.1:s 55,8 procent.techcrunch+3
Alla betraktar inte SWE-bench-resultat som definitiva. Forskning publicerad på arXiv fann att toppmodeller kunde identifiera felaktiga filsökvägar med upp till 76 procents noggrannhet genom att bara använda problembeskrivningar, vilket väcker frågor om huruvida modellerna verkligen resonerar eller delvis förlitar sig på mönster i datan. Anthropic har själva flyttat sina huvudtester för nyare modeller mot mer långsiktiga agentuppgifter som Terminal-Bench, där Fable 5.1 mer än fördubblade sin föregångares resultat på vetenskapliga forskningsproblem. Företaget presenterade inte ens ett nytt SWE-bench-resultat för Fable 5.1, vilket tyder på att även Anthropic anser att testet närmar sig mättnad i det övre skiktet.arxiv+2