Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

benchlm+1anthropic+1techcrunchAnthropics Claude AI-modeller innehar topplasseringene på tvers av alle hovedvarianter av SWE-bench-kodetesten per september 2026, der Claude Opus 5 oppnår 96 prosent på SWE-bench Verified og Claude Fable 5.1 scorer 81,2 prosent på den mer krevende SWE-bench Pro. Resultatene understreker Anthropics økende forsprang innen AI-assistert programvareutvikling, selv om rivaler fra OpenAI og Google Alphabet Inc. fortsetter å tette gapet på andre områder.benchlm+2
SWE-bench, utviklet av forskere ved Princeton University, tester om AI-modeller kan løse reelle GitHub-problemer ved å generere rettelser som består både nye og eksisterende testsett. På SWE-bench Verified, et kuratert utvalg på 500 problemer, leder Claude Opus 5 med 96 prosent, etterfulgt av Claude Mythos 5 med 95,5 prosent og Claude Fable 5 med 95 prosent. På SWE-bench Pro, som dekker 1865 problemer på tvers av 41 repositorier og tester mer komplekse ingeniøroppgaver, topper Claude Fable 5.1 resultatlisten med 81,2 prosent.benchlm+4
Utviklingen har vært bratt. Tidlig i 2025 scoret Anthropics Claude 3.5 Sonnet 49 prosent på SWE-bench Verified. Sent i 2025 nådde Claude Sonnet 4.5 77,2 prosent. Claude Opus 4.5 økte dette til 80,9 prosent tidlig i 2026, og hver påfølgende modellgenerasjon – Opus 4.7, Opus 4.8, Mythos, samt Opus 5- og Fable 5-familiene – har utvidet forspranget ytterligere.dev+5
Anthropics dominans på SWE-bench kommer midt i et intenst våpenkappløp innen AI-koding. Cognition, oppstartsselskapet bak Devin-kodeassistenten, hentet nylig 2 milliarder dollar til en verdi på 48 milliarder dollar, med en årlig omsetning som har vokst fra 492 millioner til 900 millioner dollar på fire måneder. Amazon Web Services Amazon.com, Inc. ruller ut sitt Kiro-kodeverktøy til studenter ved 132 universiteter verden over. OpenAIs GPT-5.6 Sol, deres nyeste flaggskip, har nærmet seg Claude på enkelte generelle tester, men ligger etter på agentbaserte kodeoppgaver med en score på 37,3 prosent på Terminal-Bench 4.0, sammenlignet med Fable 5.1s 55,8 prosent.techcrunch+3
Ikke alle anser SWE-bench-resultater som definitive. Forskning publisert på arXiv fant at toppmodeller kunne identifisere feilaktige filstier med opptil 76 prosent nøyaktighet ved kun å bruke problembeskrivelser, noe som reiser spørsmål om modellene faktisk resonnerer eller delvis baserer seg på mønstre i dataene. Anthropic har selv flyttet sine hovedtester for nyere modeller mot mer komplekse agentoppgaver som Terminal-Bench, der Fable 5.1 mer enn doblet forgjengerens score på vitenskapelige forskningsoppgaver. Selskapet fremhevet ikke et nytt SWE-bench-tall for Fable 5.1 i det hele tatt, noe som tyder på at selv Anthropic mener testen nærmer seg metning i toppsjiktet.arxiv+2