Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

benchlm+1anthropic+1techcrunchClaude-gervigreindarlíkön Anthropic eru í efstu sætum á öllum helstu útgáfum SWE-bench forritunarprófsins frá og með september 2026, þar sem Claude Opus 5 náði 96% á SWE-bench Verified og Claude Fable 5.1 fékk 81,2% á krefjandi SWE-bench Pro. Niðurstöðurnar undirstrika vaxandi yfirburði Anthropic í hugbúnaðarverkfræði með aðstoð gervigreindar, jafnvel þótt keppinautar frá OpenAI og Google Alphabet Inc. haldi áfram að minnka bilið á öðrum sviðum.benchlm+2
SWE-bench, sem vísindamenn við Princeton-háskóla þróuðu, prófar hvort gervigreindarlíkön geti leyst raunveruleg GitHub-vandamál með því að búa til lagfæringar sem standast bæði ný og eldri prófunarsett. Á SWE-bench Verified, sem er úrval 500 vandamála, er Claude Opus 5 efst með 96%, fylgt af Claude Mythos 5 með 95,5% og Claude Fable 5 með 95%. Á SWE-bench Pro, sem nær yfir 1.865 vandamál í 41 gagnageymslu og prófar flóknari verkfræðiverkefni, er Claude Fable 5.1 efst á listanum með 81,2%.benchlm+4
Þróunin hefur verið hröð. Snemma árs 2025 fékk Claude 3.5 Sonnet frá Anthropic 49% á SWE-bench Verified. Seint á árinu 2025 náði Claude Sonnet 4.5 77,2%. Claude Opus 4.5 hækkaði það í 80,9% snemma árs 2026, og hver ný kynslóð líkana, Opus 4.7, Opus 4.8, Mythos, og Opus 5 og Fable 5 fjölskyldurnar, hafa aukið forskotið enn frekar.dev+5
Yfirburðir Anthropic á SWE-bench koma í miðju vaxandi kapphlaupi um gervigreind forritun. Cognition, sprotafyrirtækið á bak við Devin-forritunaraðstoðarmanninn, safnaði nýverið 2 milljörðum dala á 48 milljarða dala virði, þar sem árstekjur jukust úr 492 milljónum dala í 900 milljónir dala á fjórum mánuðum. Amazon Web Services Amazon.com, Inc. er að kynna Kiro-forritunarverkfæri sitt fyrir nemendum í 132 háskólum um allan heim. GPT-5.6 Sol frá OpenAI, nýjasta flaggskip þeirra, hefur náð svipuðum árangri og Claude í sumum almennum prófunum en dregst aftur úr í verkefnum sem krefjast sjálfstæðra vinnubragða, með 37,3% á Terminal-Bench 4.0 samanborið við 55,8% hjá Fable 5.1.techcrunch+3
Ekki eru allir sammála um að SWE-bench einkunnir séu endanlegur mælikvarði. Rannsóknir birtar á arXiv leiddu í ljós að bestu líkönin gætu greint gallaðar skráarslóðir með allt að 76% nákvæmni með því að nota aðeins lýsingar á vandamálum, sem vekur spurningar um hvort líkönin séu í raun að beita rökfræði eða treysta að hluta til á mynstur í gögnunum. Anthropic sjálft hefur fært áherslur sínar í prófunum fyrir nýrri líkön yfir í flóknari verkefni eins og Terminal-Bench, þar sem Fable 5.1 tvöfaldaði einkunn forvera síns í vísindarannsóknum. Fyrirtækið birti ekki nýja SWE-bench tölu fyrir Fable 5.1, sem bendir til þess að jafnvel Anthropic telji prófið vera að ná hámarki.arxiv+2