Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

benchlm+1anthropic+1techcrunchAnthropicin Claude-tekoälymallit hallitsevat SWE-bench-koodaustestin kaikkia merkittäviä versioita syyskuussa 2026. Claude Opus 5 saavutti 96 prosentin tuloksen SWE-bench Verified -testissä ja Claude Fable 5.1 sai 81,2 prosenttia vaativammassa SWE-bench Pro -testissä. Tulokset korostavat Anthropicin kasvavaa etumatkaa tekoälyavusteisessa ohjelmistosuunnittelussa, vaikka OpenAI:n ja Google Alphabet Inc:n kilpailevat mallit kurovatkin eroa umpeen muilla osa-alueilla.benchlm+2
Pricetonin yliopiston tutkijoiden kehittämä SWE-bench testaa, pystyvätkö tekoälymallit ratkaisemaan todellisia GitHub-ongelmia luomalla korjaustiedostoja, jotka läpäisevät sekä uudet että olemassa olevat testisarjat. 500 ongelman valikoidussa SWE-bench Verified -joukossa Claude Opus 5 johtaa 96 prosentilla, jota seuraavat Claude Mythos 5 (95,5 %) ja Claude Fable 5 (95 %). SWE-bench Pro -testissä, joka kattaa 1 865 ongelmaa 41 arkistossa ja testaa pitkäkestoisempia suunnittelutehtäviä, Claude Fable 5.1 on kärjessä 81,2 prosentin tuloksella.benchlm+4
Kehitys on ollut nopeaa. Vuoden 2025 alussa Anthropicin Claude 3.5 Sonnet sai 49 prosenttia SWE-bench Verified -testissä. Vuoden 2025 loppuun mennessä Claude Sonnet 4.5 saavutti 77,2 prosenttia. Claude Opus 4.5 nosti tuloksen 80,9 prosenttiin vuoden 2026 alkuun mennessä, ja jokainen seuraava mallisukupolvi (Opus 4.7, Opus 4.8, Mythos sekä Opus 5- ja Fable 5 -perheet) on kasvattanut etumatkaa entisestään.dev+5
Anthropicin dominanssi SWE-benchissä tapahtuu tekoälykoodauksen kiivastuvassa kilpailussa. Devin-koodausavustajan takana oleva startup-yritys Cognition keräsi juuri 2 miljardia dollaria 48 miljardin dollarin arvostuksella, ja sen vuotuinen liikevaihto on kasvanut 492 miljoonasta 900 miljoonaan dollariin neljässä kuukaudessa. Amazon Web Services (Amazon.com, Inc. ) markkinoi Kiro-koodaustyökaluaan opiskelijoille 132 yliopistossa ympäri maailmaa. OpenAI:n uusin lippulaivamalli GPT-5.6 Sol on noussut tasoihin Clauden kanssa joissakin yleisissä testeissä, mutta jää jälkeen agenttipohjaisissa koodaustehtävissä saaden 37,3 prosenttia Terminal-Bench 4.0 -testissä, kun Fable 5.1 sai 55,8 prosenttia.techcrunch+3
Kaikki eivät pidä SWE-bench-pisteitä lopullisina. ArXiv-palvelussa julkaistu tutkimus osoitti, että parhaat mallit pystyivät tunnistamaan virheellisiä tiedostopolkuja jopa 76 prosentin tarkkuudella pelkkien ongelmakuvausten perusteella. Tämä herättää kysymyksen siitä, päättelykykyisyyden sijaan mallit saattavatkin tukeutua osittain datan kaavoihin. Anthropic itse on siirtänyt uusimpien malliensa pääpainon pidemmän aikavälin agenttitehtäviin, kuten Terminal-Benchiin, jossa Fable 5.1 yli kaksinkertaisti edeltäjänsä tuloksen tieteellisissä tutkimusongelmissa. Yritys ei edes nostanut esiin uutta SWE-bench-lukua Fable 5.1:lle, mikä viittaa siihen, että Anthropic itsekin pitää testiä lähestymässä kyllästymispistettään.arxiv+2