Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

benchlm+1anthropic+1techcrunchEylül 2026 itibarıyla Anthropic'in Claude AI modelleri, SWE-bench kodlama testinin tüm ana varyantlarında zirveyi elinde tutuyor. Claude Opus 5, SWE-bench Verified'da %96'ya ulaşırken, Claude Fable 5.1 daha zorlu olan SWE-bench Pro'da %81,2 puan aldı. Bu sonuçlar, OpenAI ve Google Alphabet Inc. gibi rakipler diğer alanlarda arayı kapatmaya çalışsa da, Anthropic'in AI destekli yazılım mühendisliğindeki artan liderliğini vurguluyor.benchlm+2
Princeton Üniversitesi araştırmacıları tarafından oluşturulan SWE-bench, AI modellerinin hem yeni hem de mevcut test paketlerini geçen yamalar oluşturarak gerçek dünya GitHub sorunlarını çözüp çözemeyeceğini test ediyor. 500 soruluk seçilmiş bir alt küme olan SWE-bench Verified'da Claude Opus 5, %96 ile lider durumda; onu %95,5 ile Claude Mythos 5 ve %95 ile Claude Fable 5 takip ediyor. 41 depodaki 1865 soruyu kapsayan ve daha uzun vadeli mühendislik görevlerini test eden SWE-bench Pro'da ise Claude Fable 5.1, %81,2 ile liderlik koltuğunda oturuyor.benchlm+4
İlerleme oldukça hızlı oldu. 2025'in başlarında Anthropic'in Claude 3.5 Sonnet'i SWE-bench Verified'da %49 puan almıştı. 2025'in sonlarına doğru Claude Sonnet 4.5, %77,2'ye ulaştı. Claude Opus 4.5, 2026'nın başlarında bu oranı %80,9'a çıkardı ve her yeni model nesli (Opus 4.7, Opus 4.8, Mythos ve Opus 5 ile Fable 5 aileleri) bu liderliği daha da ileri taşıdı.dev+5
Anthropic'in SWE-bench'teki hakimiyeti, yoğunlaşan bir AI kodlama silahlanma yarışı sırasında gerçekleşiyor. Devin kodlama asistanının arkasındaki girişim olan Cognition, 48 milyar dolar değerleme üzerinden 2 milyar dolar yatırım aldı ve yıllık geliri dört ay içinde 492 milyon dolardan 900 milyon dolara çıktı. Amazon Web Services Amazon.com, Inc. , Kiro kodlama aracını dünya çapında 132 üniversitedeki öğrencilere sunuyor. OpenAI'ın en yeni amiral gemisi GPT-5.6 Sol, bazı genel testlerde Claude ile neredeyse aynı seviyeye gelse de, Terminal-Bench 4.0'da %37,3 puan alarak Fable 5.1'in %55,8'lik skorunun gerisinde kaldı ve ajan tabanlı kodlama görevlerinde zayıf kaldı.techcrunch+3
Herkes SWE-bench puanlarını kesin bir ölçüt olarak görmüyor. arXiv'de yayınlanan bir araştırma, en iyi modellerin yalnızca sorun açıklamalarını kullanarak hatalı dosya yollarını %76'ya varan doğrulukla tanımlayabildiğini ortaya koydu; bu da modellerin gerçekten akıl yürütüp yürütmediği yoksa verilerdeki kalıplara mı dayandığı konusunda soru işaretleri yarattı. Anthropic, yeni modelleri için ana testlerini Terminal-Bench gibi daha uzun vadeli ajan görevlerine kaydırdı; burada Fable 5.1, bilimsel araştırma problemlerinde önceki modelin skorunu ikiye katladı. Şirket, Fable 5.1 için yeni bir SWE-bench numarası açıklamadı, bu da Anthropic'in bile testin üst sınırda doygunluğa yaklaştığını düşündüğünü gösteriyor.arxiv+2