Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

benchlm+1anthropic+1techcrunch2026 წლის სექტემბრის მდგომარეობით, Anthropic-ის Claude AI მოდელები SWE-bench-ის კოდირების რეიტინგის ყველა ძირითად ვერსიაში ლიდერობენ. Claude Opus 5-მა SWE-bench Verified-ზე 96%-ს მიაღწია, ხოლო Claude Fable 5.1-მა უფრო რთულ SWE-bench Pro-ზე 81.2% დააფიქსირა. ეს შედეგები ხაზს უსვამს Anthropic-ის მზარდ უპირატესობას AI-ზე დაფუძნებულ პროგრამულ ინჟინერიაში, მაშინ როცა OpenAI-სა და Google Alphabet Inc.-ის კონკურენტები სხვა მიმართულებებით ცდილობენ ჩამორჩენის შემცირებას.benchlm+2
პრინსტონის უნივერსიტეტის მკვლევრების მიერ შექმნილი SWE-bench ამოწმებს, შეუძლიათ თუ არა AI მოდელებს GitHub-ის რეალური პრობლემების გადაჭრა ისეთი პატჩების გენერირებით, რომლებიც გადის როგორც ახალ, ისე არსებულ ტესტებს. 500 პრობლემისგან შემდგარ SWE-bench Verified-ზე Claude Opus 5 ლიდერობს 96%-ით, მას მოსდევს Claude Mythos 5 (95.5%) და Claude Fable 5 (95%). SWE-bench Pro-ზე, რომელიც მოიცავს 1865 პრობლემას 41 რეპოზიტორიდან და ამოწმებს გრძელვადიან საინჟინრო ამოცანებს, Claude Fable 5.1 ლიდერობს 81.2%-ით.benchlm+4
პროგრესი შთამბეჭდავია. 2025 წლის დასაწყისში Anthropic-ის Claude 3.5 Sonnet-მა SWE-bench Verified-ზე 49% მიიღო. 2025 წლის ბოლოსთვის Claude Sonnet 4.5-მა 77.2%-ს მიაღწია. Claude Opus 4.5-მა ეს მაჩვენებელი 2026 წლის დასაწყისისთვის 80.9%-მდე გაზარდა, ხოლო ყოველი მომდევნო თაობა — Opus 4.7, Opus 4.8, Mythos და Opus 5 და Fable 5 ოჯახები — კიდევ უფრო აძლიერებდა ამ უპირატესობას.dev+5
Anthropic-ის დომინირება SWE-bench-ზე მიმდინარეობს AI კოდირების ინტენსიური რბოლის ფონზე. სტარტაპმა Cognition-მა, რომელიც Devin კოდირების ასისტენტის უკან დგას, 2 მილიარდი დოლარი მოიზიდა 48 მილიარდი დოლარის შეფასებით, ხოლო მისმა წლიურმა შემოსავალმა ოთხ თვეში 492 მილიონიდან 900 მილიონ დოლარამდე მოიმატა. Amazon Web Services Amazon.com, Inc. თავის Kiro კოდირების ხელსაწყოს მსოფლიოს 132 უნივერსიტეტის სტუდენტებს სთავაზობს. OpenAI-ის უახლესი ფლაგმანი GPT-5.6 Sol ზოგად რეიტინგებში Claude-ს გაუთანაბრდა, თუმცა ჩამორჩება აგენტურულ კოდირების ამოცანებში, სადაც Terminal-Bench 4.0-ზე 37.3% დააფიქსირა, მაშინ როცა Fable 5.1-ის მაჩვენებელი 55.8%-ია.techcrunch+3
ყველა არ მიიჩნევს SWE-bench-ის ქულებს საბოლოო ჭეშმარიტებად. arXiv-ზე გამოქვეყნებულმა კვლევამ აჩვენა, რომ წამყვან მოდელებს შეუძლიათ შეცდომიანი ფაილების გზების 76%-იანი სიზუსტით იდენტიფიცირება მხოლოდ პრობლემის აღწერილობის საფუძველზე, რაც აჩენს კითხვებს იმის შესახებ, მოდელები ნამდვილად მსჯელობენ თუ ნაწილობრივ მონაცემთა შაბლონებს ეყრდნობიან. თავად Anthropic-მა ახალი მოდელებისთვის აქცენტი გადაიტანა უფრო გრძელვადიან აგენტურულ ამოცანებზე, როგორიცაა Terminal-Bench, სადაც Fable 5.1-მა სამეცნიერო კვლევით ამოცანებში წინამორბედის შედეგი ორჯერ გააუმჯობესა. კომპანიას Fable 5.1-ისთვის SWE-bench-ის ახალი მაჩვენებელი არ გამოუქვეყნებია, რაც იმაზე მიუთითებს, რომ თავად Anthropic-იც მიიჩნევს, რომ ეს რეიტინგი მაქსიმალურ ზღვარს უახლოვდება.arxiv+2