Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

benchlm+1anthropic+1techcrunchΤα μοντέλα τεχνητής νοημοσύνης Claude της Anthropic κατέχουν τις κορυφαίες θέσεις σε κάθε σημαντική παραλλαγή του benchmark προγραμματισμού SWE-bench από τον Σεπτέμβριο του 2026, με το Claude Opus 5 να φτάνει το 96% στο SWE-bench Verified και το Claude Fable 5.1 να συγκεντρώνει 81.2% στο πιο απαιτητικό SWE-bench Pro. Τα αποτελέσματα υπογραμμίζουν το διευρυνόμενο προβάδισμα της Anthropic στη μηχανική λογισμικού με τη βοήθεια AI, ακόμη και καθώς οι ανταγωνιστές από την OpenAI και την Google Alphabet Inc. συνεχίζουν να μειώνουν τις διαφορές σε άλλα μέτωπα.benchlm+2
Το SWE-bench, που δημιουργήθηκε από ερευνητές του Πανεπιστημίου Πρίνστον, ελέγχει αν τα μοντέλα AI μπορούν να επιλύσουν πραγματικά προβλήματα του GitHub δημιουργώντας διορθώσεις που περνούν τόσο από νέες όσο και από υπάρχουσες σουίτες ελέγχου. Στο SWE-bench Verified, ένα επιμελημένο υποσύνολο 500 προβλημάτων, το Claude Opus 5 προηγείται με 96%, ακολουθούμενο από το Claude Mythos 5 με 95.5% και το Claude Fable 5 με 95%. Στο SWE-bench Pro, το οποίο καλύπτει 1.865 προβλήματα σε 41 αποθετήρια και ελέγχει εργασίες μηχανικής μεγαλύτερου ορίζοντα, το Claude Fable 5.1 βρίσκεται στην κορυφή του πίνακα κατάταξης με 81.2%.benchlm+4
Η πορεία ήταν ραγδαία. Στις αρχές του 2025, το Claude 3.5 Sonnet της Anthropic σημείωσε 49% στο SWE-bench Verified. Μέχρι τα τέλη του 2025, το Claude Sonnet 4.5 έφτασε το 77.2%. Το Claude Opus 4.5 το ανέβασε στο 80.9% στις αρχές του 2026, και κάθε επόμενη γενιά μοντέλων, όπως οι οικογένειες Opus 4.7, Opus 4.8, Mythos, καθώς και τα Opus 5 και Fable 5, διεύρυναν περαιτέρω το προβάδισμα.dev+5
Η κυριαρχία της Anthropic στο SWE-bench έρχεται εν μέσω ενός εντεινόμενου αγώνα δρόμου στον τομέα του προγραμματισμού μέσω AI. Η Cognition, η startup πίσω από τον βοηθό προγραμματισμού Devin, άντλησε πρόσφατα 2 δισεκατομμύρια δολάρια με αποτίμηση 48 δισεκατομμυρίων δολαρίων, με τα ετησιοποιημένα έσοδα να αυξάνονται από 492 εκατομμύρια σε 900 εκατομμύρια δολάρια μέσα σε τέσσερις μήνες. Η Amazon Web Services της Amazon.com, Inc. προωθεί το εργαλείο προγραμματισμού Kiro σε φοιτητές σε 132 πανεπιστήμια παγκοσμίως. Το GPT-5.6 Sol της OpenAI, η τελευταία της ναυαρχίδα, έχει φτάσει περίπου στο ίδιο επίπεδο με το Claude σε ορισμένα γενικά benchmarks, αλλά υστερεί σε εργασίες προγραμματισμού πρακτόρων, σημειώνοντας 37.3% στο Terminal-Bench 4.0 σε σύγκριση με το 55.8% του Fable 5.1.techcrunch+3
Δεν αντιμετωπίζουν όλοι τα σκορ του SWE-bench ως οριστικά. Έρευνα που δημοσιεύτηκε στο arXiv διαπίστωσε ότι τα κορυφαία μοντέλα μπορούσαν να εντοπίσουν διαδρομές αρχείων με σφάλματα με ακρίβεια έως και 76% χρησιμοποιώντας μόνο περιγραφές προβλημάτων, εγείροντας ερωτήματα σχετικά με το αν τα μοντέλα συλλογίζονται πραγματικά ή αν βασίζονται εν μέρει σε μοτίβα στα δεδομένα. Η ίδια η Anthropic έχει μετατοπίσει τα κύρια benchmarks για τα νεότερα μοντέλα της προς εργασίες πρακτόρων μεγαλύτερου ορίζοντα, όπως το Terminal-Bench, όπου το Fable 5.1 υπερδιπλασίασε το σκορ του προκατόχου του σε προβλήματα επιστημονικής έρευνας. Η εταιρεία δεν παρουσίασε κανένα νέο νούμερο SWE-bench για το Fable 5.1, υποδηλώνοντας ότι ακόμη και η Anthropic θεωρεί πως το benchmark πλησιάζει σε κορεσμό στο ανώτατο άκρο.arxiv+2