Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

trendingtopics+1trendingtopicstrendingtopics+1Το GPT-6 Astra της OpenAI, το οποίο κυκλοφόρησε στις 3 Σεπτεμβρίου 2026, προκάλεσε σπάνια διχογνωμία μεταξύ των ανεξάρτητων αξιολογητών: ο ένας το κατατάσσει ως το κορυφαίο μοντέλο τεχνητής νοημοσύνης στον κόσμο, ενώ ο άλλος το τοποθετεί στο ίδιο επίπεδο με τον προκάτοχό του και πίσω από το ανταγωνιστικό μοντέλο της Anthropic.
Ο σύνθετος δείκτης δυνατοτήτων Epoch Capabilities Index της Epoch AI δίνει στο Astra βαθμολογία 169, τοποθετώντας το στην πρώτη θέση ανάμεσα σε 267 μοντέλα, μπροστά από το Claude Fable 5.1 της Anthropic που συγκέντρωσε 163. Η Artificial Analysis, εταιρεία benchmarking με έδρα το Σαν Φρανσίσκο, κατέληξε σε διαφορετικό συμπέρασμα. Ο δείκτης νοημοσύνης της κατατάσσει το Astra στους 61 βαθμούς, ισοφαρίζοντας ακριβώς το GPT-5.6 Sol της OpenAI και της Microsoft Corporation , με το Claude Fable 5.1 της Anthropic να προηγείται κατά πέντε μονάδες στους 66. Στις εργασίες προγραμματισμού, η εικόνα είναι πιο ευνοϊκή: το Astra συγκέντρωσε 67 βαθμούς στον δείκτη Artificial Analysis Coding Agent Index, περίπου στο ίδιο επίπεδο με το Claude Opus 5 και το Muse Spark 1.3 της Meta .trendingtopics+4
Η διαφωνία πηγάζει εν μέρει από το τι μετράει ο κάθε δείκτης. Η Epoch AI συγκεντρώνει βαθμολογίες από benchmarks συλλογισμού, μαθηματικών, επιστήμης και πρακτόρων σε έναν ενιαίο αριθμό, ενώ η Artificial Analysis δίνει διαφορετική βαρύτητα στη γνώση, τον συλλογισμό σε μεγάλα έγγραφα και την ακρίβεια των γεγονότων. Η Epoch AI σημείωσε στο X ότι το ρεκόρ του Astra ήταν «εντός του ορίου αβεβαιότητας» των προηγούμενων ηγετών, υποδηλώνοντας ότι το χάσμα μπορεί να είναι μικρότερο από ό,τι υπονοεί ο αρχικός αριθμός.latent+1
Ο οργανισμός ARC Prize παρείχε τη δική του αξιολόγηση, δοκιμάζοντας το Astra στο ARC-AGI-3, ένα διαδραστικό benchmark που απαιτεί από τους πράκτορες να εξερευνούν άγνωστα περιβάλλοντα, να συμπεραίνουν στόχους και να σχεδιάζουν ενέργειες χωρίς ρητές οδηγίες. Με το τυπικό πλαίσιο, το Astra σημείωσε 62,7% με κόστος περίπου 26.000 δολάρια ανά εκτέλεση. Με το πλαίσιο Provider Adapter της OpenAI, το οποίο διατηρεί την κατάσταση συλλογισμού του μοντέλου μεταξύ των αιτημάτων, η βαθμολογία εκτινάχθηκε στο 99,9% με κόστος περίπου 19.000 δολάρια.arcprize
Ένα εντυπωσιακό εύρημα ήταν η αποδοτικότητα ενεργειών του Astra. Σε δοκιμές έναντι μιας βάσης αναφοράς από περίπου 500 ανθρώπους συμμετέχοντες, το Astra χρησιμοποίησε λιγότερες ενέργειες από τον μέσο άνθρωπο στο 96% των επιπέδων και είχε κατά μέσο όρο 51,7% λιγότερες ενέργειες ανά επίπεδο συνολικά. «Αυτό αποτελεί ένα σημαντικό ορόσημο», έγραψε το ARC Prize, προσθέτοντας ότι το αποτέλεσμα «ισοφάρισε και ξεπέρασε την ανθρώπινη ισοτιμία» σύμφωνα με το μέτρο τους για την αποδοτικότητα ενεργειών.arcprize
Η Epoch AI ανέφερε επίσης ότι στο νέο της benchmark FrontierMath Erdős, ένα σύνολο 68 ανοιχτών προβλημάτων που έθεσε ο μαθηματικός Paul Erdős, το Astra ήταν το μόνο μοντέλο που έλυσε κάποια από αυτά, παράγοντας αποδείξεις επαληθευμένες από το Lean για δύο προβλήματα με προϋπολογισμό 300 δολαρίων ανά προσπάθεια. Τρεις επιπλέον λύσεις προέκυψαν από πιο δαπανηρές μη τυποποιημένες εκτελέσεις που ξεπέρασαν τα 220.000 δολάρια, τις οποίες η Epoch απέκλεισε από την επίσημη βαθμολογία.the-decoder+1
Για τους προγραμματιστές, η απόδοση έχει το τίμημά της. Η OpenAI όρισε τις τιμές API του Astra στα 10 δολάρια ανά εκατομμύριο input tokens και 50 δολάρια ανά εκατομμύριο output tokens, μια αύξηση 2,5 φορές σε σχέση με το GPT-5.6 Sol. Η Artificial Analysis διαπίστωσε ότι η βελτιωμένη αποδοτικότητα των token του Astra αντισταθμίζει τις υψηλότερες τιμές σε εργασίες προγραμματισμού, αλλά καθιστά το μοντέλο περίπου 75% ακριβότερο ανά εργασία για γενικές εργασίες νοημοσύνης.trendingtopics