Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

trendingtopics+1trendingtopicstrendingtopics+1OpenAI:n 3. syyskuuta 2026 julkaistu GPT-6 Astra on saanut ristiriitaisen vastaanoton riippumattomilta arvioijilta: yksi pitää sitä maailman parhaana tekoälymallina, kun taas toinen sijoittaa sen samalle tasolle edeltäjänsä kanssa ja kilpailija Anthropicin taakse.
Epoch AI:n yhdistetty kyvykkyysindeksi antaa Astralle 169 pistettä, mikä asettaa sen ensimmäiseksi 267 mallin joukossa – Anthropicin Claude Fable 5.1:n (163 pistettä) edelle. Sanfranciscolainen vertailuyritys Artificial Analysis päätyi eri johtopäätökseen. Sen Intelligence Index antaa Astralle 61 pistettä, mikä vastaa täsmälleen OpenAI:n ja Microsoft Corporation GPT-5.6 Sol -mallia, kun taas Anthropicin Claude Fable 5.1 on viisi pistettä edellä 66 pisteellä. Koodaustehtävissä tilanne on suotuisampi: Astra sai 67 pistettä Artificial Analysisin koodausagentti-indeksissä, mikä on suunnilleen samalla tasolla Claude Opus 5:n ja Meta Muse Spark 1.3:n kanssa.trendingtopics+4
Erimielisyys johtuu osittain siitä, mitä kukin indeksi mittaa. Epoch AI yhdistää päättelyn, matematiikan, tieteen ja agenttien suorituskyvyn yhdeksi luvuksi, kun taas Artificial Analysis painottaa tietoa, pitkien dokumenttien päättelyä ja faktuaalista tarkkuutta eri tavoin. Epoch AI totesi X-palvelussa, että Astran ennätys oli "epävarmuusvälin sisällä" aiempiin johtajiin nähden, mikä viittaa siihen, että ero saattaa olla pienempi kuin otsikon luku antaa ymmärtää.latent+1
ARC Prize -järjestö teki oman arvionsa testaamalla Astraa ARC-AGI-3-mallilla, joka on interaktiivinen vertailukohta, jossa agenttien on tutkittava tuntemattomia ympäristöjä, pääteltävä tavoitteita ja suunniteltava toimia ilman suoria ohjeita. Vakioasetuksilla Astra sai 62,7 % tuloksen noin 26 000 dollarin kustannuksella per ajo. OpenAI:n Provider Adapter -asetuksilla, jotka säilyttävät mallin päättelytilan pyyntöjen välillä, tulos nousi 99,9 prosenttiin noin 19 000 dollarilla.arcprize
Erityisen huomionarvoinen löydös oli Astran toiminnallinen tehokkuus. Noin 500 ihmisosallistujan vertailuryhmään verrattuna Astra käytti vähemmän toimintoja kuin mediaani-ihminen 96 prosentissa tasoista, ja keskimäärin se käytti 51,7 % vähemmän toimintoja tasoa kohden. "Tämä on merkittävä virstanpylväs", ARC Prize kirjoitti ja lisäsi, että tulos "vastasi ja ylitti ihmisen tason" heidän toiminnallisen tehokkuuden mittarillaan.arcprize
Epoch AI raportoi myös, että uudessa FrontierMath Erdős -vertailussa – joka sisältää 68 matemaatikko Paul Erdősin esittämää avointa ongelmaa – Astra oli ainoa malli, joka ratkaisi yhtään niistä, tuottaen Lean-varmennetut todistukset kahdelle ongelmalle 300 dollarin budjetilla per yritys. Kolme muuta ratkaisua syntyi kalliimmista, ei-standardoiduista ajoista, joiden hinta ylitti 220 000 dollaria, ja jotka Epoch sulki pois virallisista pisteistä.the-decoder+1
Kehittäjille suorituskyky maksaa. OpenAI asetti Astran API-hinnat 10 dollariin per miljoona syötetokenia ja 50 dollariin per miljoona tulostetokenia, mikä on 2,5-kertainen nousu GPT-5.6 Soliin verrattuna. Artificial Analysis totesi, että Astran parantunut token-tehokkuus kompensoi korkeampia hintoja koodaustehtävissä, mutta tekee mallista noin 75 % kalliimman per tehtävä yleisessä älykkyystyössä.trendingtopics