Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

trendingtopics+1trendingtopicstrendingtopics+1OpenAIs GPT-6 Astra, som lanserades den 3 september 2026, har skapat en ovanlig splittring bland oberoende utvärderare: en rankar den som världens främsta AI-modell, medan en annan placerar den i nivå med sin föregångare och bakom konkurrenten Anthropic.
Epoch AIs sammansatta Epoch Capabilities Index ger Astra 169 poäng, vilket placerar den först bland 267 modeller, före Anthropics Claude Fable 5.1 med 163 poäng. Artificial Analysis, ett benchmarking-företag baserat i San Francisco, drog en annan slutsats. Deras Intelligence Index ger Astra 61 poäng, vilket är exakt samma som OpenAIs Microsoft Corporation egna GPT-5.6 Sol, medan Anthropics Claude Fable 5.1 ligger fem poäng före på 66. När det gäller kodningsuppgifter är bilden mer positiv: Astra fick 67 poäng på Artificial Analysis Coding Agent Index, ungefär i nivå med Claude Opus 5 och Metas Muse Spark 1.3.trendingtopics+4
Oenigheten beror delvis på vad varje index mäter. Epoch AI sammanställer poäng från resonemang, matematik, vetenskap och agent-tester till ett enda tal, medan Artificial Analysis viktar kunskap, resonemang i långa dokument och faktamässig korrekthet på ett annat sätt. Epoch AI noterade på X att Astras rekord låg inom osäkerhetsmarginalen för tidigare ledare, vilket tyder på att klyftan kan vara mindre än vad huvudnumret antyder.latent+1
Organisationen ARC Prize genomförde en egen utvärdering och testade Astra på ARC-AGI-3, ett interaktivt benchmark som kräver att agenter utforskar okända miljöer, härleder mål och planerar handlingar utan explicita instruktioner. Med standarduppsättningen fick Astra 62,7 procent till en kostnad på cirka 26 000 dollar per körning. Med OpenAIs Provider Adapter, som bevarar modellens resonemangstillstånd mellan anrop, steg poängen till 99,9 procent för cirka 19 000 dollar.arcprize
Ett anmärkningsvärt resultat var Astras effektivitet i handlingar. Vid testning mot en baslinje från cirka 500 mänskliga deltagare använde Astra färre handlingar än medianmänniskan på 96 procent av nivåerna och använde i genomsnitt 51,7 procent färre handlingar per nivå totalt. Detta är en betydande milstolpe, skrev ARC Prize, och tillade att resultatet matchade och överträffade mänsklig paritet enligt deras mått på effektivitet.arcprize
Epoch AI rapporterade också att Astra var den enda modellen som löste några av problemen i deras nya FrontierMath Erdős-benchmark, en uppsättning av 68 öppna problem ställda av matematikern Paul Erdős, genom att producera Lean-verifierade bevis för två problem med en budget på 300 dollar per försök. Tre ytterligare lösningar framkom från dyrare, icke-standardiserade körningar som översteg 220 000 dollar, vilka Epoch exkluderade från den officiella poängen.the-decoder+1
För utvecklare kommer prestandan till ett pris. OpenAI satte Astras API-priser till 10 dollar per miljon input-tokens och 50 dollar per miljon output-tokens, en 2,5-faldig ökning jämfört med GPT-5.6 Sol. Artificial Analysis fann att Astras förbättrade token-effektivitet kompenserar för de högre priserna vid kodningsuppgifter, men gör modellen cirka 75 procent dyrare per uppgift för generella intelligens-uppgifter.trendingtopics