Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

developer.nvidia+1techcrunchdeveloper.nvidiaNvidia julkaisi perjantaina tutkimuksen, jonka mukaan sen yleiskäyttöinen agenttijärjestelmä, Agentic Variation Operators (AVO), saavutti täydet 100 % ARC-AGI-3-vuorovaikutteisessa päättelytestissä. Tulos korostaa, että agenttiarkkitehtuuri, ei vain mallin kyvykkyys, määrittää suorituskyvyn monimutkaisissa autonomisissa tehtävissä.
Käyttämällä Claude Opus 5 -mallia pohjana, AVO suoritti kaikki 183 tasoa 25 ympäristössä ARC-AGI-3-julkisessa testijoukossa 100,00 RHAE-pisteellä (Relative Human Action Efficiency), suorittaen tehtävän 6 624 ympäristötoiminnolla. Ilman AVO-kehystä Opus 5 sai samassa testissä vain 30 %, mikä oli paras tulos kaikista korkean päättelytason malleista.developer.nvidia+1
ARC-AGI-3 on testi, joka koostuu 2D-pelimäisistä ympäristöistä ilman ohjeita, sääntöjä tai asetettuja tavoitteita. Agentin on tutkittava, pääteltävä dynamiikka ja toimittava tehokkaasti vaikeutuvilla tasoilla. Testi on osoittautunut vaikeaksi huippumalleille, ja OpenAI:n mallit saivat alle 10 % ennen kuin yritys teki oman kehysoptimointitutkimuksensa viime kuussa.techcrunch+1
AVO:n erottavia piirteitä ovat pysyvä muisti, joka siirtää aiemmat toteutukset ja päättelyt istuntojen välillä, sekä valvontakomponentti, joka seuraa agentin liikerataa ja ohjaa sitä uudelleen, kun se jumiutuu tai palaa tuottamattomille poluille. "Mielenkiintoisempi osa oli valvovan agentin tuominen varsinaisen työtä tekevän pääagentin rinnalle", kertoi Nvidian tekoälyyksikön tuotejohtaja Adel El Hallack TechCrunchille. "Se toimii lähes kuin toimitusjohtaja, joka tönäisee agenttia, kun se poikkeaa suunnasta."developer.nvidia+1
AVO kehitettiin alun perin GPU-ydinten optimointiin, missä se toimi jatkuvasti seitsemän päivää, tutki yli 500 optimointisuuntaa ja tuotti huomiokerneleitä, jotka suoriutuivat jopa 3,5 % paremmin kuin cuDNN ja jopa 10,5 % paremmin kuin FlashAttention-4 NVIDIA DGX B200 -järjestelmissä. Sama arkkitehtuuri siirrettiin ARC-AGI-3-testiin ilman muutoksia sen ydinsilmukkaan; vain ympäristökohtaiset työkalut ja arviointi muuttuivat.developer.nvidia
Järjestelmä osoitti myös monipuolisuutta eri mallien välillä. Rajoitetuissa kokeissa, joissa AVO yhdistettiin GPT-5.6 Sol -malliin, malli saavutti vastaavat tasot nopeammin seinäkellon ajassa useissa tapauksissa, kun taas Opus käytti vähemmän ympäristötoimintoja.developer.nvidia
Nvidian tutkimus lisää näyttöä siitä, että kehys – ei pelkkä mallin valinta – on kriittinen muuttuja agenttien suorituskyvyssä. Databricksin toimitusjohtaja Ali Ghodsi totesi heinäkuussa, että pelkkä kehyksen valinta voi kaksinkertaistaa tekoälykustannukset samalle mallille. "Ajattelet, että tämä on kallis malli tai halpa malli. Mutta odota, mitä kehystä käytät?"techcrunch
El Hallack kehysti tulokset argumentiksi avoimien agenttipinojen puolesta. "Uskomme, että avoin agenttipino, jossa on hallinta kehyksen, infrastruktuurin ja ajonaikaisen ympäristön yli, on välttämätön ekosysteemin viemiseksi eteenpäin turvallisesti", hän sanoi.techcrunch