Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

developer.nvidia+1techcrunchdeveloper.nvidiaPenktadienį Nvidia paskelbė tyrimą, rodantį, kad jos bendrosios paskirties agentų sistema, Agentic Variation Operators (AVO), pasiekė tobulą 100 proc. rezultatą ARC-AGI-3 interaktyvaus samprotavimo teste. Tai pabrėžia, kad agento architektūra, o ne tik modelio galimybės, lemia našumą atliekant sudėtingas autonomines užduotis.
Naudodama Claude Opus 5 kaip pagrindinį modelį, AVO įveikė visus 183 lygius 25 aplinkose ARC-AGI-3 viešajame rinkinyje su 100,00 santykiniu žmogaus veiksmų efektyvumo (RHAE) balu, užduotį atlikdama per 6 624 aplinkos veiksmus. Be AVO sistemos, Opus 5 tame pačiame teste surinko tik 30 proc. – tai buvo geriausias rezultatas tarp visų modelių, išbandytų su didelėmis samprotavimo pastangomis.developer.nvidia+1
ARC-AGI-3 yra testas, susidedantis iš 2D žaidimo tipo aplinkų be instrukcijų, taisyklių ar nustatytų tikslų. Agentas turi tyrinėti, daryti išvadas apie dinamiką ir efektyviai veikti vis sudėtingesniuose lygiuose. Šis testas pasirodė esąs sunkus pažangiausiems modeliams, o OpenAI modeliai surinko mažiau nei 10 proc. prieš tai, kai bendrovė praėjusį mėnesį atliko savo sistemos optimizavimo tyrimus.techcrunch+1
Išskirtinės AVO savybės yra ilgalaikė atmintis, kuri perkelia ankstesnius įgyvendinimus ir samprotavimus tarp sesijų, bei prižiūrėtojo komponentas, kuris stebi agento trajektoriją ir nukreipia jį, kai jis sustingsta arba grįžta prie neproduktyvių kelių. "Įdomesnė dalis buvo prižiūrinčio agento įvedimas kartu su pagrindiniu agentu, kuris atlieka darbą", – TechCrunch sakė Adel El Hallack, Nvidia AI padalinio produktų viceprezidentas. Jis "veikia beveik kaip generalinis direktorius, pastūmėdamas agentą, kai šis nukrypsta nuo kurso".developer.nvidia+1
AVO iš pradžių buvo sukurta GPU branduolių optimizavimui, kur ji nepertraukiamai veikė septynias dienas, ištyrė daugiau nei 500 optimizavimo krypčių ir sukūrė dėmesio branduolius, kurie NVIDIA DGX B200 sistemose veikė iki 3,5 proc. geriau nei cuDNN ir iki 10,5 proc. geriau nei FlashAttention-4. Ta pati architektūra buvo perkelta į ARC-AGI-3 be jokių pakeitimų jos pagrindiniame cikle – pasikeitė tik aplinkai skirti įrankiai ir vertinimas.developer.nvidia
Sistema taip pat parodė universalumą įvairiuose modeliuose. Ribotuose eksperimentuose, sujungus AVO su GPT-5.6 Sol, modelis keliais atvejais greičiau pasiekė atitinkamus lygius realiuoju laiku, o Opus sunaudojo mažiau aplinkos veiksmų.developer.nvidia
Nvidia tyrimas papildo vis gausėjančius įrodymus, kad sistema, o ne tik modelio pasirinkimas, yra kritinis agento našumo kintamasis. Databricks generalinis direktorius Ali Ghodsi liepos mėnesį pažymėjo, kad vien sistemos pasirinkimas gali padvigubinti DI kaštus tam pačiam modeliui. "Galvoji, o, čia brangus modelis. Čia pigus modelis. Bet palauk, kokią sistemą tu naudoji?"techcrunch
El Hallack pateikė rezultatus kaip argumentą už atvirus agentų paketus. "Mes tikime, kad atviras agentų paketas, kuriame jūs kontroliuojate sistemą, infrastruktūrą ir vykdymo aplinką, yra tai, ko reikia, kad galėtume saugiai ir sparčiai judėti pirmyn", – sakė jis.techcrunch