Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

developer.nvidia+1techcrunchdeveloper.nvidiaSpolečnost Nvidia v pátek zveřejnila výzkum, který ukazuje, že její systém pro obecné agenty, Agentic Variation Operators (AVO), dosáhl perfektního skóre 100 % v benchmarku interaktivního uvažování ARC-AGI-3. Tento výsledek podtrhuje, jak architektura agenta, nejen schopnosti modelu, určuje výkon při komplexních autonomních úkolech.
S modelem Claude Opus 5 jako základem dokončil systém AVO všech 183 úrovní napříč 25 prostředími ve veřejné sadě ARC-AGI-3 s relativní efektivitou lidské akce (RHAE) 100,00, přičemž úkol splnil pomocí 6 624 akcí v prostředí. Bez systému AVO dosáhl Opus 5 ve stejném benchmarku pouze 30 % – což byl nejlepší výsledek mezi všemi modely testovanými při vysokém úsilí o uvažování.developer.nvidia+1
ARC-AGI-3 je benchmark sestávající z 2D herních prostředí bez instrukcí, pravidel nebo stanovených cílů. Agent musí prozkoumávat, odvozovat dynamiku a efektivně jednat v postupně obtížnějších úrovních. Benchmark se ukázal jako obtížný pro špičkové modely, přičemž modely OpenAI dosahovaly méně než 10 % předtím, než společnost minulý měsíc provedla vlastní výzkum optimalizace systémů.techcrunch+1
Charakteristickými rysy AVO jsou trvalá paměť, která přenáší předchozí implementace a úvahy mezi relacemi, a dohlížecí komponenta, která monitoruje trajektorii agenta a přesměrovává jej, když uvízne nebo se vrací k neproduktivním cestám. "Zajímavější částí bylo zavedení dohlížecího agenta kromě vašeho hlavního agenta, který vykonává práci," řekl pro TechCrunch Adel El Hallack, viceprezident pro produkty v divizi AI společnosti Nvidia. "Funguje to téměř jako generální ředitel, který agenta postrčí, když se odchýlí od směru."developer.nvidia+1
Systém AVO byl původně vyvinut pro optimalizaci GPU jader, kde běžel nepřetržitě sedm dní, prozkoumal více než 500 optimalizačních směrů a vytvořil pozornostní jádra, která na systémech NVIDIA DGX B200 překonala cuDNN až o 3,5 % a FlashAttention-4 až o 10,5 %. Stejná architektura byla přenesena do ARC-AGI-3 bez úprav její hlavní smyčky – změnily se pouze nástroje specifické pro prostředí a hodnocení.developer.nvidia
Systém také prokázal všestrannost napříč modely. V omezených experimentech, kde byl AVO spárován s GPT-5.6 Sol, dosáhl model v několika případech odpovídajících úrovní rychleji v reálném čase, zatímco Opus použil méně akcí v prostředí.developer.nvidia
Výzkum společnosti Nvidia doplňuje rostoucí množství důkazů, že systém, nikoli pouze výběr modelu, je kritickou proměnnou ve výkonu agentů. Generální ředitel Databricks Ali Ghodsi v červenci poznamenal, že samotná volba systému může zdvojnásobit náklady na AI pro stejný model. "Myslíte si, ach, tohle je drahý model. Tohle je levný model. Ale počkejte, jaký systém používáte?"techcrunch
El Hallack interpretoval výsledky jako argument pro otevřené agentní zásobníky. "Věříme, že mít otevřený agentní zásobník, kde máte kontrolu nad systémem, infrastrukturou a běhovým prostředím, je to, co potřebujeme, abychom mohli ekosystém posouvat vpřed bezpečně," řekl.techcrunch