Un agent de Nvidia obtient 100% au test de raisonnement ARC-AGI-3

4 sources
  • Le système d'agents AVO de Nvidia a atteint un score parfait de 100,00 au benchmark de raisonnement interactif ARC-AGI-3, en terminant les 183 niveaux répartis sur 25 environnements.
  • AVO utilise une mémoire persistante et un composant superviseur pour gérer les tâches à long terme; sans ce cadre, Claude Opus 5 n'a obtenu que 30% au même test.
  • La même architecture a précédemment optimisé des noyaux GPU lors d'une exécution autonome de sept jours, suggérant que la boucle de l'agent est généralisable à des domaines très variés.
Sources (4)
  1. 1 NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents | NVIDIA Technical Blog developer.nvidia.com
  2. 2 Nvidia just showed that the harness, not the AI model, is now the real hero | TechCrunch techcrunch.com
  3. 3 Nvidia Research: AI Agent Control Beats Raw Model Power www.techbuzz.ai
  4. 4 Nvidia just showed that the harness, not the AI model, is now the real hero tech.yahoo.com