Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

developer.nvidia+1techcrunchdeveloper.nvidiaNvidia a publié vendredi une étude montrant que son système d'agents polyvalent, Agentic Variation Operators (AVO), a atteint un score parfait de 100% au benchmark de raisonnement interactif ARC-AGI-3. Ce résultat souligne que l'architecture de l'agent, et non seulement la capacité du modèle, détermine la performance sur des tâches autonomes complexes.
En utilisant Claude Opus 5 comme modèle sous-jacent, AVO a terminé les 183 niveaux répartis sur 25 environnements du jeu de données public ARC-AGI-3 avec un score d'efficacité d'action humaine relative (RHAE) de 100,00, accomplissant la tâche en 6 624 actions environnementales. Sans le cadre AVO, Opus 5 n'a obtenu que 30% au même benchmark, soit le meilleur résultat parmi tous les modèles testés avec un effort de raisonnement élevé.developer.nvidia+1
ARC-AGI-3 est un benchmark composé d'environnements de type jeu 2D sans instructions, règles ou objectifs énoncés. Un agent doit explorer, déduire les dynamiques et agir efficacement à travers des niveaux de plus en plus difficiles. Ce benchmark s'est avéré difficile pour les modèles de pointe, les modèles d'OpenAI ayant obtenu moins de 10% avant que l'entreprise ne mène ses propres recherches d'optimisation le mois dernier.techcrunch+1
Les caractéristiques distinctives d'AVO sont la mémoire persistante, qui conserve les implémentations et le raisonnement antérieurs entre les sessions, et un composant superviseur qui surveille la trajectoire de l'agent et le redirige lorsqu'il stagne ou revisite des chemins improductifs. "La partie la plus intéressante a été l'introduction d'un agent superviseur en plus de l'agent principal qui effectue le travail", a déclaré à TechCrunch Adel El Hallack, vice-président produit au sein de l'unité IA de Nvidia. "Il agit presque comme un PDG pour orienter l'agent lorsqu'il s'écarte de la direction."developer.nvidia+1
AVO a été initialement développé pour l'optimisation des noyaux GPU, où il a fonctionné en continu pendant sept jours, exploré plus de 500 directions d'optimisation et produit des noyaux d'attention surpassant cuDNN jusqu'à 3,5% et FlashAttention-4 jusqu'à 10,5% sur les systèmes NVIDIA DGX B200. La même architecture a été transférée à ARC-AGI-3 sans modification de sa boucle centrale, seuls les outils spécifiques à l'environnement et l'évaluation ayant été modifiés.developer.nvidia
Le système a également fait preuve de polyvalence entre les modèles. Dans des expériences limitées associant AVO à GPT-5.6 Sol, le modèle a atteint des niveaux correspondants plus rapidement en temps réel dans plusieurs cas, tandis qu'Opus a utilisé moins d'actions environnementales.developer.nvidia
Les recherches de Nvidia s'ajoutent à un nombre croissant de preuves montrant que le cadre, et non la seule sélection du modèle, est la variable critique de la performance des agents. Le PDG de Databricks, Ali Ghodsi, a noté en juillet que le choix du cadre peut à lui seul doubler les coûts de l'IA pour un même modèle. "Vous pensez, oh, c'est un modèle coûteux. C'est un modèle bon marché. Mais attendez, quel cadre utilisez-vous ?"techcrunch
El Hallack a présenté ces résultats comme un argument en faveur des piles d'agents ouvertes. "Nous pensons qu'avoir une pile d'agents ouverte, où vous avez le contrôle sur le cadre, sur l'infrastructure, sur l'exécution, est ce qui est nécessaire pour faire avancer l'écosystème de manière sécurisée", a-t-il déclaré.techcrunch