Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

developer.nvidia+1techcrunchdeveloper.nvidiaΗ Nvidia δημοσίευσε την Παρασκευή έρευνα που δείχνει ότι το σύστημα πρακτόρων γενικού σκοπού, Agentic Variation Operators (AVO), πέτυχε απόλυτο σκορ 100% στο διαδραστικό τεστ συλλογισμού ARC-AGI-3, ένα αποτέλεσμα που υπογραμμίζει πώς η αρχιτεκτονική του πράκτορα, και όχι μόνο η ικανότητα του μοντέλου, καθορίζει την απόδοση σε σύνθετες αυτόνομες εργασίες.
Χρησιμοποιώντας το Claude Opus 5 ως το υποκείμενο μοντέλο του, το AVO ολοκλήρωσε και τα 183 επίπεδα σε 25 περιβάλλοντα του δημόσιου συνόλου ARC-AGI-3 με σκορ 100,00 στη σχετική αποδοτικότητα ανθρώπινης δράσης (RHAE), ολοκληρώνοντας την εργασία σε 6.624 ενέργειες περιβάλλοντος. Χωρίς το πλαίσιο AVO, το Opus 5 πέτυχε μόλις 30% στο ίδιο τεστ, το οποίο ήταν το κορυφαίο αποτέλεσμα μεταξύ όλων των μοντέλων που δοκιμάστηκαν με υψηλή προσπάθεια συλλογισμού.developer.nvidia+1
Το ARC-AGI-3 είναι ένα τεστ που αποτελείται από περιβάλλοντα που μοιάζουν με παιχνίδια 2D χωρίς οδηγίες, κανόνες ή δηλωμένους στόχους. Ένας πράκτορας πρέπει να εξερευνήσει, να συμπεράνει τη δυναμική και να δράσει αποτελεσματικά σε προοδευτικά δυσκολότερα επίπεδα. Το τεστ έχει αποδειχθεί δύσκολο για τα μοντέλα αιχμής, με τα μοντέλα της OpenAI να συγκεντρώνουν λιγότερο από 10% πριν η εταιρεία διεξάγει τη δική της έρευνα βελτιστοποίησης πλαισίου τον περασμένο μήνα.techcrunch+1
Τα διακριτικά χαρακτηριστικά του AVO είναι η μόνιμη μνήμη, η οποία μεταφέρει προηγούμενες υλοποιήσεις και συλλογισμούς μεταξύ των συνεδριών, και ένα στοιχείο επίβλεψης που παρακολουθεί την πορεία του πράκτορα και τον ανακατευθύνει όταν λιμνάζει ή επιστρέφει σε μη παραγωγικά μονοπάτια. "Το πιο ενδιαφέρον μέρος ήταν η εισαγωγή ενός επιβλέποντος πράκτορα επιπλέον του κύριου πράκτορα που κάνει τη δουλειά", δήλωσε στο TechCrunch ο Adel El Hallack, αντιπρόεδρος προϊόντων στη μονάδα AI της Nvidia. "Λειτουργεί σχεδόν σαν διευθύνων σύμβουλος για να ωθήσει τον πράκτορα όταν βγαίνει εκτός πορείας".developer.nvidia+1
Το AVO αναπτύχθηκε αρχικά για τη βελτιστοποίηση πυρήνων GPU, όπου λειτούργησε συνεχώς για επτά ημέρες, εξερεύνησε περισσότερες από 500 κατευθύνσεις βελτιστοποίησης και παρήγαγε πυρήνες προσοχής που ξεπέρασαν το cuDNN έως και 3,5% και το FlashAttention-4 έως και 10,5% σε συστήματα NVIDIA DGX B200. Η ίδια αρχιτεκτονική μεταφέρθηκε στο ARC-AGI-3 χωρίς τροποποίηση στον κεντρικό βρόχο της, μόνο τα εργαλεία και η αξιολόγηση που αφορούν το περιβάλλον άλλαξαν.developer.nvidia
Το σύστημα έδειξε επίσης ευελιξία σε διάφορα μοντέλα. Σε περιορισμένα πειράματα που συνδύαζαν το AVO με το GPT-5.6 Sol, το μοντέλο έφτασε σε αντίστοιχα επίπεδα ταχύτερα σε χρόνο ρολογιού σε αρκετές περιπτώσεις, ενώ το Opus χρησιμοποίησε λιγότερες ενέργειες περιβάλλοντος.developer.nvidia
Η έρευνα της Nvidia προστίθεται σε έναν αυξανόμενο όγκο αποδεικτικών στοιχείων ότι το πλαίσιο, και όχι μόνο η επιλογή του μοντέλου, είναι η κρίσιμη μεταβλητή στην απόδοση των πρακτόρων. Ο διευθύνων σύμβουλος της Databricks, Ali Ghodsi, σημείωσε τον Ιούλιο ότι η επιλογή του πλαισίου από μόνη της μπορεί να διπλασιάσει το κόστος της τεχνητής νοημοσύνης για το ίδιο μοντέλο. "Σκέφτεσαι, ω, αυτό είναι ένα ακριβό μοντέλο. Αυτό είναι ένα φθηνό μοντέλο. Αλλά περίμενε, ποιο πλαίσιο χρησιμοποιείς;"techcrunch
Ο El Hallack πλαισίωσε τα αποτελέσματα ως επιχείρημα υπέρ των ανοιχτών στοιβών πρακτόρων. "Πιστεύουμε ότι η κατοχή μιας ανοιχτής στοίβας πρακτόρων, όπου έχετε τον έλεγχο σε όλο το πλαίσιο, σε όλη την υποδομή, σε όλο τον χρόνο εκτέλεσης, είναι αυτό που απαιτείται για να οδηγήσουμε το οικοσύστημα προς τα εμπρός και με ασφάλεια", είπε.techcrunch