Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

developer.nvidia+1techcrunchdeveloper.nvidiaპარასკევს Nvidia-მ გამოაქვეყნა კვლევა, რომელიც აჩვენებს, რომ მისმა ზოგადი დანიშნულების აგენტურულმა სისტემამ, Agentic Variation Operators (AVO), ARC-AGI-3 ინტერაქტიული მსჯელობის ტესტში 100%-იანი შედეგი აჩვენა. ეს შედეგი ხაზს უსვამს, რომ კომპლექსური ავტონომიური ამოცანების შესრულებისას გადამწყვეტია არა მხოლოდ მოდელის შესაძლებლობები, არამედ აგენტის არქიტექტურა.
Claude Opus 5-ის ბაზაზე შექმნილმა AVO-მ ARC-AGI-3-ის საჯარო კომპლექტში არსებული 183-ვე დონე 25 სხვადასხვა გარემოში დაძლია და ადამიანის მოქმედების ეფექტურობის (RHAE) 100.00-იანი მაჩვენებელი აჩვენა, რისთვისაც 6,624 მოქმედება დასჭირდა. AVO-ს დამხმარე სისტემის გარეშე Opus 5-მა იმავე ტესტში მხოლოდ 30% მიიღო, რაც საუკეთესო შედეგი იყო მაღალი მსჯელობის მქონე ყველა სხვა მოდელს შორის.developer.nvidia+1
ARC-AGI-3 არის ტესტი, რომელიც შედგება 2D თამაშის მსგავსი გარემოებებისგან, ყოველგვარი ინსტრუქციების, წესების ან დასახული მიზნების გარეშე. აგენტმა დამოუკიდებლად უნდა შეისწავლოს გარემო, გაიგოს დინამიკა და ეფექტურად იმოქმედოს სულ უფრო რთულ დონეებზე. ეს ტესტი რთული აღმოჩნდა წამყვანი მოდელებისთვის; OpenAI-ის მოდელებმა 10%-ზე ნაკლები შედეგი აჩვენეს, სანამ კომპანია გასულ თვეში საკუთარ კვლევას ჩაატარებდა.techcrunch+1
AVO-ს განმასხვავებელი ნიშნებია მუდმივი მეხსიერება, რომელიც ინახავს წინა გამოცდილებასა და მსჯელობას, და ზედამხედველის კომპონენტი, რომელიც აკონტროლებს აგენტის ტრაექტორიას და მიმართულებას აძლევს, თუ ის ჩიხში შევა. "უფრო საინტერესო იყო ზედამხედველი აგენტის დამატება მთავარი აგენტის გვერდით, რომელიც უშუალოდ ასრულებს სამუშაოს," განუცხადა TechCrunch-ს Nvidia-ს AI განყოფილების პროდუქტების ვიცე-პრეზიდენტმა ადელ ელ ჰალაკმა. ის "თითქმის CEO-სავით მოქმედებს და აგენტს მიმართულებას აძლევს, როცა ის გზიდან გადაუხვევს."developer.nvidia+1
AVO თავდაპირველად GPU-ბირთვების ოპტიმიზაციისთვის შეიქმნა, სადაც ის შვიდი დღის განმავლობაში უწყვეტად მუშაობდა, შეისწავლა 500-ზე მეტი ოპტიმიზაციის მიმართულება და შექმნა ისეთი ყურადღების ბირთვები (attention kernels), რომლებმაც NVIDIA DGX B200 სისტემებზე cuDNN-ს 3.5%-ით, ხოლო FlashAttention-4-ს 10.5%-ით აჯობა. იმავე არქიტექტურამ ARC-AGI-3-ზე გადასვლისას ძირითადი ციკლის ცვლილების გარეშე იმუშავა; შეიცვალა მხოლოდ გარემოსთვის სპეციფიკური ხელსაწყოები და შეფასების მეთოდები.developer.nvidia
სისტემამ მრავალფეროვნება აჩვენა სხვადასხვა მოდელთან მუშაობისას. შეზღუდულ ექსპერიმენტებში, სადაც AVO დაწყვილებული იყო GPT-5.6 Sol-თან, მოდელმა რამდენიმე შემთხვევაში უფრო სწრაფად მიაღწია მიზანს, ხოლო Opus-მა ნაკლები მოქმედება გამოიყენა.developer.nvidia
Nvidia-ს კვლევა ამყარებს მოსაზრებას, რომ დამხმარე სისტემა (harness) და არა მხოლოდ მოდელის არჩევანი, არის აგენტურული მუშაობის კრიტიკული ცვლადი. Databricks-ის აღმასრულებელმა დირექტორმა ალი ღოდსიმ ივლისში აღნიშნა, რომ მხოლოდ დამხმარე სისტემის არჩევამ შეიძლება გააორმაგოს AI-ს ხარჯები ერთი და იმავე მოდელისთვის. "თქვენ ფიქრობთ, რომ ეს ძვირი მოდელია, ეს კი იაფი, მაგრამ დაელოდეთ, რომელ დამხმარე სისტემას იყენებთ?"techcrunch
ელ ჰალაკმა ეს შედეგები ღია აგენტურული სტეკების სასარგებლოდ არგუმენტად წარმოადგინა. "ჩვენ გვჯერა, რომ ღია აგენტურული სტეკის ქონა, სადაც თქვენ გაქვთ კონტროლი დამხმარე სისტემაზე, ინფრასტრუქტურასა და გარემოზე, არის ის, რაც საჭიროა ეკოსისტემის უსაფრთხოდ წინსვლისთვის," განაცხადა მან.techcrunch