Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

developer.nvidia+1techcrunchdeveloper.nvidiaNvidia Cuma günü, genel amaçlı ajan sistemi olan Agentic Variation Operators'ın (AVO) ARC-AGI-3 etkileşimli mantık testinde %100 skor elde ettiğini gösteren bir araştırma yayınladı. Bu sonuç, karmaşık otonom görevlerde başarının sadece model yeteneğine değil, ajan mimarisine bağlı olduğunu kanıtlıyor.
Claude Opus 5'i temel model olarak kullanan AVO, ARC-AGI-3 genel setindeki 25 ortamda bulunan 183 seviyenin tamamını tamamlayarak 6,624 çevresel eylemle %100.00 Bağıl İnsan Eylem Verimliliği (RHAE) skoru elde etti. AVO desteği olmadan Opus 5, aynı testte sadece %30 skor alabildi; bu da yüksek mantık çabası gerektiren test edilen tüm modeller arasındaki en iyi sonuçtu.developer.nvidia+1
ARC-AGI-3, herhangi bir talimat, kural veya belirtilen hedef içermeyen 2D oyun benzeri ortamlardan oluşan bir testtir. Bir ajanın ortamı keşfetmesi, dinamikleri anlaması ve giderek zorlaşan seviyelerde verimli bir şekilde hareket etmesi gerekir. Bu test, öncü modeller için oldukça zorlayıcı olmuştur; OpenAI modelleri, şirketin geçen ay kendi optimizasyon araştırmasını yapmasından önce %10'un altında skorlar elde etmişti.techcrunch+1
AVO'nun ayırt edici özellikleri, önceki uygulamaları ve mantığı oturumlar boyunca taşıyan kalıcı bellek ve ajanın gidişatını izleyerek tıkandığında veya verimsiz yollara girdiğinde onu yönlendiren bir denetleyici bileşenidir. Nvidia'nın AI biriminde ürün başkan yardımcısı olan Adel El Hallack, TechCrunch'a verdiği demeçte, "İşi yapan ana ajana ek olarak bir denetleyici ajan eklemek daha ilginç bir kısımdı" dedi. "Ajan rotadan saptığında onu dürtmek için neredeyse bir CEO gibi davranıyor."developer.nvidia+1
AVO başlangıçta, yedi gün boyunca kesintisiz çalışan, 500'den fazla optimizasyon yönünü keşfeden ve NVIDIA DGX B200 sistemlerinde cuDNN'den %3.5'e, FlashAttention-4'ten ise %10.5'e kadar daha iyi performans gösteren dikkat çekirdekleri (attention kernels) üreten GPU çekirdek optimizasyonu için geliştirilmişti. Aynı mimari, temel döngüsünde hiçbir değişiklik yapılmadan ARC-AGI-3'e uyarlandı; sadece ortama özgü araçlar ve değerlendirme kriterleri değiştirildi.developer.nvidia
Sistem, farklı modellerle eşleştirildiğinde de çok yönlülük gösterdi. AVO'nun GPT-5.6 Sol ile eşleştirildiği sınırlı deneylerde, model bazı durumlarda hedeflere daha hızlı ulaşırken, Opus daha az çevresel eylem kullandı.developer.nvidia
Nvidia'nın araştırması, sadece model seçiminin değil, destek sisteminin (harness) ajan performansındaki kritik değişken olduğuna dair artan kanıtlara bir yenisini ekliyor. Databricks CEO'su Ali Ghodsi, Temmuz ayında yaptığı açıklamada, sadece destek sistemi seçiminin aynı model için yapay zeka maliyetlerini ikiye katlayabileceğini belirtti. "Bunun pahalı bir model, şunun ucuz bir model olduğunu düşünüyorsunuz. Ama bekleyin, hangi destek sistemini kullanıyorsunuz?"techcrunch
El Hallack, sonuçları açık ajan yığınları (open agent stacks) lehine bir argüman olarak sundu. "Destek sistemi, altyapı ve çalışma zamanı üzerinde kontrol sahibi olduğunuz açık bir ajan yığınına sahip olmanın, ekosistemi güvenli bir şekilde ileriye taşımak için gerekli olduğuna inanıyoruz" dedi.techcrunch