Eigen RadarYapay Zekâ
Analiz

Nvidia açık sette tam puan duyururken, yeni ölçümler eylemcinin nerede yavaşladığını gösteriyor

Nvidia'nın açık set sonucu eylemci mimarisinin tavanını öne çıkarırken, Amazon ve DeepMind araç kalabalığı, görev bölme ve yetki tasarımının başarıyı doğrudan değiştirdiğini gösteriyor.

Yapay Zekâ··Gece
Koyu atölyede çok sayıda farklı takım merkezi robot kolun tek bağlantısında sıkışırken, sağdaki bant üç aydınlık işlem istasyonuna uzanıyor.

Nvidia 183 açık seviyenin tamamını bitirdi

Nvidia, AVO adını verdiği kodlama eylemcisinin ARC-AGI-3'ün kamuya açık 25 ortamında 183 seviyenin tamamını bitirdiğini ve 100,00 RHAE puanına ulaştığını duyurdu. Şirket, bu sonucun kalıcı bellek, denetim ve inceleme-planlama-uygulama-değerlendirme döngüsüyle kurulan mimariden geldiğini savunuyor. Kendi sayılarına göre AVO aynı görev grubunu karşılaştırdığı VISTA'dan daha az ortam eylemiyle tamamladı. Ancak bu sonuç yalnızca açık sete ait, yarı gizli ve gizli yarışma kümelerini kapsamıyor ve bağımsız doğrulama da bildirilmiyor; bu yüzden şimdilik satıcının kendi ölçümü olarak okunuyor.[1]

Altı aracın yerine 20 araç verilince tablo bozuldu

Amazon araştırmacılarının SOP-Bench çalışması, bir iş yordamını uçtan uca tamamlama yükünü ölçmek için 12 iş alanında 2.000'den fazla görev kurdu. En çarpıcı sonuç, eylemciye daha çok seçenek vermenin otomatik olarak daha iyi sonuç getirmemesi oldu. Gereken altı aracın yerine 20 araçlık takım verildiğinde, 11 öncü modelin başarı oranı neredeyse yarıya indi. Çalışma ayrıca daha yeni sürümün her durumda üstün çıkmadığını gösterdi; Claude 4.5 ailesi, akıl yürüten eylemci kurulumunda daha eski Claude 4 ailesinin gerisine düştü. Araştırmacılar her yordamda önde giden tek bir model de bulamadı; bazı işlerde doğruluk 10'da 9'a yaklaşırken daha zor yordamlar 4'te 1 düzeyine indi.[2]

DeepMind belirsiz görevin önce parçalanmasını istiyor

Google DeepMind ve Google Cloud'un birlikte öne çıkardığı "Intelligent AI Delegation" çalışması, bu sınırı tasarım ilkelerine çeviriyor. Yazıya göre yöneten eylemci, hedefi tek tek izlenebilen ve notlanabilen alt işlere ayırmalı; ağır akıl yürütme gerektirmeyen işleri daha hafif modellere yönlendirmeli; çalışacak en dar yetkiyi vermeli; belirsiz bir isteği sorgulama ya da insana yükseltme hakkını korumalı. Bu vurgu, Amazon'un ölçtüğü değişkenlerle aynı yere bakıyor: işin nasıl bölündüğü, kaç aracın aynı anda açıldığı ve eylemcinin hangi isteği sorgulamadan kabul ettiği önem kazanıyor. Böylece açık sette gelen gösterişli tavan sonucu ile günlük görevlerde görülen düşüş aynı orkestrasyon soruları etrafında okunabiliyor.[3], [2]

Kaynakça

  1. Haber kaynağıNVIDIANvidia'nın kodlama eylemcisi ARC-AGI-3'ün açık setinde tam puan aldı↩
  2. Haber kaynağıAmazon ScienceEylemciye fazladan araç vermek başarısını neredeyse yarıya indiriyor↩1↩2
  3. Haber kaynağıGoogle Cloud BlogDeepMind'ın devretme çalışması, eylemcinin sorgusuz kabul alanını daraltmayı öneriyor↩