Eigen RadarYapay Zekâ
Analiz

Arama desteği skoru 33'ten 75'e taşıyor; bellek her modelde aynı karşılığı vermiyor

Yeni yayımlanan donanım ve başarım testleri, modellerin büyük veri kümelerindeki hızını ve yardımcı araçlara bağımlılığını ortaya koyuyor. Çıkarım anında arama yeteneği ve eylemci belleği, sonuçların kalitesini doğrudan etkilerken, her model aynı oranda yarar sağlayamıyor.

Yapay Zekâ··Sabah
Beyaz bir salonda tavandan asılı, ışıklı düğüm kümeleriyle dev üç boyutlu ağ heykeli; altında tek araştırmacı.

Sekiz H100, 106 milyon vektörlük grafiği 8 dakikada kurdu

Donanım sınırlarını test eden NVIDIA, cuML ve cuVS kütüphane sürümlerini güncelleyerek UMAP grafiği kurulumunu ilk kez tek bir grafik işlemciden çıkarıp birden fazla işlemciye dağıttı. Şirket içi performans ölçümlerine göre sekiz adet H100 veri merkezi hızlandırıcısı, 870 GB boyutunda ve 106 milyon vektörden oluşan oldukça geniş bir veri kümesini yalnızca 8 dakikada işleyerek sistem öngörülerine kıyasla yüksek bir ivme ve verimlilik yakalıyor.[1]

Arama olmadan skor 33'te kalıyor

Araç kullanımının model başarımı üzerindeki etkisi, Artificial Analysis şirketi tarafından yayımlanan Search Index ile ölçülüyor. Düzenlenen testler, eylemcilerin görev sırasında kullandığı çeşitli arama servislerinin kalite, gider ve hıza yönelik etkilerini sıralıyor; elinde arama aracı bulunmayan bir model zorlu görevlerde ancak 33 puanda kalabilirken, arama özelliği sağlandığında aynı modelin 75 puana kadar çıkabildiği ve başarımını belirgin ölçüde yukarı taşıdığı görülüyor.[2]

Bellek her mimaride çalışmıyor

Eylemci belleğinin getirdiği başarım artışı da her mimaride ve her ağırlıkta aynı biçimde çalışmıyor. IBM Research birimleri, bir eylemcinin geçmiş izlerinden çıkardığı davranış kılavuzlarını çıkarım anında modele yeniden veren ALTK-Evolve yöntemini AppWorld görevleri üzerinde sınadı; gpt-oss-120b modeli karmaşık görevlerin tamamlanmasında 16,1 puanlık bir artış gösterirken, GLM-5 modelinin bu bellek eklentisinden hiçbir ek yarar sağlamadığı ve başarımının değişmediği saptandı.[3]

Kaynakça

  1. Haber kaynağıNVIDIA Technical BlogSekiz H100, 106 milyon vektörlük UMAP grafiğini 8 dakikada kuruyor↩
  2. Haber kaynağıThe DecoderArama olmadan puan 33'te kalıyor, aramayla 75'e çıkıyor↩
  3. Haber kaynağıHugging FaceEylemci belleği her modelde aynı işe yaramıyor↩