Eigen RadarYapay Zekâ
Analiz

Açık eylemci yığını: model, yönlendirici ve çalışma belleği

NVIDIA ve IBM Research'ün üç yayını, eylemci sistemlerde verim arayışını açık bir modelden çağrı yönlendirmeye ve geçmiş çalışmalardan seçilerek getirilen yönergelere taşıyor.

Yapay Zekâ··Akşam
Güneşli bir atölyede merkezi döner tabla, etiketsiz iş parçalarını farklı boyuttaki iki makine hattına yönlendiriyor.

Model ağırlıklarıyla birlikte eğitim paketi

NVIDIA, Nemotron 3.5 Lightning adlı 30 milyar parametreli uzman karışımı modelini ağırlıkları, eğitim verisi ve eğitim tarifleriyle birlikte OpenMDW-1.1 lisansı altında yayımladı. Model her belirteç için toplamın 3 milyar parametrelik bölümünü çalıştırıyor; NVFP4 ve BF16 kontrol noktaları Hugging Face, ModelScope ve NVIDIA'nın kendi erişim noktalarında sunuluyor. Şirket, modelin vLLM, SGLang ve TensorRT-LLM ile sunulabildiğini; Ollama, llama.cpp, LM Studio ve Unsloth ile de çalıştığını belirtiyor. NVIDIA'nın kendi ölçümlerinde model, benzer boyuttaki rakiplere göre 4 kata kadar daha yüksek çıktı hızına ulaşıyor. PinchBench'te 10.000 görevi Qwen3.6 35B'den yüzde 30 daha hızlı bitirirken yüzde 86 doğruluk bildirilmiş. Dokuz değerlendirmeyi birleştiren Artificial Analysis Intelligence Index için de önde gelen doğruluk iddiası var. Bu sonuçlar bağımsız olarak doğrulanmış değil. Yine de yayının kapsamı yalnızca indirilebilir ağırlıklardan ibaret değil: veri, tarif, farklı sayı biçimlerinde kontrol noktası ve yaygın sunum araçları aynı pakette yer alıyor. Böylece model, açık eylemci yığınının hesaplama katmanını oluşturuyor.[1]

Her adım için aynı modeli kullanmamak

NeMo Switchyard bu yığına, eylemcinin işini her istekte veya çok turlu konuşmanın her adımında farklı modellere verebilen açık kaynak bir yönlendirme katmanı ekliyor. switchyard-libsy adlı sağlayıcıdan bağımsız kit, hangi modelin görevi çözebildiğini, seçeneklerin gecikmesini ve fiyatını, ayrıca sistem güvenilirliği işaretlerini birlikte değerlendiriyor. Ayar gerektirmeyen seçenekler arasında LLM sınıflandırıcısı, aşama yönlendiricisi ve yükseltme yönlendiricisi bulunuyor; ön dolum yönlendiricisi ise ayarlanabiliyor. NVIDIA, LangChain'in 145 çok turlu görevinde çağrıların yüzde 7'sini öncü modele göndererek yalnızca öncü modele dayanan taban çizgisine göre gideri yüzde 74 azalttığını bildiriyor. Bunun karşılığında doğruluk yaklaşık 6 puan düşmüş. Cognition'ın FrontierCode kümesinde ise ortalama 3,11 dolar giderle yüzde 50,6 başarı açıklanıyor; şirket bunu Opus 5'in 2,8 puan altında ve yaklaşık yüzde 28 daha ucuz olarak konumluyor. Bunlar da NVIDIA'nın kendi ölçümleri. Rakamlar, yönlendirmenin bedelsiz bir kazanç olmadığını gösteriyor: daha düşük gider, bazı görevlerin daha ucuz modele bırakılmasıyla geliyor ve bildirilen doğruluk farkı bu seçimin karşılığını görünür kılıyor.[2]

Geçmiş çalışmaların tamamı yerine ilgili yönergeler

IBM Research'ün Hugging Face'te anlattığı ALTK-Evolve, üçüncü katmanı model ağırlıklarını değiştirmeden geçmiş çalışmalardan öğrenmeye ayırıyor. Sistem, strateji, toparlanma ve eniyileştirme için türlendirilmiş yönergeler çıkarıyor; bunlara destek sayıları ekliyor ve birbirine yakın kayıtları kümeliyor. IBM'in ACE yaklaşımıyla arasına koyduğu temel fark iletim miktarı: her adımda bütün kılavuzu yeniden göndermek yerine, yalnızca ilgili modelin kullanabileceği bölüm getiriliyor. IBM'in AppWorld ölçümlerinde DeepSeek-V3.2 ile görev hedefi tamamlama yüzde 89,3'e, senaryo hedefi tamamlama yüzde 80,4'e ulaşırken görev başına 263.000 belirteç kullanılmış; ACE için bildirilen değerler yüzde 80,4, yüzde 73,2 ve 634.000 belirteç. gpt-oss-120b denemesinde de ALTK-Evolve 116.000 belirteç, ACE 777.000 belirteç kullanmış. Ölçümler yazarlara ait ve yazıda lisans belirtilmiyor. Üç yayın birlikte, verimi tek bir model puanına indirgemeyen bir düzen kuruyor: açık model işi yapıyor, yönlendirici hangi modelin ne zaman çalışacağını seçiyor, bellek katmanı da hangi geçmiş yönergenin bağlama gireceğini sınırlıyor. Bunun ortak kısıtı, her katmandaki kazanımın sağlayıcının kendi değerlendirmelerine dayanması.[1], [2], [3]

Kaynakça

  1. Haber kaynağıNVIDIA Technical BlogNVIDIA, 30 milyar parametreli eylemci modelini eğitim verisi ve tarifleriyle birlikte açtı↩1↩2
  2. Haber kaynağıNVIDIA Technical BlogNVIDIA, bir eylemcinin işini ucuz ve öncü modeller arasında taşıyan yönlendiriciyi açık kaynak yaptı↩1↩2
  3. Haber kaynağıHugging FaceIBM Research, ACE düzeyinde doğruluğu onun çıkarım giderinin yaklaşık yüzde 40'ıyla bildiriyor↩