Eigen RadarYapay Zekâ
Analiz

NVIDIA, aynı ekran kartında hazır bir yedek çıkarım motoru tutuyor

NVIDIA'nın sınamasında, aynı ekran kartındaki yedek çıkarım motoru bir arızadan 7,3 saniye sonra hizmeti sürdürdü; soğuk yeniden başlatma 283 saniye aldı. McKinsey anketinde eylemcilerin ölçeklenmesi artarken kazanç etkisi yerinde saydı. Kuramsal bir çalışma, sıkışıklıkta ucuz modele yönlendirmenin yeni denemeler yoluyla talebi büyütebileceği konusunda uyarıyor.

Yapay Zekâ··Öğle
Tek ekran kartındaki ortak bellek düzleminde, kehribar renkli etkin çıkarım yolu sönerken camgöbeği yedek yol aydınlanıyor.

Yedek motor ağırlıkları yeniden yüklemiyor

NVIDIA, Dynamo için Shadow Engine Recovery adlı önizleme özelliğinde etkin çıkarım motoruyla aynı ekran kartında tümüyle başlatılmış bir yedek tutuyor. İki motor, GPU Memory Service üzerinden model ağırlıklarını paylaştığı için yedek ayrı bir kopya taşımıyor. NVIDIA'nın GLM-5.2 ile B200 düğümlerinde yürüttüğü sentetik yük sınamasında ikinci çalışan, arızadan 7,3 saniye sonra hizmet vermeyi sürdürdü; soğuk yeniden başlatma 283 saniye aldı. Bunlar üreticinin kendi sonuçları. Özellik Kubernetes 1.34 veya daha yeni bir sürüm ve dinamik kaynak ayırma gerektiriyor; ana arka uç hedefi vLLM.[1]

Eylemci ölçeği büyüyor, kazanç etkisi yerinde sayıyor

The Register'ın aktardığı McKinsey anketi, dünya genelinde 1.719 uzman ve iş yöneticisini kapsıyor. Yapay zekânın kazanç üzerinde en az bir miktar etkisi olduğunu söyleyenlerin payı yüzde 37'de, yüksek başarım gösteren sayılanların payı yüzde 6'da kaldı; iki oran da 2025'e göre değişmedi. Geliri 1 milyar dolar üzerinde olan şirketlerde eylemcileri ölçekleyenlerin payı bir yıl önceki yüzde 27'den yüzde 40'a çıktı. Yapay zekâ kullananların yüzde 80'i bireysel üretkenliğin arttığını söylerken, yüzde 20'si işletme giderinin kullanımı sınırladığını belirtti. Anket, tek tek altyapı önlemlerinin kazanca etkisini ölçmüyor.[2]

Ucuz yönlendirme yeni denemelerle talebi büyütebilir

Kuramsal çalışma, sıkışıklık sırasında soruları daha küçük modellere yönlendirmenin daha zayıf yanıtlar üretip kullanıcıları yeniden denemeye itebileceği bir sistem kuruyor. Yeni denemeler dışarıdan gelen talebin bir parçası sayıldığında, geçici bir yükseliş kalıcı düşük nitelikli duruma dönüşebiliyor. Bu, canlı bir hizmette gözlenmiş bir sonuç değil; kamuya açık başarım verileriyle ayarlanmış kuramsal bir yapı. Gerçek bir hizmette kullanıcıların yeniden deneme davranışı, kuyruk yönetimi veya kapasite ayırma farklı sonuç verebilir. Yedek motor arızadan dönüş süresini hedeflerken, bu çalışma sıkışıklıkta verilen model seçiminin talebi nasıl değiştirebileceğini ayırıyor.[3], [1]

Kaynakça

  1. Haber kaynağıNVIDIA Developer BlogAynı ekran kartındaki yedek motor, çöken model sunucusunu saniyeler içinde geri getiriyor↩1↩2
  2. Haber kaynağıThe RegisterKurumlar eylemcileri ölçeklerken, kâr etkisi yerinde sayıyor↩
  3. Haber kaynağıarXivDarboğazda daha ucuz modele yönlendirme, sunucu yükünü büyütebilir↩