Eigen RadarYapay Zekâ
Analiz

NVIDIA PAIR, yerel çıkarım isteklerini ağdaki uygun makineye yönlendiriyor

NVIDIA'nın beta aşamasındaki PAIR aracı, yerel model sunucularının önünde bir vekil olarak çalışıyor ve her isteği aynı ağdaki uyumlu bir bilgisayara atıyor. Farklı işletim sistemleri bir arada kullanılabiliyor; ancak araç grafik işlemcilerini ya da görüntü belleğini ortak bir havuzda birleştirmiyor. Bu nedenle model tek bir düğüme sığmalı. NVIDIA kodu yayımladı; çok makineli gösterimindeki hızlanmanın başarım güvencesi olmadığını da belirtti.

Yapay Zekâ··Gece
Gün ışığı alan bir atölyede, biri açık ve teknisyenin yanında duran dört farklı masaüstü bilgisayar; öndeki ağ anahtarından ayrı kablolar uzanıyor.

Her istek tek makineye gidiyor

NVIDIA'nın Kişisel Yapay Zekâ Yönlendiricisi PAIR, aynı yerel ağdaki bilgisayarların çıkarım gücünü tek bir giriş noktasının arkasında erişilebilir kılıyor. Araç, Ollama ya da LM Studio gibi yerel model hizmetlerinden gelen isteğin hangi motoru ve modeli gerektirdiğini okuyor. Ardından işi çalıştırabilecek düğümler arasından birini seçiyor; seçilen bilgisayar isteği baştan sona kendi başına tamamlıyor. NVIDIA Technical Blog, sanal yönlendiriciyi çok eylemcili görevlerin yerel donanım üzerindeki yükünü dağıtmak için sundu. InfoQ'nun bağımsız anlatımı da aynı ağ içi yönlendirme düzenini ve beta durumunu doğruluyor.[1], [2]

Bellek tek düğümde kalıyor

PAIR, bir modeli birkaç grafik işlemcisine bölmüyor ve farklı bilgisayarlardaki görüntü belleğini tek havuz yapmıyor. Bu sınır nedeniyle çalıştırılacak modelin seçilen makineye sığması gerekiyor. Yönlendirici, mevcut çıkarım hizmetlerinin mimarisini değiştirmeden onların önüne yerleşiyor. Windows 11, Linux ve macOS çalıştıran x64 ya da arm64 makineler aynı kümede eşlenebiliyor; düğümlerin aynı işletim sistemini kullanması gerekmiyor. Düzenek böylece tek ve daha büyük bir sanal hızlandırıcı kurmak yerine, birbirinden bağımsız istekleri eldeki ayrı bilgisayarlara paylaştırıyor.[1]

NVIDIA gösterimi sınırını da belirtti

NVIDIA'nın Hermes Desktop ile yaptığı gösterim, bir görevi 5 ayrı çözümlemeye ayırdı. RTX Spark, DGX Spark ve RTX 5090 birlikte kullanıldığında tamamlanma süresi, yalnızca RTX Spark dizüstü bilgisayarla yapılan çalışmaya göre yaklaşık 2 kat azaldı. Bu karşılaştırma şirketin kendi gösterimine dayanıyor; NVIDIA sonucu genel bir başarım güvencesi saymamak gerektiğini belirtti. PAIR'ın kodu ve başlangıç kılavuzu GitHub'da yayımlandı. Bu malzemeler, geliştiricilerin yönlendiriciyi kendi yerel model hizmetlerinin önünde kurup hangi makinelerin uygun düğüm sayılacağını tanımlamasına olanak veriyor.[1]

Kaynakça

  1. Haber kaynağıInfoQNVIDIA'nın Kişisel Yapay Zekâ Yönlendiricisi yerel çıkarımı aynı ağdaki makinelere dağıtıyor↩1↩2↩3
  2. Haber kaynağıNVIDIA Technical BlogPAIR sanal çıkarım yönlendiricisi yerel ağdaki kullanılabilir hesaplama gücünü genişletiyor↩