283 saniyenin içinde ne var?

NVIDIA, iki çalışan süreçli bir GLM-5.2 kurulumunda süreçlerden birini bilerek durdurdu. Model B200 düğümlerinde NVFP4'e nicemlenmişti; yapay yükte her istek 32.000 girdi ve 1.000 çıktı belirteci taşıyor, saniyede 0,7 istek geliyordu. Soğuk yol, ağırlıkları yüksek bant genişlikli belleğe yeniden yükleyip çekirdekleri derliyor ve CUDA çizgelerini yeniden kuruyor. Dolayısıyla ölçüm, açıklanmış bir iş yükünde sağlıklı donanım üstündeki süreç arızasını sınıyor.[1]

Soğuk yeniden başlatmada ikinci çalışan süreç 283 saniyede geri döndü; hazır yedekle bu süre 7,3 saniyeye indi. Arızadan sonraki pencerede ilk belirtece kadar geçen ortanca süre 23.815 milisaniyeden 1.311 milisaniyeye düşerken, kullanıcı başına ortanca çözme hızı saniyede 12 belirteçten 46 belirtece çıktı. Bunlar NVIDIA'nın kendi denemesinin sonuçları; kazanç, arıza sırasında öteki çalışanın bütün istekleri tek başına taşıdığı iki çalışan süreçli düzene ait.[1]

Yedeğin ödediği ve ödemediği bedel

Hızın karşılığı, aynı ekran kartında önceden hazırlanmış ikinci bir çıkarım motoru. NVIDIA'nın GPU Memory Service katmanı fiziksel ağırlık sayfalarını süreçten bağımsız tutuyor; etkin ve yedek motor aynı ağırlıkları eşliyor. Yedek motor ayrı bir ağırlık kopyası ya da anahtar-değer önbelleği taşımıyor, ancak CUDA bağlamını, yakalanmış çizgeleri ve iletişim düzeneklerini hazır tutuyor. Böylece bellek giderinin en büyük iki kaleminden kaçınıyor, fakat yedek sürecin duran altyapısı yine ekran kartında yer kaplıyor.[1]

Ürün önizleme aşamasında ve dinamik kaynak ayırma açıkken Kubernetes 1.34 ya da üstünü gerektiriyor; başlıca desteklenen arka uç vLLM. Kapsamı da dar: süreç çökmesi, kurtarılabilir CUDA hatası ve geçici iletişim arızası gibi durumları hedefliyor. Donanım, düğüm ve çok düğümlü arızalarda olağan yeniden zamanlama sürüyor. Bir işletmecinin bu düzeneğe değer biçmesi, farklı trafik karışımlarında ek ekran kartı belleğini ve yararlı iş hacmindeki değişimi ölçmeyi gerektiriyor.[1]