Aynı kartın iki hizmet hedefi
Strata’da dört konuşmanın birlikte çalışması, GPU belleğini yeniden paylaştırıyor. Yerel çıkarım motorunun geliştiricisi, RTX 5070 üzerindeki Q2_0 deneyinde son isteğin başlama süresini 11,2 saniyeden 1,8 saniyeye indirdiğini bildiriyor. Aynı denemede toplam üretim hızı saniyede 70,7 belirteçten 63,1 belirtece düştü. Bekleyen kullanıcı daha erken hizmet alırken kartın toplam çıktısı azaldı. Bu iki sonuç, aynı donanımda farklı hizmet hedeflerine karşılık geliyor.[1]
Her açık oturum uzman önbelleğinden 0,56 GiB alıyor. Modelin kullandığı uzman parçalarını GPU’da tutan bu alan daraldığında, eşzamanlılık için yer açmanın bedeli mevcut işin hızına yansıyor. Geliştirici, tek isteğin bile iki yuva açıkken yüzde 11, dört yuva açıkken yüzde 22 yavaşladığını bildiriyor. Kart aynı kart; daha fazla oturum açmak, model parçaları için ayrılmış bellekle kullanıcı oturumlarının belleğini birbirine rakip hale getiriyor.[1]
Benim buradan çıkardığım işletme tercihi şu: bir kartın verimini değerlendirirken toplam belirteç üretimiyle sıradaki kullanıcının bekleyişini birlikte ölçmek gerekiyor. Kısa süreli bir istek yığılmasında daha erken başlama değerli olabilir; sürekli yoğun işte toplam çıktının düşmesi daha ağır basabilir. Bellek açıklaması bu tercihe somut bir neden veriyor. Bununla birlikte, oturumları birlikte yönetmenin yazılım gideri de yavaşlamaya katkı yapabilir; açıklanan deney bu etkileri ayrı ayrı ölçmüyor.[1]
Belleği ayırmak, donanımda çalıştırmak
Strata bu yüzden eşzamanlılığı isteğe bağlı tutuyor ve uzmanların çoğu GPU belleğine sığıyorsa öneriyor. Uzun istem, parça sınırında kısa isteğe yol verebiliyor; boş yuva kalmadığında yeni konuşmalar bekliyor. Tek başına kalan istek sırayla işleme yoluna dönüyor. Kullanıcının önündeki tercih, bilgisayarda daha çok konuşma açarken hangi belleği ve hangi bekleme süresini önceliklendireceği.[1]
Donanımın genişlemesi de farklı teslim aşamalarında. Pascal ve Volta için CUDA 12.9 motoru derlenmiş durumda; geliştiricinin elinde bu kartlar bulunmuyor. Intel Arc yolu Linux’ta kaynak koddan derleniyor, çekirdek testleri CPU aygıtında yapılmış ve hazır Intel motoru sunulmuyor. Yeni seçenekleri kullanacak kişi, kendi kartında çalışan uygulamaya ulaşmak için deneysel yoldan geçiyor. Derlemenin tamamlanması, o kartta sürdürülen hizmet kapasitesinin ölçülmesinden önceki aşama.[1]
Bir sonraki yararlı karşılaştırmada aynı kart, model ve istemler korunup eşzamanlı oturum sayısı değiştirilebilir. Toplam üretim hızı, son isteğin başlama süresi ve önbelleğe ayrılan bellek birlikte verildiğinde, daha kısa kuyruğun hangi çıktı bedeliyle geldiği anlaşılır. Strata’nın bu sürümünde kararın merkezi, mevcut GPU belleğinin bölüşümü. Sıraya öncelik veren kurulumla toplam üretime öncelik veren kurulum, aynı karttan farklı hizmet almayı seçiyor.[1]