A100 üzerinde payda

40 GB belleğe sahip bir A100, bu çalışmanın fiziksel sınırı. Mukund Agarwalla ve Chih-Jen Lin, TopK-Guided ön baskısında aynı GPU üzerinde Llama-2-7B ve Llama-3-8B için çıkarım hesaplamasını dağıtıyor. Hedefleri yüzde 30, yüzde 50 ve yüzde 70 etkinleşme seyrekliği. Bu yüzde, matris işleminden çıkarılan etkinleşmelerin payı; cihazın elektrik çekişinin veya cevap bekleme süresinin aynı oranda azalması anlamına gelmiyor. İşlem bütçesini okurken paydanın bu ayrıntısını korumak gerekiyor.[1]

Seyreklik burada modelin ağırlıklarını kalıcı olarak silmiyor. Her belirteç için sıfıra yakın etkinleşmelerle ilişkili sütunların bir bölümü işlem dışında kalıyor. Donanımın değişmediği bir karşılaştırmada yazılımın müdahale noktası açık: aynı modelin hangi hesaplamaları yaptığını seçmek. Watt cinsinden bir sonuç çıkarabilmek için cihazın çalışma süresi ve güç ölçümü de gerekiyor. Ön baskının sunduğu ölçüm seti kayan nokta işlem sayısı ve cevap kalitesiyle sınırlı.[1]

Kesintinin yeri değişiyor

Bütçeyi korumanın iki ayrı sorunu var. TEAL’in eşik yaklaşımında farklı belirteçler farklı işlem miktarı alabiliyor; WINA’nın sabit sayıda seçiminde ise bütçe korunurken uyarlama alanı daralıyor. TopK-Guided önce eşik altındaki etkinleşme payını kestirip hedefin bir yüzde puanlık çevresine sıkıştırıyor. Quickselect adımı korunacak etkinleşmeleri seçiyor. Böylece belirtece göre değişen seçim ile önceden belirlenmiş hesaplama sınırı aynı düzende tutuluyor.[1]

Katmanlar da eşit kesinti almıyor. Yoğun ve seyrek çıktılar arasındaki normalize edilmiş hata, kırılgan blokları belirliyor. Erken ve duyarlı bloklarda daha fazla etkinleşme tutulurken sonraki dayanıklı blokların hesaplaması azalıyor; toplam bütçe değişmiyor. Buradaki mühendislik katkısı, aynı işlem payını her yere dağıtmanın yerine hesaplamayı hatanın daha ağır olduğu yerde korumak. Kazanç, yeni bir çipin kapasitesinden önce mevcut hesaplamanın dağıtımında aranıyor.[1]

Çekirdekten hizmet kapasitesine

Yazarların yüzde 70 seyrekli Llama-3-8B deneyinde sekiz görevin ortalama doğruluğu TopK-Guided için yüzde 57,85, WINA için yüzde 55,34 ve TEAL için yüzde 52,64. Bu karşılaştırmanın değeri, aynı model ve seyreklik hedefinde dağıtımın kaliteyi değiştirmesi. Buradan daha büyük modellerin veya farklı iş yüklerinin aynı sonucu verdiği çıkarılamıyor. 7B ve 8B modeller, kullanılan GPU ve bu görevler ölçümün kapsamını belirliyor.[1]

İşlem sayısından hizmet kapasitesine geçişin eksik halkası çalışan çekirdek. Yazarlar hızlı çekirdek uygulamasını sonraki çalışmaya bırakıyor; uçtan uca gecikme ve enerji tasarrufu ölçmüyor. Dolayısıyla bu sonuçla bir veri merkezinin kaç ek isteği karşılayabildiğini hesaplamak mümkün değil. TopK-Guided’ın bugün gösterdiği, sabit işlem bütçesinin daha dikkatli dağıtılabildiği. GPU zamanına dönüşümün ayrı ölçümü, bu dağıtımın işletme giderine katkısını belirleyen aşama.[1]