Eigen RadarYapay Zekâ
Analiz

SpAx, yerel dil modeli üretimini hızlandırmak için dış belleği seçerek okuyor

SpAx, dil modeli her yeni belirteci üretirken ağırlıkları özgün, sıkıştırılmış ve okunmayan gruplara ayırıyor. Tek ön baskı, GPU belleğine sığmayan modellerde ana bellekten veya depolamadan aktarımın nasıl azaldığını sınadı. llama.cpp deneyleri bir RTX 4090 iş istasyonunda yapıldı. Aktarımdan kazanılan süre ile yaklaşık ağırlıkları yeniden oluşturmanın gideri ayrı değerlendirildi; hız bulguları sınanan kurulum ve kalite sınırlarıyla geçerli.

Yapay Zekâ··Akşam
Üstten görülen açık metal bilgisayar kasasında ekran kartı, bellek modülleri ve anakarta takılı depolama birimi bulunuyor.

Okunacak ağırlıklar her belirteçte değişiyor

SpAx, yanıt üretirken ağırlıklarını GPU belleğinin dışından tekrar tekrar okuyan modelleri ele alıyor. Tek ön baskıdaki yöntem, ağ içinde oluşan etkinleşme değerlerinin büyüklüğüne göre üç seçim yapıyor. En küçük değerlerle ilişkili sütunları okumuyor, orta büyüklüktekiler için sıkıştırılmış yaklaşık ağırlıkları getiriyor, en büyüklerde özgün biçimi koruyor. Etkinleşme değerleri değiştikçe seçilen sütunlar da her belirteçte değişebiliyor. Model ağırlıklarının yeniden eğitilmesi gerekmiyor.[1]

Ana bellek ve depolama ayrı sınandı

Ana bellekten aktarım ve depolamadan doğrudan okuma, llama.cpp üzerine kurulan uygulamayla ayrı ayrı sınanıyor. İş istasyonunda RTX 4090 bulunuyor; kartın bağlantısı PCIe 4.0 x8, ana bellek kapasitesi 128 GB. Depolama NVMe üzerinden sağlanıyor. Aynı anda tek örnek üretiliyor. Girdi metni bütün ilgili ağırlıklarla işleniyor, seçici erişim çıktı belirteçlerinde uygulanıyor. Ayarlama aşamasında matris gruplarına okuma bütçeleri atanıyor. Yan yana seçilen aralıklar birleştirilince küçük depolama isteklerinin sayısı azalıyor.[1]

Bayt azalması ile süre kazancı ayrı ölçümler

Daha az bayt aktarımı, her ayarda en kısa üretim süresini sağlamıyor. Yaklaşık ağırlıkları GPU üzerinde yeniden oluşturmak için harcanan süre de ölçüme katılıyor; depolama isteklerinin büyüklüğü biçimler arasında değişiyor. Bu farkın olası açıklamalarından biri yeniden oluşturma gideri, bir diğeri depolamanın okuma düzeni. Biçimler için evrensel bir neden sıralaması kurulmuyor. WikiText-2 ile sözcük dizilerinin olasılıkları, görev deneyleriyle doğruluk ölçülüyor. Gömme katmanı, çıktı katmanı ve dikkat önbelleği GPU içinde tutuluyor. Sonuçların kapsamı sınanan iş yükleri ve kalite toleransları.[1]

Kaynakça

  1. Haber kaynağıarXivSpAx, GPU dışındaki ağırlıkları seçerek okuyup bellek aktarımını azaltıyor↩1↩2↩3