Eigen RadarYapay Zekâ
Analiz

TaSQ, model önbelleğinde bir bit düzeyinde sıkıştırmayı sınadı

TaSQ ön baskısı, dil modellerinin anahtar-değer önbelleğini kanal başına yaklaşık bir bit düzeyinde sıkıştırmak için niceleme uzayını yeniden düzenliyor. Araştırmacılar, tek RTX 6000 Ada üzerinde daha büyük topluluklarla tepe üretim hızının 1,87 katına çıktığını bildiriyor. Kodlama işlemi ilk belirtece ulaşma süresini yüzde 10–14 artırdı. Sonuçlar, sürekli üretimdeki kazanç ile başlangıç gecikmesini ayırıyor ve denenen modellerle altyapı için geçerli.

Yapay Zekâ··Gece
Aydınlık laboratuvarda açık alüminyum test düzeneğine bağlı, fanlı tek profesyonel grafik işlemci.

Üretim hızındaki artışa başlangıç gecikmesi eşlik ediyor

TaSQ ön baskısında araştırmacılar, tek RTX 6000 Ada üzerindeki deneyde tepe üretim hızının 1,87 katına çıktığını bildiriyor. Karşılaştırma aynı SGLang altyapısıyla yapıldı. Tepe hız saniyede 220,8 belirteçten 412,6 belirtece, azami topluluk büyüklüğü altıdan 84’e yükseldi. Nicelenmiş önbelleğin kodlanması ise 8K–32K belirteçlik istemlerde ilk belirtece ulaşma süresini yüzde 10–14 artırdı. Böylece başlangıç gecikmesi ile sonraki üretim hızı ayrı sonuçlar verdi.[1]

Yöntem önbellek nicelemesini yeniden düzenliyor

TaSQ, üretim sırasında yeniden okunan önceki belirteç etkinleştirmelerini tutan anahtar-değer önbelleğini sıkıştırıyor. Kanal başına yaklaşık bir bit düzeyinde küçük bir kod kitabının büyük kanal gruplarını temsil etmesi gerekiyor. Sorgulara göre ağırlıklandırma, dikkat başlıkları arasında normalleştirme ve kovaryansa göre gruplama bu temsili yeniden düzenliyor. Yazarlar, dönüşümlerin kod kitaplarıyla izdüşüm ağırlıklarına eklenebildiğini; vektör nicelemesindeki standart aramaların ve döner konum gömmeleriyle uyumun korunduğunu belirtiyor.[1]

Testlerde model görevleri ayrı ele alınıyor

Tek ön baskıya dayanan çalışma kod ile matematik görevlerini, genel bilgiyi ve uzun bağlamdaki bilgi aramasını ayrı ölçüyor. Genel testlerde Qwen3-4B ile Llama-3.1-8B-Instruct, akıl yürütme deneylerinde ek modeller kullanılıyor. RULER testleri 4K–64K bağlamları kapsıyor; her ayarda 200 örnek ve üç örnekleme tohumu bulunuyor. Ek dönüşümlerin sınırlı kazancı nedeniyle değerler için standart bitişik gruplama korunuyor. Verim ve kalite sonuçları, araştırmacıların denenen modeller ile kurulumdaki deneylerine dayanıyor.[1]

Kaynakça

  1. Haber kaynağıarXivTaSQ, bir bitlik önbellek için niceleme uzayını yeniden düzenliyor↩1↩2↩3