Uzun bağlam dikkat katmanında daralıyor
NVIDIA, uzun bağlamın gecikmesini yalnızca daha hızlı donanım sorunu olarak ele almadı. Yayımlanan çözümleme, sorgu başlığı sayısının anahtar-değer başlığı sayısına oranı, başlık boyutu ve dizi uzunluğunun GPU üzerinde çıkarım süresini nasıl belirlediğini ölçüyor. Nidhi Bhatia, Samkit Jain, Sai Kishan Pampana, Ritika Borkar ve Bita Darvish Rouhani imzalı yazıya göre çözme aşamasındaki başarım grup boyutuyla doğrusal ölçekleniyor ve grup boyutu iki katına çıktığında yaklaşık iki kat hızlanma elde ediliyor; ön dolum aşaması ise bu parametreye duyarsız kalıyor. Başlık boyutu için GPU döşeme boyutlarına oturması amacıyla 128 veya 256 öneriliyor. Ön dolum giriş uzunluğuyla karesel, çözme ise anahtar-değer önbelleği uzunluğuyla doğrusal büyüyor. Ölçümler hem dikkat hesabı hem de anahtar-değer önbelleği için FP8 duyarlıkla yapılmış; iki anahtar-değer başlıklı gruplanmış sorgu dikkati kullanan NVIDIA Nemotron 3 örnek olarak veriliyor. Yazı TensorRT-LLM içindeki tensör paralelliği, geniş uzman paralelliği ve Helix paralelliği yaklaşımlarını dört tasarım önerisinde topluyor. Yeni bir model ağırlığı ya da kod paketi yayımlanmadı.[1]
