Kısa üretim, uzun eylem

BitNest’in OpenVLA-7B deneyinde aynı robotik eylemin belirteç üretim aşaması 135,6 milisaniyeden 100,8 milisaniyeye düşüyor. Fakat toplam eylem süresi 201,5 milisaniyeden 212,7 milisaniyeye çıkıyor. Araştırmacıların kendi ölçümünde hızlanan bölüm, kullanıcının beklediği bütün işi hızlandırmıyor. Görsel kodlama bu iki toplamın da dışında; açıklanan sınır içinde bile kazanç kayboluyor. Bir kontrol sistemi için karşılaştırılacak sayı, yalnızca son altı belirtecin üretim hızı değil, eylemi hazırlamakla üretmek arasındaki toplam bekleyiş.[1]

Başlangıç işleme aşaması 65,9 milisaniyeden 111,7 milisaniyeye çıkıyor. Makale bunun mekanizmasını da veriyor: küçük matrisli üretim yolu paketlenmiş düşük bitli ağırlıkları doğrudan okuyor; büyük başlangıç matrislerinde mevcut uygulama ağırlıkları FP16 biçimine açıp cuBLAS kullanıyor. Niceleme ve diğer dönüşümlerin ek işi burada kalıyor. Sonuç, bellek trafiğini azaltan gösterimin her hesaplama aşamasında aynı verimi sağlamadığını gösteriyor.[1]

Bellekteki kazancı ayrı tutalım

Bu gecikme sonucu, BitNest’in bellek kazanımını silmiyor. Taslak 4 bitlik tabanı okuyor; doğrulayıcı ek düzeltme düzlemiyle 8 bitlik gösterime erişiyor. Ayrı taslak ağırlığı saklanmıyor. Jetson Orin NX 16 GB üzerinde LLaMA-2-7B-32K için PyTorch tepe ayırması FP16 ile 13,9 GiB, W8A8 ile 8,2 GiB, BitNest ile 7,7 GiB. Aynı deneyin sistem genelindeki tepe belleği de raporlanıyor. Tahsis edilen model belleğiyle cihazın bütün bellek kullanımını eşitlemek bu farkı saklıyor.[1]

Jetson karşılaştırmasında tek doğru payda da yok: FP16 ayrı bir hassasiyet noktası, W8A8 ise zaten sıkıştırılmış taban. Araştırmacıların verdiği üretim hızları sırasıyla 6,0 ve 7,8 belirteç/saniye; BitNest 9,0–9,3 aralığında. Belleği dar bir cihazda ikinci fark daha doğrudan karar desteği sağlıyor, çünkü niceleme kazancını taslak düzeninin ek kazancından ayırıyor. Alternatif açıklama, hızın yalnızca iç içe gösterimden değil, ayarlanmış bellek okuma çekirdeklerinden de gelmesi; makale bu çekirdek iyileştirmesini ayrıca ölçüyor.[1]

Karar cihazdan ve işten çıkıyor

Donanımı seçen ekip için bu çalışma iki ayrı mühendislik sonucu taşıyor: sınırlı belleğe sığan uzun bağlam ve eylem başına toplam gecikme. Jetson’da çalıştırılabilir bağlamın büyümesi, OpenVLA’daki başlangıç yükünü ortadan kaldırmıyor; robotik deneydeki yavaşlama da dil modeli belleğindeki tasarrufu hükümsüz bırakmıyor. BitNest bir ön baskı ve bu ölçümler araştırmacıların düzeneğine ait. Uygulama seçiminin dayanağı, aynı cihazda aynı işin bütün aşamalarıyla karşılaştırılması. Darboğazın adı bu örnekte bellekten başlangıç işlemeye geçiyor.[1]