Muse Glimmer, ExecuTorch ve yeni bir bilgi damıtma yöntemi; modeli, çalıştırma katmanını ve eğitimi daha sınırlı donanıma sığdırmak için üç ayrı yol gösteriyor.
Yapay Zekâ··Akşam
Model ile çalıştırma katmanı aynı hedefte buluşuyor
Meta, 30 milyar parametreli Muse Glimmer'ı görüntü ile metni birlikte işleyen açık ağırlıklı bir model olarak yayımladı. Ağırlıklar Hugging Face üzerinden indirilebiliyor; Apache 2.0 lisansı ticari kullanıma da izin veriyor. Şirket, modeli sürekli çalışan yerel eylemci akışları için tasarladığını ve tek tüketici GPU'su bulunan bir Mac ya da PC'de çalışabilecek büyüklükte olduğunu söylüyor. Bu konumlandırmayı somut bir çalıştırma yolu izliyor: ExecuTorch ekibi NVIDIA CUDA ve Apple Metal için hazır paketler yayımladı. PyTorch'un 64 GiB bellekli M5 Pro üzerindeki kendi ölçümünde model saniyede 21,6 belirteç oluşturdu; DFlash spekülatif çözümlemeyle hız 33,0 belirtece çıktı. Uzun bağlamın bellek yükünü sınırlamak için 52 katmanın 13'ü bütün diziye bakarken 39'u kayan pencere kullanıyor. İlk sürüm metin ve görüntüyü destekliyor; video, oturumlar arası önek paylaşımı, ara kayıt ve sürekli yığınlama henüz kapsamda değil. Meta'nın model karşılaştırmaları ile PyTorch'un hız sonuçları üreticilerin kendi ölçümleri; bağımsız değerlendirme sunulmuyor.[1], [2]
Eğitim tarafında öğretmen model bellekten çıkıyor
Multiverse Computing'in Hugging Face'te yayımladığı yöntem, büyük bir öğretmen modelin bilgisini daha küçük bir öğrenci modele aktarırken iki pahalı adımı değiştiriyor. Önce öğretmenin en yüksek 100 çıktı puanı bir kez hesaplanıp saklanıyor. Yayımlanan yöntemde öğretmen model eğitim boyunca GPU belleğinde tutulmuyor. Ardından KL kaybı, sözlük boyutu ile dizi uzunluğunun çarpımı kadar büyük bir matrisi bir kerede kurmak yerine parçalar halinde hesaplanıyor. Ekibin 32K belirteçlik kendi denemesinde tepe bellek kullanımı 85,2 GiB'den 5,45 GiB'ye, GPT-OSS 20B için adım süresi de 57,0 saniyeden 12,23 saniyeye indi. Ekip, aynı yöntemde eğitimin dört GPU düğümü yerine tek düğümde yürüdüğünü belirtiyor. Uygulama açık kaynak olarak yayımlandı ve yöntem arXiv:2608.03796 numaralı, henüz hakem değerlendirmesinden geçmemiş ön baskıda anlatılıyor. Doğruluk iddiası daha sınırlı: 8 milyar parametreli öğretmenden damıtılan 3,2 milyar parametreli öğrencinin BoolQ ve HellaSwag sonuçlarının büyük bölümünü koruduğu söyleniyor, ancak duyuru bu iki değerlendirme için sayı vermiyor.[3]
Verimlilik tek bir düğmede toplanmıyor
Üç çalışma, daha erişilebilir yapay zekâyı farklı aşamalarda kuruyor. Muse Glimmer modelin boyutunu ve dikkat düzenini yerel çalışmaya uygun hale getiriyor; ExecuTorch aynı modeli belirli donanım arka uçlarına taşıyıp hazır paketlerle çalıştırıyor; damıtma yöntemi ise daha küçük bir modeli eğitirken öğretmenin ve kayıp hesabının bellek yükünü azaltıyor. Bunun sonucu, tek bir başarı sayısından çok bir kaynak zinciri: modelin diskte ve bellekte kapladığı alan, belirteç üretme hızı, uzun bağlamın yükü ve eğitimin istediği GPU sayısı ayrı ayrı ele alınıyor. Haberler aynı zamanda sınırları da görünür kılıyor. Muse Glimmer ve ExecuTorch sonuçları Meta ile PyTorch'un ölçümlerine dayanıyor; ilk çalıştırma sürümünde bazı özellikler eksik. Damıtma çalışmasında büyük bellek ve süre düşüşleri sayılandırılmış olsa da doğruluğun ne ölçüde korunduğuna ilişkin ayrıntılı sonuç yok ve yöntem henüz hakem sürecinden geçmedi. Yine de yayımlanan ağırlıklar, çalıştırma paketleri ve açık kaynak kod, geliştiricilere iddiaları kendi donanımlarında sınayabilecekleri üç ayrı giriş noktası veriyor.[1], [2], [3]