Eigen RadarYapay Zekâ
Analiz

Açık ağırlıklar ve damıtma, yetkin modelleri tek kart belleğine yaklaştırıyor

Meta'nın 30 milyar parametreli Muse Glimmer'ı, NVIDIA'nın 12 dilli Magpie ses modeli ve Multiverse'in damıtma bellek yöntemi, açık ağırlıkla çalışan sistemleri daha dar donanıma sığdırma çabasını yan yana koyuyor.

Yapay Zekâ··Öğle
Aydınlık bir atölyede, ince model yolları ve ses dalgası açık kasadaki tek ekran kartına doğru sıkışıyor; ahşap tezgahta kablolar ve araçlar duruyor.

Tek kartta eylemci ve açık ses modeli

Meta Superintelligence Labs, Muse Glimmer adlı 30 milyar parametreli modeli Apache 2.0 lisansıyla yayımladığını açıkladı. Şirket modele, bulut bağlantısı olmadan bir Mac veya bilgisayarda sürekli açık eylemciler çalıştırmayı hedeflediğini söylüyor; ağırlıklar Hugging Face üzerinde ve llama.cpp, MLX ile ExecuTorch uyumlu derlemelerin önümüzdeki günlerde geleceği belirtiliyor. Glimmer, Meta'ya göre daha büyük Muse Spark modelinin çıktılarından damıtılarak eğitildi; ara aşamada uzun bağlam ve eylemci verisi, son aşamada denetimli ince ayar, kendi verisiyle damıtma ve pekiştirmeli öğrenme bir araya geliyor. Tam duyarlıkta 55 gigabayttan fazla bellek isteyecek model, yaklaşık 4 bitlik nicemleme ile 20 gigabayt altına indiriliyor; şirket bunun 24 gigabayt ile 32 gigabayt arasındaki ekran kartlarına sığdığını ve eylemci görevlerinde kayda değer bir gerileme ölçmediklerini söylüyor. Model metin ile görüntüyü birlikte alıyor, 100'den fazla dilin verisiyle eğitildi ve OpenClaw gibi eylemci düzenekleriyle çalışıyor. Meta, DeepSearch QA, MCP-Atlas, 𝛕-Bench ve SWE-Bench başarımlarında Gemma4-31B ile Qwen3.6-27B karşısında güçlü sonuçlar bildiriyor; ölçümler şirket değerlendirmesine dayanıyor ve bağımsız doğrulanmadı. Aynı pencerede NVIDIA, Hugging Face yazısında Magpie metinden konuşmaya modelinin yeni sürümünü tanıttı: açık ağırlıklar, NVIDIA NIM paketi ve 12 dil; yeni kapsamda Modern Standart Arapça, Korece ve Brezilya Portekizcesi var. Şirket, sesli eylemcilerin gecikmesini kendi altyapısında yönetmek isteyen ekipleri hedeflediğini söylüyor.[1], [2]

Damıtmanın bellek tavanı ve katmanlı ses

Multiverse Computing ekibi Hugging Face yazısında, büyük dil modellerini küçültürken kullanılan damıtma adımının bellek tepesini düşüren iki değişikliği anlatıyor. Olağan düzende öğretmen ve öğrenci modeller bellekte birlikte duruyor ve öğretmen her adımda yeniden çalıştırılıyor. Örnek olarak gpt-oss-120b modelinin 201.088 belirteçlik sözlüğü veriliyor: 32K dizi uzunluğu ve 4 yığın boyutuyla yalnızca öğretmen olasılık dizisi bfloat16 biçiminde yaklaşık 50 gigabayt yer kaplıyor, tek eğitim adımının tepe kullanımı yaklaşık 250 gigabayta çıkıyor. Bu tepe, bir H200 ekran kartının 141 gigabaytlık belleğini aşıyor. İlk değişiklik, öğretmenin her konum için en olası 100 belirtecini bir kez hesaplayıp saklamak; ikincisi, çıkış katmanını kayıp hesabının içine katarak öğrencinin tam sözlük dizisini hiç oluşturmamak. Ekip, ikinci yöntemle tepe belleğin yaklaşık 128 gigabayta indiğini ve dizi uzunluğuyla doğrusal büyüdüğünü bildiriyor; karşılığında çıkış izdüşümü ileri ve geri olmak üzere iki kez hesaplanıyor. Ölçümler yazının kendi bildirimidir. Magpie tarafında NVIDIA, bütünleşik ses modelinin tek çağrıyla çalışmasının kolaylık sağladığını, ayrı konuşma tanıma, seslendirme ve dil modeli katmanlarının ise her parçayı ayrı ayarlanabilir bıraktığını savunuyor. Şirket bu yapıyı veri yerelliği, gecikme görünürlüğü ve alana özgü uyarlama isteyen kurumlar için öneriyor; yazı ürün tanıtımıdır ve başarım karşılaştırmaları şirketin kendi bildirimidir.[3], [2]

Açık ağırlık ile dar bellek aynı masada

Üç gelişme farklı ürün katmanlarında olsa da aynı donanım darlığını merkeze alıyor. Muse Glimmer, nicemlemeyle bellek ihtiyacını tek bir tüketici ekran kartının 24–32 gigabayt aralığına indirdiğini ve açık lisansla ağırlıkları paylaştığını söylüyor; bu iddia şirket değerlendirmesine dayanıyor. Multiverse yazısı, damıtma sırasında öğretmen çıktısının her adımda yeniden üretilmesinin H200 belleğini aşabildiğini ve tepe kullanımı yaklaşık 128 gigabayta çekmenin mümkün olduğunu kendi ölçümleriyle ileri sürüyor. Magpie, açık ağırlıklı seslendirme modelini 12 dilde ve kendi altyapısında gecikmeyi yönetmek isteyen ekiplere sunarken bütünleşik ile katmanlı kurulum tercihini kurumun denetim ihtiyacına bağlıyor. Ortak çizgi, modeli yerel veya kurum içi bellek bütçesine sığdırmak ve ağırlıkları ya da bileşenleri açık biçimde dağıtmaktır. Okurun gördüğü tablo bir sıralama değil; parametre sayısı, nicemleme, önbellek ve kayıp hesabının bellek tavanını nasıl daralttığına dair şirketlerin kendi sınır anlatısıdır. Bağımsız doğrulama bu metinlerin kapsamı dışındadır.[1], [3], [2]

Kaynakça

  1. Haber kaynağıMeta AI ResearchMeta, tek tüketici ekran kartında çalışan 30 milyar parametreli eylemci modeli Muse Glimmer'ın ağırlıklarını açtı↩1↩2
  2. Haber kaynağıHugging FaceNVIDIA, 12 dili konuşan Magpie seslendirme modelini açık ağırlıklarla yayımladı↩1↩2↩3
  3. Haber kaynağıHugging FaceMultiverse Computing, damıtmanın bellek tepesini tek ekran kartına sığacak düzeye indiren bir yöntem yayımladı↩1↩2