Hangi özgün sürüm?

Multiverse Computing, Quantization-Aware Healing'i alışılmış yaklaşımdan tek bir noktada ayrılan bir kurtarma yöntemi olarak tanıtıyor: sıkıştırılmış öğrenciyi, dondurulmuş öğretmen olarak tutulan sıkıştırma öncesi özgün modelden doğrudan damıtıyor. Bunu, logit üzerinde KL ıraksaması yitimiyle ve 32.000 belirteçlik dizileri taşıyabilen parçalı bir hesapla yapıyor. GPT-OSS 120B modeli 60B parametreye indirilip MXFP4'e nicemlendiğinde ortaya çıkan model, kendi bfloat16 sürümünü 9 başarımın 7'sinde geçiyor. O bfloat16 sürümü de sıkıştırmanın ürünü: yöntemin damıttığı 120B ağ yerine, nicemleme öncesindeki 60B ara sürüm.[1]

Bu karşılaştırmadaki kazançlar gerçek ve eşit dağılmıyor. 60B bfloat16 taban sürüme karşı 4 bitlik model AA-LCR'de 7,4, AIME 2025'te 5,6 ve Aider'da 2,7 puan ekliyor; SciCode'da 1,4, MMLU-Pro'da 0,2 puan geri veriyor. Başlığın anlatmadığı şey, bir alıcının önündeki karşılaştırma. Oradaki seçim, sıkıştırılmış modelle ondan damıtıldığı 120B öğretmen arasında ve tablo o sütunda ayrışıyor: LiveCodeBench'te 66,5'e karşı 66,0, GPQA Diamond'da 67,4'e karşı 69,0, AA-LCR'de 42,7'ye karşı 50,0.[1]

En çok oynayan başarım

AA-LCR her iki yönde de en çok oynayan başarım ve ilk bakacağım yer orası. Kümedeki uzun bağlam akıl yürütme görevi bu; ağırlıkları kesilip nicemlendikten sonra modelin uzun bir girdiyi ne kadar bir arada tutabildiğine en çok bağlı olan puan. Yöntem, sıkıştırılmış kardeş sürüme karşı bu puanın 7,4'ünü geri kazandırıyor; modeli öğretmenin ise 7,3 puan gerisinde bırakıyor. En yalın okuma şu: iyileştirme, nicemlemenin uzun girdilerde götürdüğünün büyük bölümünü geri getiriyor, yarıya inen parametre sayısı ise gerçek bir aralığı açık bırakıyor. Başka bir okuma daha var: AA-LCR kümedeki en gürültülü madde olabilir ve o durumda farklı tohumlarla yapılacak bir yineleme onu ötekilerden daha çok oynatır. Yazı, tek çalıştırmaya dayanan sonuçlar bildiriyor.[1]

Bu ay ikinci kez bir nicemleme kurtarma iddiası, karşılaştırma kümesi satıcının seçtiği hâliyle geliyor. Bir hafta önce NVIDIA'nın ortanca kurtarma oranını okuduğumda sorun, puanlama kümesinin bileşiminin denemeler arasında değişmesiydi; ortanca, yöntemden başka nedenlerle oynuyordu. Multiverse Computing, NVIDIA'nın vermediği başarım başına tabloyu yayımlıyor ve bu daha işe yarar bir açıklama. İkisinde de eksik kalan ise aynı: değerlendirme düzeneği, çalıştırma sayısı ve satıcı dışından birinin aldığı herhangi bir ölçüm.[1], [3]

Bunu çözecek ölçüm

Bunu çözecek ölçüm dar ve ucuz: aynı dokuz başarım, yayımlanan 4 bitlik ara sürüm ile GPT-OSS 120B üzerinde, ilan edilmiş tek bir düzenekte ve farklı tohumlarla en az üç kez çalıştırılsın, ortalamanın yanında yayılım da bildirilsin. Multiverse Computing yöntem için arXiv'de 2608.20953 numaralı makaleye yönlendiriyor; yazının kendisi ağırlıkların açık olup olmadığını söylemiyor ve onlar olmadan şirket dışından kimse bu sınamayı yapamaz. Ağırlıklar ve düzenek 30 Kasım 2026'ya kadar yayımlanırsa, AA-LCR'de öğretmene karşı açığın 4 puanın üzerinde kalmasını, LiveCodeBench'teki üstünlüğün ise çalıştırmalar arası gürültünün içine düşmesini beklerim.[1]

Karşılaştırma noktası seçimi bu hafta başka bir yerde de benzer bir iş görüyor. Nvidia, Groq 3 LPX'in Gemma 4 31B üzerinde saniyede 3.400 belirtece ulaştığını, Cerebras'ta bu değerin saniyede 882 belirteç olduğunu açıkladı; oysa aynı rakam bir yanda en az 64 hızlandırıcı, öbür yanda bir ya da iki birim gerektiriyor ve Cerebras'ın güncel CS-4 kuşağını dışarıda bırakıyor. İki durum, okuyucunun neyi geri kurabildiği bakımından ayrışıyor. Multiverse Computing öğretmen satırını basıyor, böylece başlığın atladığı karşılaştırma aynı tablodan çıkarılabiliyor; LPX iddiası rakip kuşağı büsbütün dışarıda bıraktığı için yayımlanan rakamlarla yapılacak hiçbir işlem onu geri getirmiyor.[1], [2]