Aynı dosya boyutunda iki yöntem

NVIDIA'nın 17 Ağustos'ta yayımladığı yazı, Nemotron 3.5 Lightning modelinin 4 bitlik NVFP4 sürümünün nasıl üretildiğini adım adım anlatıyor. Yöntem iki aşamalı: tam duyarlıklı öğretmen modelden eğitim sonrası nicemlemeyle bir öğrenci çıkarılıyor, ardından öğrenci donmuş öğretmene karşı KL ıraksaması kaybıyla eğitiliyor. Karşılaştırmanın güçlü yanı şu: iki yol da aynı 21,19 GB dosyayı üretiyor ve 65,85 GB boyutundaki tam duyarlıklı sürümün karşısında ikisi de aynı bellekte duruyor, dolayısıyla aradaki farkı yöntem üretiyor.[1]

Öne çıkan sayı, yazının medyan kurtarma oranı dediği ölçü: bir başarım listesindeki tek tek oranların ortancası. Ara bir kontrol noktasında eğitim sonrası nicemleme yüzde 96,33 veriyor, damıtma bunu yüzde 99,72'ye taşıyor ve 11 başarımın 10'unda iyileşme görülüyor. Bu, yöntemin lehine en temiz tablo; yazının kendi anlatımına göre burada nicemleme kasten daha agresif tutulmuş, yani damıtmanın kapatacağı bir açık bırakılmış.[1]

Ortancanın altındaki tek tek ölçümler

İkinci ara kontrol noktasında ortanca yüzde 95,84'ten yüzde 98,53'e çıkıyor, ancak iyileşme 9 başarımın yalnızca 5'inde görülüyor. Gerileyenler arasında GDPval Norm. Elo 16,46'dan 12,90'a, AA-Omni Non-Halluci. ise 69,02'den 64,67'ye iniyor. Yazı bunu saklamıyor; sonucu tek tek puanların değil ortancanın taşıdığını açıkça söylüyor. Bu cümle aynı zamanda ortancanın burada ne olduğunu tarif ediyor: listedeki iyileşmeleri ve gerilemeleri tek bir sayıya katan bir özet.[1]

İki ara kontrol noktası aynı listeyle de ölçülmemiş. Birincisi 11 başarımlı bir kümeyle, ikincisi yazının güncellenmiş değerlendirme kümesi dediği 9 başarımlı bir kümeyle puanlanmış. Bu durumda yüzde 99,72 ile yüzde 98,53 farklı ölçeklerde duruyor: her biri kendi kümesinin ortasını bildiriyor. Bir yöntemin gücünü ortancalar arasındaki farkla okumak, kümenin bileşimini sabit varsaymayı gerektirir.[1]

Yayımlanan sürümde sayı nereye düşüyor?

Asıl sınav, kullanıcıya ulaşan sürümde. Orada nicemleme daha temkinli seçilmiş ve eğitim sonrası nicemleme zaten tam duyarlıklı temele yakın duruyor: ortanca kurtarma yüzde 99,24. Damıtmalı sürüm yüzde 98,97 ile bunun biraz altında kalıyor. Yöntemin kazancı bu sürümde ortancada görünmüyor; Terminal-Bench v2.1'de 3,79 puanlık, SWE-Bench Multilingual'da 1,07 puanlık, HLE'de 0,65 puanlık farklarda toplanıyor.[1]

Temmuzda bu köşede bir yatırımcı belgesindeki başarım iddiası ele alınırken sorun, kümenin, sürümlerin ve puanlamanın hiç yazılmamış olmasıydı. Burada bunların hepsi yayımlanmış durumda ve bu gerçek bir ilerleme. Geriye ölçünün kendisiyle ilgili bir soru kalıyor: tek bir eğitimden çıkan tek bir ortanca, hem iyileşen hem gerileyen puanları aynı sayıya katıyor ve tekrar edilen çalıştırmalardaki değişkenlik hakkında hiçbir şey söylemiyor. Bu yöntemi bir üst basamağa taşıyacak şey, yayımlanan NVFP4 sürümü için birden çok çalıştırmayla üretilmiş başarım başına sonuçlar ve NVIDIA dışından bir tekrar olurdu; özellikle halüsinasyon ve eylemci ölçümlerinde farkın yönü buna bağlı.[1], [2]