Ölçüm neyi ölçüyor?
Hume AI'daki araştırmacıların Hugging Face'te yayımladığı çalışma, 11 açık kaynaklı konuşma tanıma modeline basit bir soru sordu: ses ile ölçümün başvuru metni çeliştiğinde model hangisini yazıyor? Modellerin 6'sı, sesle çeliştiği hâlde başvuru metnindeki bilinen yazım hatasını yeniden üretti. Yani bu modeller, duydukları şeyi değerlendiren bir sınavda, sınavın beklediği cevabı verdi.[1]
İki sınama daha aynı yöne işaret ediyor. LibriSpeech'te en yüksek puan alan modellerin bazıları, sesten çıkarılmış sayıları örneklerin yaklaşık yüzde 30 ile yüzde 40'ında yine de yazdı. Yazım kuralını seçmeleri istendiğinde birkaç model yaklaşık yüzde 90 doğrulukla geçiş yaptı; rastgele seçim tabanı yüzde 50. Bir kaydın hangi veri kümesinden geldiğini ayırt edebilen model, o veri kümesine beklediği cevabı da verebilir.[1]
Altyazıyı bekleyen için ne değişiyor?
Sokaktaki gözle bakınca fark şu: ölçüm puanı bir sınavı ölçüyor ve altyazıyı bekleyen kişi o sınavın dışında duruyor. Yazarlara göre bir puan, ölçüme özgü örüntülerin öğrenilmesiyle de yükselebilir ve bu yükseliş çözümlemenin gerçekten iyileştiği anlamına gelmeyebilir. Bana göre sıralama hâlâ gerçek bir şeyi sıralıyor, ama tanımadığı bir seste ne olacağına dair bir söz vermiyor.[1]
En güçlü karşı açıklama şu: modeller gerçek bir beceride iyi olabilir; eğitildikleri malzemenin yazım geleneklerine uymak, o malzemeyle çalışan biri için zaten istenen şeydir. Çalışmanın yeni veriyle yaptığı adım bu açıklamayı zorlaştırıyor. Aynı alanlardan yeni toplanmış ses kayıtlarında modellerin çoğu duyduğunu yazmaya döndü; bu davranış, alanı bilmekten çok sınav kümesini tanımaya benziyor.[1]
Bir sonraki sinyal ne?
Bu köşe bu ay 'Aylık 1 milyar kullanıcı sayısı, Gemini'nin ne kadar kullanıldığını söylüyor mu?' yazısında benzer bir soruyu sormuştu: birbiriyle uyuşan üç ölçüm vardı, ama hiçbiri şirketin kendi kullanıcı rakamının geldiği yüzeyi ölçmüyordu. Konuşma tanımada durum daha keskin, çünkü burada ölçüm ile kullanım aynı ses üzerinde çalıştırılabiliyor ve yine ayrışıyor.[1], [2]
Bugün elde olan denetim küçük: hiçbir ölçümün görmediği bir ses dosyası seçin — kendi aksanınızla bir sesli not, modelin desteklediğini söylediği bir dilde bir ders — ve çıkan metni söylenenle karşılaştırın. Yayımlanan puanın oynaması ayrı bir mesele; o puan aynı sınav kümelerinde oynamaya devam edecek. Okumamı değiştirecek şey, tanıdık sayının yanında yeni toplanmış sesle alınmış bir sonucun da yayımlandığı bir sıralama olurdu.[1]