Silinen sayı
Hume AI ekibinin Hugging Face'te yayımladığı çalışma, 11 açık kaynaklı konuşma tanıma modelini üç sınamadan geçiriyor. İkincisi çok yalın: ses dosyasındaki sayılar susturuluyor, sonra modelden duyduğunu yazması isteniyor. Sayı artık seste yok, dolayısıyla doğru çıktıda hiçbir sayı bulunmaması gerekiyor. LibriSpeech'te en yüksek başarım puanına sahip modellerin bir bölümü silinen sayıyı örneklerin yaklaşık yüzde 30-40'ında yine de yazdı — üstelik doğrusunu.[1]
Bu çıktıya sesi çözerek varılamaz; yol, metnin kendisini hatırlamaktan geçiyor. Buna karşı çıkarılabilecek en güçlü açıklama, modelin çevredeki cümlelerden makul bir sayı tahmin etmesi ve zaman zaman tutturmasıdır. Çalışmadaki dağılım o açıklamayı zorluyor: geri getirme oranları en yüksek, kamuya açık başarım kümelerinde çıkıyor; aynı alanlardan yeni toplanan ep-fresh ve libri-fresh seslerinde düşüyor. Bağlamdan tahmin, kümeden kümeye bu kadar keskin değişmezdi.[1]
Başarım kümesinin alıştığı yazım
Diğer iki sınama aynı yöne bakıyor. Birincisi, sesbirim hata oranı düşük bir model topluluğuyla referans metnin kendi hatalarını işaretliyor: incelenen VoxPopuli kesitlerinin yüzde 40'ında olası referans hatası çıkıyor, bu da tüm referans sözcüklerinin yaklaşık yüzde 3'üne denk geliyor. Başarım kümesine uyum davranışı gösteren modeller bu hatalı metinleri yüzde 18-30 oranında olduğu gibi yeniden üretiyor; bir örnekte 11 modelin 6'sı, sesin açıkça içerdiği bir hitap cümlesini referans metnin atladığı yerde atlıyor. Üçüncü sınama aynı sesi veren yazım seçeneklerini karşılaştırıyor: kimi modeller yüzde 50'lik rastgele seçim tabanını aşıyor, bir bölümü yüzde 90'a yaklaşan bir isabetle kendi başarım kümesinin alıştığı yazımı seçiyor.[1]
Rastgele seçim tabanının üstüne çıkmak için modelin önce sesin hangi kümeden geldiğini kestirmesi gerekir. Bu kestirim yapılabildiğinde, bildirilen sözcük hata oranının bir bölümü o kümenin yazım alışkanlığına uyumu ölçmeye başlar ve çözümleme başarısıyla arasındaki bağ gevşer. Fark küçük görünebilir; ama modeli o tek sayıya bakarak seçen biri, kümenin dışında karşılaşacağı davranışı görmeden seçmiş olur.[1]
Bir puanın taşıyabileceği
Yazarlar başarım kümesi hazırlayanlara somut bir öneri bırakıyor: bağımsız ve özdeş dağılımlı bölmeler yerine zaman, konuşmacı ya da başka üstveriye dayalı ayrım. Bu ayrım benimsenmezse aynı modellerin yeni toplanan seste kendi başarım puanlarının gerisinde kalmayı sürdürmesini bekliyorum. Sınamanın yapılacağı yer de belli: çalışma Open ASR Leaderboard'a "Benchmark fitting" adlı bir sekme ekledi ve çözümleme betiklerini açık kaynak yaptı. 31 Aralık 2026'ya kadar o sekmede model başına yayımlanan sonuçlar, bu beklentiyi doğrulamaya da çürütmeye de yeter.[1]
4 Ağustos'taki sütunumda, bir üretim aracının kendi sezicisinin eşiği, hata oranı ve itiraz yolu bildirilmediğinde ortaya bir benzerlik açıklaması çıktığını, köken saptaması çıkmadığını yazmıştım. Buradaki boşluk aynı türden, yalnızca bir adım geride duruyor: küme aidiyetini denetleyen bir düzenek olmadan başarım puanı, modelle birlikte kümeyi de anlatıyor. İşin sevindirici yanı, boşluğu kapatacak şeyin bu kez adının konmuş olması — tümüyle dışarıda tutulan değerlendirme kümeleri ve model başına yayımlanan uyum çözümlemeleri.[1], [2]