Puanın kapsadığı alan

Google DeepMind'in tanıttığı SL2T, 50'den fazla işaret dilinde 100.000 saatten fazla veriyle eğitildi ve bu verinin yaklaşık dörtte biri Amerikan İşaret Dili. Telefona inen işlev ise tek bir yönde çalışıyor: Amerikan İşaret Dili'nden İngilizceye. Şirketin bildirdiği tek sayısal başarım, FLEURS-ASL sd-test ölçütünde 70 BLEURT'lük sıfır atışlı puan ve bu ölçüt de aynı dil çiftini sınıyor.[1]

Buradaki mesele kapsam. Sıfır atışlı 70 BLEURT, bir çeviri çıktısının referans metne ne kadar yaklaştığını söylüyor; eğitim kümesindeki diğer 50 dilin çevirisi hakkında bir şey söylemiyor, telefonda karşılaşılan çekim koşulları hakkında da söylemiyor. Ölçüt, düzgün kaydedilmiş bir değerlendirme kümesi üzerinde çalışıyor; ürün ise elde tutulan bir telefonun kamerasıyla çalışıyor. Aradaki farkı kapatan bir sayı yayımlanmadı.[1]

Google'ın kendi listesi

İlginç olan, bu boşluğu ilk işaret edenin Google olması. Yazı, yalnızca akademik ölçütleri eniyileştirmenin gerçek uygulamalarda kullanılabilirliği garanti etmediğini söylüyor ve ardından ayrıca uğraşılan konuları sıralıyor: akış gecikmesini azaltmak, işaret içermeyen girdide uydurma çıktıyı önlemek, işaret kullananların yüzde 10'unu oluşturan solaklar için adaleti sağlamak ve telefonu diğer elle tutarken yapılan tek elli işaretlerde başarımı iyileştirmek. Bu dört başlığın hiçbirinin yanında bir ölçüm yok.[1]

Dolayısıyla kullanıma açılan işlevin niteliği şu anda onu kapsamayan tek ölçüme dayanıyor. Aynı yazıda hataların seyrek işaretlerde, hızlı parmak alfabesinde, edilgen kuruluşlarda ve bağlamsız zaman kiplerinde sürdüğü kabul ediliyor; bunlar örnek düzeyinde anlatılıyor, oran olarak değil. Başka bir açıklama da mümkün: Sağır kullanıcılarla değerlendirme çalışmaları yürütüldü ve AISLAC ile ortak bir etki raporu yazıldı, sayılar orada durabilir. Ama bu rapordaki değerler tanıtım yazısına girmediği sürece, Pixel 11'de kullanıma açılan işlevin koşul koşul ne yaptığı dışarıdan bilinmiyor.[1], [2]

Ne yayımlanırsa sınanabilir hale gelir?

1 Ağustos'ta LG AI Research'ün 24 ölçütte bildirdiği 70,1 ortalamasını yazarken, tek bir sayının altındaki dağılımın ağırlıklar açık lisansla yayımlandığı için dışarıdan ölçülebilir hale geldiğini savunmuştum. Buradaki durum aynı sorunun kapalı biçimi. SL2T'de de tek bir sayı var, ama ne ağırlıklar ne de koşul koşul ayrılmış sonuçlar yayımlandı; dağılımı dışarıdan ölçmenin bir yolu şimdilik yok.[1], [3]

Bunu değiştirecek şey belli ve dar: Google'ın kendi saydığı dört başlıkta hata oranlarını ayrı ayrı veren bir belge. Solak ve tek elli işaret kullananlar için hata oranı, işaret içermeyen görüntüde uydurma çıktı oranı, akış gecikmesi ve seyrek işaret ile parmak alfabesinde hata oranı. Aralık 2026 sonuna kadar bu ayrımlı sonuçları taşıyan bir teknik belge ya da etki raporu yayımlanırsa, telefondaki işlevin niteliği ilk kez sınanabilir bir iddiaya dönüşür; yayımlanmazsa 70 BLEURT tek başına, ölçmediği bir ürünün başarım kanıtı olarak dolaşmayı sürdürür.[1]