Yeni ölçütler aslında neyi ölçüyor
CapQuiz, üretilen bir betimlemenin referans metne ne kadar benzediğini sormayı bırakıyor. Betimlemeyi, videodan türetilen ve insan doğrulamasından geçmiş çoktan seçmeli soruların yanıtlanmasını destekleyip desteklemediğine göre, 24 video alanındaki 10 soru türü üzerinden puanlıyor; olgusallık ve kapsama bileşenlerini tek bir sayıda topluyor. Gerekçe açık: referansla eşleştirme, bir betimlemeyi sözcük farkları yüzünden cezalandırıyor ve bir video pek çok geçerli betimlemeye izin veriyor. Ölçütü değiştirmek, herhangi iki model karşılaştırılmadan önce puanın hangi özelliğe ilişkin olduğunu değiştiriyor.[1]
DiscoSign aynı hamleyi başka bir yerde yapıyor. İşaret dili sistemleri çoğunlukla cümle cümle çalıştı; bu da işaretli bir bölümün dayandığı yapıyı yitiriyor: işaret uzayında yerini koruyan bir varlık, belirli bir söylem işlevi taşıyan bir tümce biçimi, İngilizce bir kavram ile işareti arasında kararlı bir eşleme. Çerçeve bu olguların 3'ünü ele alıyor ve olağan çeviri puanları söylem düzeyindeki niteliği kaydetmediği için çalışma, üstlendiğini söylediği her boyut adına bir ölçüt getiriyor.[2]
Ölçüm aracı ile sonuç aynı yerden geliyor
İki makale, konularının ötesinde bir şeyi paylaşıyor. Her birinde ölçümü yeniden tanımlayan ekip, o ölçümle elde edilen iyileşmeyi de bildiriyor: CapQuiz'in insan yargısıyla mevcut ölçütlerden anlamlı biçimde daha iyi örtüştüğü, söylem farkındalıklı işlemenin ise yalnızca cümle düzeyinde çalışan çeviriye kıyasla uzamsal tutarlılığı ve varlık izlemeyi iyileştirdiği belirtiliyor. İki ifade de doğru olabilir. Ne var ki kanıt olarak okunduğunda iç doğrulama düzeyinde kalıyorlar; çünkü ölçüt ile onun okunuşu aynı yerden geliyor.[1], [2]
Daha dostça bir okuma da var ve söylenmeyi hak ediyor. Yeni bir ölçüt, eskisinin yanıldığı yerde haklı olabilir; yazarların dışındaki bir ekip aynı sıralamayı kendi ölçümleriyle yeniden üretebilir ve o zaman sonucu taşıyan şey ölçüm aracı olmaz. CapQuiz makalesi tam bu noktada dikkatli: insan yargısıyla karşılaştırma yazarların kendi karşılaştırması ve çalışma başka bir ekibin dış doğrulamasından geçmedi. Bu, iddianın nerede durduğunun dürüst bir tarifi.[1]
Bunu kanıt basamağında ne yukarı taşır?
İzlemeye değer bir sonraki gelişme, ölçütlerden birinin onu kurmayanlarca benimsenmesi olur: özgün ekiplerin dışındaki bir grubun CapQuiz'i ya da DiscoSign söylem ölçütlerini, özgün çalışmanın kapsamadığı modeller üzerinde çalıştırması. Bu olursa her ölçütün ürettiği sıralama ikinci bir elden denetlenebilir hâle gelir ve kazanımı ölçüm aracının mı yoksa yöntemin mi ürettiği sorusu yanıt bulur. O zamana kadar dürüst özet şu: iki makale daha iyi bir soru önerdi ve onu kendileri yanıtladı.[1], [2]