Hangi sorular sayılıyor?

MedBenchAgent ön baskısındaki insan denetiminde 1000 sorudan 994'ü bütün ölçütleri geçti. Bu sayı, tıbbi görsel modelleri sınamak için otomatik soru üretiminin ayrıntılı bir sonucunu veriyor. Paydada önemli bir seçim var: denetlenen sorular, sistemin doğru belirlediği görevlerden çekilmiş. Dolayısıyla yüzde 99,4'lük oran, bu görevlerin içindeki soruların denetimini anlatıyor. Sınamanın hangi becerileri kapsadığı ise başka bir ölçüm gerektiriyor. Aynı çalışmada bu ayrım açıkça tutulmuş; benim ilgimi çeken de yüksek oranın yanında görev seçiminin ayrıca hesaplanmış olması. Tıbbi bir modelin değerlendirmesi, soru yazılmadan önce hangi yeteneğin görünür kılındığına bağlı.[1]

Görev planlamasında araştırmacıların referansı 21 görevden oluşuyor. MedBenchAgent bunların 20'sini buluyor, birini kaçırıyor ve üç fazladan görev öneriyor. Bu dağılım yüzde 90,9 Task-Space F1 veriyor; F1, doğru görevleri bulma ile yanlış eklemelerden kaçınmayı birlikte ölçüyor. Soruların yüzde 99,4 denetim başarısıyla bu puanın farklı olması çelişki yaratmıyor: biri kapsam seçimini, diğeri seçilen kapsam içindeki örnekleri değerlendiriyor. Bir görev yanlış seçildiğinde, o göreve tutarlı sorular yazılması seçimi düzeltmiyor. Tersine, uygun bir görev için yazılmış sorunun yanıtı da yanlış olabiliyor. Denetimdeki altı hata bu ikinci aşamada ortaya çıkmış.[1]

İnsan denetiminin yeri

MedBenchAgent bu sınırları bir ara gösterimde tutuyor: görev tanımı, onu destekleyen görüntü açıklaması, puanlama yöntemi ve soru özellikleri birlikte kaydediliyor. Planlama aşamasında insan kontrolü var; soru üretimi onaylanmış tanımdan ilerliyor. VinDr-Mammo, BrEaST ve BUS-BRA veri kümeleriyle BI-RADS kılavuzunun kullanılması, otomasyona somut dayanak sağlıyor. Burada insanın katkısı, yalnızca son yanıtı işaretlemekten daha geniş: hangi açıklamanın hangi soruyu haklı çıkardığına da karar veriliyor. Bu nedenle bildirilen soru kalitesini, insan denetimini de içeren bu düzenin sonucu olarak okuyorum. İnsan kontrolünü çıkarmanın etkisi aynı sayıdan hesaplanamıyor.[1]

Kurulan sınama 12 görsel-dil modelini karşılaştırınca kapsamın etkisi daha görünür oluyor. Toplam doğruluk ile görev düzeyi doğruluk arasında 66 model çiftinin 12–24'ünde sıralama değişiyor. Mekânsal ölçümlerde değişim 28–34 çifte çıkıyor. Tıbbi modellerin ortalama doğruluğu daha yüksekken değerlendirme kategorisi görevlerinde genel modellerin gerisinde kalması da aynı soruyu büyütüyor: bir modeli hangi görev için seçiyoruz? Tek ortalama, farklı hataların dağılımını bir araya getiriyor. Görüntüde bir bulguyu yerelleştirmekle değerlendirme kategorisini doğru belirlemek ayrı beceriler. Bu deneylerin ölçtüğü sonuç, açıklamalı görüntü kümelerindeki model davranışı; hasta bakımına katkı için kullanılan bir sonlanım yok.[1]

Kapsamı dışarıdan ölçmek

Çalışmanın erken aşamadaki değeri, sınama hazırlamanın kararlarını tek bir üretim puanında eritmeden göstermesinde. Bununla birlikte görev referansı, veri kümelerini bilen araştırmacılar ve klinik işbirlikçilerin görüşleriyle oluşturulmuş. Zengin açıklamaların mevcut görevleri görünür kılması, iyi kapsam sonucuna katkıda bulunmuş olabilir; başka bir veri kümesinde aynı başarıyı varsaymak için dayanak sağlamıyor. ISIC2018'e taşınan uygulama bir ek örnek sunuyor, bağımsız görev tanımıyla kurulmuş dış değerlendirme sorusunu açık bırakıyor. Benim güvenimi artıran nokta, sistemin soruyu hangi açıklamaya bağladığının incelenebilmesi. Güvenin alanını belirleyen nokta ise referans kapsamın nasıl seçildiği.[1]

Bu yöntemi değerlendirmek için bir sonraki güçlü karşılaştırma, başka bir klinik ekibin görev listesini soru üretiminden önce sabitlemesi. Kapsam ölçümü kaçırılan ve yanlış eklenen görevleri bütün liste üzerinden saymalı; soru denetimi de bütün üretilen görevlerle yalnız doğru seçilen görevleri ayrı ayrı göstermeli. Böylece iki paydanın nerede değiştiği görünür olur. Üretilen soruların açıklamaya sadakati için mevcut sonuç yararlı bir başlangıç. Model seçimini bu sınamaya bağlamak isteyen ekip için belirleyici ek bilgi, kendi kullanımındaki görevlerin bu liste içinde ne ölçüde temsil edildiği. MedBenchAgent'ın ölçülebilir iddiasını genişletmek, bu kapsam karşılaştırmasını açıkça kurmayı gerektiriyor.[1]