Aynı düzeltici, iki skor tahtası

Dong, Wang ve Jin, sabit bir çıkarım anı dönüşümünün TruthfulQA benzeri bir doğruluk stres testinde yaklaşık 10 puan kazandırırken klinik çoktan seçmeli başarımda hemen hemen durduğunu yazıyor. Gerekçe, yönerge ayarının çıktı olasılığını tek şıkta yığması ve uç entropiyi düşük bırakması. Dış getirici, ince ayar veya ek model çağrısı istenmiyor; çünkü her biri klinik yönetişimin onaylayacağı yeni altyapı demek.[1]

Bu, skorun adının ölçtüğü şeyi değiştirmesidir. TruthfulQA, modelin düşük güvenli uydurmayı bırakıp bırakmadığını yoklar. MedQA sınıfı şık testleri, zaten keskinleşmiş bir dağılımın tepesini okur. Aynı logit dönüşümünün ikisinde birden işlemesi gerekmez; ikinci tahtada dönüşecek kütle kalmamıştır.[1]

Kapı, tek geçişte iki sayı

ALTAS, her soruda uç entropi ve geç katman doğrusalığı (R²) okuyup açgözlü çözme ile geç katman yörünge düzeltmesi arasında seçiyor. Sınıflandırıcı, sonda veya kafa eğitilmiyor; yönlendirici aday şık logitleri üzerinde duruyor ve gecikmeye yüzde 6,5 yük yazıyor. Her soruya uygulanınca TruthfulQA kazancı 3B'de 11,4, 8B'de 10,0 puan (p<10⁻¹⁰). Kapılanınca 8,3 ile 9,5 puan kalıyor; MedQA, PubMedQA ve MedHallu açgözlüye göre bir puanlık zararsızlık bandında, istatistiksel fark yok. Eşikler dondurulmuş.[1]

Klinik bir ürün iddiası henüz yok: bu bir ön baskı yöntemi, hasta sonucu değil. 22 Temmuz'da bu köşede sorulan şey, skorun ortamı mı yoksa adı konan yapıyı mı ölçtüğüydü; burada aynı düzeltici TruthfulQA ile klinik şık testinde ayrışıyor. Bağımsız bir ekip aynı dondurulmuş eşiklerle MedQA'yı bir puanlık bandın dışına taşırsa, kapının alanda tuttuğu şey çöker.[1], [2]