19 Eylül npj Digital Medicine deneyi ESI-matched çiftleri ve altı saatlik kötüleşme kapısını tutarken üç açık ağırlıklı model nötr ve damgalayıcı cümleleri sıraladı. Damgalayıcı sık acil kullanımı satırı her model-veri hücresinde sırayı kaydırdı; üst sınır yüzde 9,4.
Bilim··Öğle
Altı saatlik kapı
npj Digital Medicine ekibi iki üniversite hastanesinde Acil Önem İndeksi ile eşleştirilmiş çiftler kurdu: her çiftte bir dosya altı saat içinde kötüleşti, eşi kötüleşmedi. Gemma, Qwen ve DeepSeek, tek bir demografik, toplumsal veya damga ipucu eklenmeden ve eklendikten sonra bu çiftleri yeniden sıraladı. Sonuç ölçütü altı saatlik kötüleşme; model beğenisi değil. On sekiz ifade ızgarası aynı fikrin nötr ve damgalayıcı cümlelerini karşılaştırdı; çift, motor ve ifade boyutlarında 221.556 model karşılaştırması üretti, tek bir hasta sayısı başlığı değil.[1]
Hangi cümle sırayı bozdu
Sık geliş damgası satırı denendiğinde her model ve veri hücresinde zararlı yeniden önceliklendirme görüldü; üst sınır yüzde 9,4 civarında ve nötr ifadeyi hücre içinde 1,4 ile 7,1 puan geçti. Klinik fikir sabitken yalnızca cümle değişince sıra yine kaydı. Psikiyatri öyküsü ipuçları da kuyruğu yaklaşık yüzde 9,5'e kadar oynattı; damga ile nötr arasındaki anlamlı fark yalnızca bir motorda çıktı. Irk, dil ve sigorta etiketleri tutarlı kayma vermedi; zarar her öznitelikte aynı boyutta değildi.[1]
Tekrarın eşiği
Bu, üç açık ağırlıklı modelde, ESI-matched ve 6 saatlik kötüleşme kapısıyla kurulmuş bir deney. Kapalı ticari modeller, başka bir Acil Önem İndeksi (ESI) eşiği veya farklı bir kötüleşme tanımı aynı yüzdeyi vermeyebilir. Girdi seçiminin güvenlik sınırı olduğu, bu düzeneğin ölçtüğü kaymadan çıkan bir yorum.[1]