Korece tıp soruları eğitim ve doğrulama dosyalarında örtüştü
Kang Su Ha ile Mi Ae Yang’ın yürüttüğü inceleme, Korece tıbbi soru yanıt verilerinde doğrulama satırlarının yüzde 96,7’sinin eğitim sorularıyla aynı kimliği taşıdığını buldu. Uzmanlık alanları da eşit temsil edilmiyordu. İki uyarlanmış Qwen modelinin ayrı bir başarım sınamasındaki doğruluk farkı istatistiksel açıdan anlamlı çıkmadı. Bulgular, model puanı ile bağımsız değerlendirme arasındaki ayrımı somutlaştırıyor.
Yapay Zekâ··Gece
Doğrulama soruları eğitimde yeniden karşılaşıldı
Kang Su Ha ile Mi Ae Yang’ın yürüttüğü inceleme, veri kaynakları sunan AI Hub’daki Korece tıbbi soru yanıt kümelerinde yaygın soru tekrarları saptadı. Doğrulama için ayrılan 3.448 satırın 3.333’ü, eğitim kümesindeki sorularla aynı kimliği taşıyordu. Bu, doğrulama satırlarının yüzde 96,7’siydi. Soru metinlerinin ortanca benzerliği 0.885 oldu. Araştırmacılar, aynı kaynakla uyarlanan modeller için bu bölümün bağımsız sınama sağlayamayacağı sonucuna vardı.[1]
Uzmanlık alanları eşit temsil edilmedi
İnceleme, uzmanlık bilgisi ve temel tıp bilgisi kaynaklarını kapsadı. Toplam 222.073.009 belirteç ve 17 alanda 34.487 soru yanıt çifti vardı. Belirteç, dil modelinin işlediği metin birimidir. Soruların yüzde 78,7’si çoktan seçmeliydi. Yoğunlaşma ölçüsü 0.178 olarak bulundu; bunun karşılığı 5,62 etkin alandı. Böylece toplam alan sayısı yüksek olsa da içeriğin daha dar bir alanda toplandığı ortaya çıktı.[1]
Ayrı model sınamasında puanlar yakın kaldı
Korece tıp sorularıyla başarım sınayan KorMedMCQA üzerinde yapılan ayrı karşılaştırmada, 2.489 benzersiz soruyu temsil eden 2.494 satır kullanıldı. Qwen2.5-14B’nin temel bilgiyle uyarlanan modeli yüzde 64,35, uzmanlık bilgisiyle uyarlanan modeli yüzde 64,03 doğruluğa ulaştı. İki uyarlama için eşleştirilmiş McNemar sınamasının p değeri 0.440 oldu; fark istatistiksel açıdan anlamlı çıkmadı. Araştırmacılar, sınama kümesindeki bulaşmanın giderilmesini ile klinik hatalara yönelik inceleme istedi; ölçütlerin önceden belirlenmesini önerdi. Bu puanlar klinik kullanıma hazır olunduğunu kanıtlamıyor.[1]