Beş model, tek bir istatistiksel düğüm
Beth Israel Deaconess'ten psikiyatrist John Torous'un da içinde bulunduğu bir ekip, OpenAI'nin HealthBench'inin 5.000 hekim-kurallı konuşmasını ruh sağlığı ilgisi için taradı, saptadığı alt kümeyi iki tur kör klinisyen incelemesinden geçirdi ve 610 konuşmalık HealthBench-Psych'i çıkardı. 20 modeli üç yapay zekâ yargıcıyla (GPT-4.1, Claude Haiku 4.5, Gemini 2.5 Flash) puanladılar; yargıçların güvenilirliğini de OpenAI'nin HealthBench-Hard'da yayımladığı GPT-4.1 sonucunu (0,16) neredeyse birebir yineleyerek (0,157) sınadılar.[1]
Sonuç bir sıralama değil, bir yığın: Kimi K2.6 (0,627), GPT-5.5 (0,624), Claude Opus 5 (0,620), Grok 4.5 (0,612) ve GPT-5.6-Sol (0,610) o kadar yakın çıkıyor ki düzeltilmemiş yüzde 95 güvenle yalnızca iki model çifti birbirinden ayrışıyor; konuşma sayısı arttıkça yanlış pozitifi önlemek için uygulanan Holm-Bonferroni düzeltmesinden ise hiçbiri sağ çıkmıyor. Yani beş modelin “en iyisi” diye bir şey, bu veriyle söylenemez.[1]
Reddetmeler erdem değil, veri
Sınananlar arasında yalnızca iki model hiç yanıt vermedi. Claude Opus 5, 610 konuşmadan 10'unu (yüzde 1,6) reddetti; bunlar ağırlıkla psikiyatrik ilaç dozu ve klinisyenin hasta yönetimiyle ilgili soruları kapsıyordu. Claude Fable 5 ise 610 konuşmadan 3'ünü (yüzde 0,5) reddetti, üçü de Alzheimer belirteçleri ve mekanizmalarıyla ilgiliydi. Diğer on sekiz model bir kez bile reddetmedi; reddetmeler puanlama kuralında boş yanıt sayıldı.[1]
Bunun okunması tek yönlü değil. Reddetmelerin dozaj ve nörodejeneratif içerikte toplanması, bu iki modelin daha yüksek riskli klinik alanı bilinçli olarak ayırdığını düşündürebilir; ama aynı veri, HealthBench'in doğrudan ve eksiksiz yanıtı ödüllendiren kuralına karşı gereğinden temkinli bir filtrenin puan kaybettirdiğini de gösterebilir — makale ikisi arasında hakemlik yapmıyor. Reddetmeyen on sekiz modelin kendi aralarında da eşit çıkması, bu kümede asıl ayrımın klinik muhakeme kalitesinden çok reddetme davranışının kendisi olabileceğini akla getiriyor.[1]
Puanın henüz söyleyemediği
Yazarların kendi sınırlamalar listesi kısa değil: puanlar eşleştirilmiş bir çıkarım hesaplama gücünde değil, her modelin dağıtımdaki varsayılan ayarında ölçüldü; yargıç güvenilirliği kanıtı tek bir uzmanlıktaki üç yargıca dayanıyor ve yazarların deyimiyle “gösterge niteliğinde” sayılmalı; değerlendiriciler İngilizce konuşuyordu ve 123 İngilizce dışı konuşmayı referans olarak makine çevirisiyle okudu; ön tarama katmanı kendi sistem istemi taşıyan bir düzenek içinde çalıştığı için yazarlar bunu yalnızca bir ön filtre sayıyor. Çalışma ayrıca hakem incelemesinden geçmiş bir makale değil, bir ön baskı.[1]
Bu sınırlarla birlikte okunduğunda, HealthBench-Psych'in şu an gösterdiği şey şudur: bu beş modelin çıktıları, bu kurallar altında, başka modeller tarafından değerlendirildiğinde birbirine benziyor. Bu, bir ruh sağlığı konuşmasındaki gerçek bir kişi için hangisinin daha güvenli ya da daha yararlı olduğu anlamına gelmez. Sıradaki gerçek kanıt eşiği, yazarların kendi kurdukları düzenekten bağımsız, klinisyenlerin doğrudan puanladığı, eşleştirilmiş hesaplama gücüyle çalışan ve İngilizce dışı konuşmacıları da içeren bir yineleme olur; bu tür bir doğrulama gelmeden bu eşitliği ya da sıralamayı bir konuşlandırma kararına dayanak yapmak erken olur.[1]