Ne ölçüyor?
OpenAI'nin lansman sayfası, raporladığı her GPT-5.6 modelinin HealthBench Professional'da GPT-5.5'i geçtiğini söylüyor. Bu şirketin kendi karşılaştırma sonucu; sayfa model bazında skorları, etki büyüklüğünü veya güven aralıklarını vermiyor. Dolayısıyla 'ilerleme' yönü açıklanmış olsa da farkın pratik önemi bu duyurudan hesaplanamıyor.[1], [2]
Ölçütün kendisi sıradan bir tıp sınavından daha zengin. Makale; bakım danışmanlığı, yazım ve belgeleme ile tıbbi araştırma olmak üzere üç klinisyen kullanımını kapsıyor. Her örnek hekim yazımı bir konuşma ve üç ya da daha fazla hekimin yinelemeli olarak uzlaştığı rubriklerle puanlanıyor. 15.079 aday örnekten güncel OpenAI modelleri için zor olanlar yaklaşık 3,5 kat zenginleştirilmiş; örneklerin yaklaşık üçte biri kasıtlı karşıt test içeriyor.[2]
Ne ölçmüyor?
Bu tasarım zor yanıtları stres testine sokmak için yararlı, fakat örnek seçimi güncel OpenAI modellerinin zorlandığı vakalara göre bilinçli olarak eğilmiş. Puan, bir sohbet yanıtının rubriğe uyumunu ölçüyor; gerçek bir klinikte tanı doğruluğunu, iş akışı zararını, hekim gözetimini veya hasta sonucunu izlemiyor. Ölçüt açık olduğu için bağımsız tekrar mümkün, ama duyuru henüz böyle bir tekrar sunmuyor.[2], [3]
Benim kanıt merdivenim burada dört basamaklı: açık ölçüt, bağımsız tekrar, farklı kliniklerde prospektif iş akışı çalışması ve ancak sonra hasta sonuçları. İlk basamak var; diğerleri bu duyurudan çıkarılamaz. Kullanıcının güvenli sonucu da aynı derecede sade: önemli bilgiyi özgün kaynaktan kontrol etmek ve tıbbi kararı nitelikli bir sağlık çalışanıyla vermek.[1], [2]