Kurgu

Abraham Camelo-Guerrero ve Jairo Diaz-Rodriguez, OpenAI GPT-5.4, Google Gemini 3.1 Pro Preview ve Anthropic Claude Opus 4.6 tarafından yazılan değerlendirmeleri, konu bakımından eşleştirilmiş 300 ICLR 2026 bildirisi için insan hakemlerin verdiği notlarla karşılaştırdı; bildiriler sözlü, poster ve reddedilen olarak eşit dağıtıldı. Her model aynı bildirileri, karar bilgisi çıkarılmış standart yönergelerle değerlendirdi.[1]

Bildirileri, yönergeyi ve gizlenen kararı üç sağlayıcı için sabit tutmak, karşılaştırmayı okunabilir kılan şey. Aynı zamanda sınırını da çizen şey: örneklem tek bir konferans, tek bir yıl ve tek bir bildiri kitlesi; dolayısıyla çalışmanın destekleyebildiği ifade, genel olarak hakemlik hakkında değil bu üç modelin ICLR 2026 üzerindeki davranışı hakkında.[1]

Uyum nerede bitiyor

Üç model de kabul edilen bildirileri reddedilenlerden ayırdı. Hiçbiri insan notlarındaki sözlü ile poster ayrımını yeniden üretemedi. Bu iki cümle farklı işleri anlatıyor: ilki, geniş bir nitelik işaretinin aşabileceği kaba bir eşik; ikincisi kabul edilenler kümesi içinde sıralama gerektiriyor ve orada farklar daha küçük, insan kararı da kısmen bildirinin yanı sıra program bileşimiyle ilgili.[1]

Puanlama sağlayıcıya göre değişti. Gemini istikrarlı biçimde daha yüksek not verdi; OpenAI ve Anthropic modelleri reddedilen ve poster bildirilerde insan değerlendirmesine daha yakın kalırken sözlü bildirilere fazla sert davrandı. Bu türden bir sağlayıcı düzeyi kayması ayarlamayla soğurulabilir. Özellikle en güçlü bildirilerde yanılmak ise ayarlamadan sonra da kalır, çünkü ince ayrım tam da dağılımın tepesindeki bildirilere ilişkindir.[1]

Değerlendirmeler neye bakıyordu

İçerik farkı puanlardan daha bilgilendirici. Modeller eksik karşılaştırma taban çizgilerini insanlardan daha sık işaretledi, insanlar ise hesaplama verimliliğine ilişkin kaygıları daha sık dile getirdi. Yani iki değerlendirme süreci bir sonuçta anlaşırken bildirinin zayıflığının ne olduğu konusunda ayrışabilir ve kararlar üzerinden hesaplanan bir uyum ölçüsü bunu göstermez.[1]

Yazarlar da bunu söylüyor: karar düzeyindeki geniş uyum, daha ince insan yargılarıyla ya da değerlendirme öncelikleriyle uyuşma anlamına gelmiyor. Kurgunun desteklediği sonuç bu ve yukarı çekilmemeli. Çalışma bir ön baskı ve hakem incelemesinden geçmedi; hakemliği inceleyen bir metin için bunu iki kez söylemek yerinde. Sonucu genişletecek ölçüm, sözlü ile poster sınırının başka bir yere çizildiği, kabul oranı farklı ikinci bir konferans olurdu.[1]