Ne dağıtılıyor, ne ölçülüyor?

Program, daha yüksek kullanım sınırları ve daha geniş bağlam pencereleriyle ChatGPT'yi, GPT-5.6 Sol ile uzun süren işler için ayarlanmış GPT-5.6 Sol Pro'yu, yüzlerce siteden ya da yalnızca bilimsel dergilerden bilgi toplayabilen genişletilmiş derin araştırma özelliğini, Codex'i ve ChatGPT Work'ü ücretsiz veriyor. Erişim sınırlı sayıda üniversitedeki 10.000 araştırmacıyla başlıyor, kalan 90.000 kişi zaman içinde ekleniyor ve davet edilen her bilim insanı aynı kurumdan dört meslektaşını ücretsiz ekleyebiliyor. Program, bilimsel projelere yönelik 250 milyon dolar büyüklüğündeki bir girişimin parçası olarak tanımlanıyor.[1]

Duyuruda adlandırılmış bir sonuç ölçütü yok: yayın sayısı, yeniden üretilebilirlik oranı, bir sonuca varma süresi ya da taslak çözümlemelerdeki hata sıklığı sayılmıyor. Tanımlı bir sonuç ve karşılaştırma grubu olmadığı için programın bildirebileceği şey benimsenme düzeyi; bilimsel keşfin hızlanıp hızlanmadığı bu tasarımdan çıkmıyor.[1]

Seçilim, ölçümü baştan sakatlıyor

Davet zinciri, katılımcıları mevcut iş birliği ağları üzerinden topluyor: sınırlı sayıda üniversitede başlıyor ve her davetli dört meslektaşını ekliyor. Böylece katılan topluluk, hedeflenen 100.000 araştırmacıdan sistemli biçimde farklılaşıyor. Sonradan kullananlarla kullanmayanlar karşılaştırılırsa, aracın etkisi ile aracı erken benimseyen laboratuvarın özellikleri birbirine karışıyor. Karşı olasılık: OpenAI duyuruda anlatılmayan, kendi tasarımıyla ayrı bir değerlendirme yürütüyor olabilir.[1]

Bu tasarım sorunu çözülebilir bir sorun. Tek bir bilimsel iş için önceden ilan edilmiş bir karşılaştırma, tanımlı bir sonuç ölçütü ve bir karşılaştırma grubu 30 Nisan 2027'ye kadar yayımlanırsa hızlanma iddiası sınanabilir hale gelir. Ölçüt de gösterişli olmak zorunda değil: sorudan denetlenebilir bir çözümlemeye geçen süre ve o çözümlemedeki hata sıklığı yeterli olur.[1]

AlphaFold'un gösterdiği fark

Yapay zekâyı bilimde inandırıcı kılan sonuç, yöntemi yayımlanmış ve başkalarınca bağımsız biçimde kullanılmış tek bir çalışmadan geldi. AlphaFold'u üreten ekip artık dağıtıldı: Google DeepMind projeyi kapatmadan ona ayrılmış ekibi çözdü, yazarların çoğu Gemini model çalışmalarına, enzim tasarımına, füzyona ve genom araştırmalarına aktarıldı, üç yazar Anthropic'e geçti ve tam zamanlı yazarların yaklaşık yüzde 25'i şirketten ayrıldı. Doğrulanabilir bir bilimsel sonucu üreten şey belirtilmiş bir yöntemdi; erişimin geniş dağıtılması henüz aynı türden bir kanıt üretmedi.[1], [2]