İki ana değişkenin gerçekte ne olduğu

Bu çalışmanın iki ana değişkeni de doğrudan gözlem değil, kestirim. Dil modeli katılımı, Liang ve arkadaşlarının dağılım yöntemiyle sözcük sıklıklarından çıkarılıyor: insan yazısının dağılımı, modellerin yaygınlaşmasından önceki 2021 başlangıçlı 6.000 NSF hibe özetinden kuruluyor; dil modeli dağılımı ise aynı özetlerin GPT-3.5-turbo-0125 modeline yeniden yazdırılmasıyla üretiliyor. Ayırt edicilik de bir metin ölçüsü: bir başvuru özetinin SPECTER2 gömmesinin, aynı kurumun bir önceki yıl fonladığı bütün özetlere olan ortalama kosinüs uzaklığı, yıl içi yüzdelik sıraya çevriliyor. Yani ölçülen şey, modelin bir başvuruda ne kadar kullanıldığı ile fikrin ne kadar özgün olduğu sorularının metne bıraktığı izler.[1]

Sayılar bu ölçüler üzerinde okunuyor. Kestirilen kullanımın alt çeyreğinden üst çeyreğine geçmek, NSF hibelerinde ayırt edicilik yüzdeliğini 5 puan, NIH hibelerinde 4 puan düşürüyor. NIH başvurularında aynı geçiş fonlanma olasılığını 4 puan yükseltiyor, NSF başvurularında anlamlı bir fark yaratmıyor. Fonlanan NIH hibelerinde yüzde 5 daha fazla yayın çıkıyor, ama sayım en çok anılan yüzde 5'lik dilimle sınırlandığında ilişki zayıflıyor ve anlamlılığını yitiriyor. Kestirimler 2023-2024 başlangıçlı hibelere dayanıyor ve hibe sonrası yalnızca bir ila iki yılı görüyor; bu, en çok anılan yayınların birikmesi için kısa bir pencere.[1]

Araştırmacı sabit etkilerinin sağladığı şey

Tasarımın asıl kazancı burada. Bağlanımlar hibe başlangıç yılı, alan ve araştırmacı sabit etkileri taşıyor; yani her araştırmacı, kendi başvuruları arasında karşılaştırılıyor. Bu, yeteneğin, yazma alışkanlığının ve konu seçiminin zamanla değişmeyen kısmını devreden çıkarıyor. Yazarlar ayrıca bir biçem denetimi koyuyor: ayırt edicilik hattını, 2021 temel özetlerinin bilimsel içeriği sabit tutulup yüzey dili değiştirilmiş sürümlerine uyguluyorlar ve özgün ile yeniden yazılmış özetlerin ortalama ayırt ediciliği neredeyse aynı çıkıyor. Bu denetim olmasaydı, düşen ayırt edicilik, modellerin yalnızca cümleleri birbirine benzetmesiyle de açıklanabilirdi.[1]

Geriye kalan boşluğu yazarların kendisi adlandırıyor. Sabit etkiler, araştırmacıların dil modellerini ne zaman ve hangi başvuruda kullandıklarına ilişkin zamanla değişen seçimleri gideremiyor. Bir araştırmacı, zaten adım adım ilerleyen, uygulanabilir ya da kurum önceliklerine yakın duran bir başvuruda modele daha çok yaslanıyor olabilir; o zaman düşük ayırt edicilik, modelin ürettiği bir kayma yerine seçilen proje türünün göstergesi olur. Aynı yönde işleyen bir başka sınır da veride: gizli başvurular yalnızca iki büyük ABD R1 üniversitesinden geliyor. Yazarlar bu yüzden bulguları araştırmacı içi koşullu bağıntı diye adlandırıyor ve nedensel kestirim demiyor.[1]

Yazarların bu çekingenliği, bir hafta önce burada başka bir metin için sorduğum şeye verilmiş bir cevap sayılır. Bilimsel makalenin biçimi üzerine yazılmış bir savı, sonuç ölçüsü ve karşılaştırma grubu olmadığı gerekçesiyle gözlem düzeyinde bırakmıştım. Bu çalışmanın sonuç ölçüsü de karşılaştırması da var, gene de nedensellik savına geçmiyor. İkisi arasındaki fark, meta-bilimde ayrımın konunun ilginçliğinden çok savı taşıyan tasarımda kurulduğunu gösteriyor.[1], [2]

Bunu bağıntının ötesine ne taşır?

Bir vekil ölçüyle çalışırken sorulacak ilk soru, ölçünün kendi keyfi seçimlerinin sonucu sürükleyip sürüklemediğidir ve bu makale o soruyu ciddiye almış. Başarı için lojistik, yayın sayıları için negatif binom bağlanımlar aynı ilişkileri veriyor; kosinüs yerine L2 uzaklığı, yüzdelik normalleştirmesi olmayan ham uzaklıklar, alan ve alt kurum düzeyinde yinelemeler tutarlı çıkıyor. Saptama ve çözümleme hattının tamamı Claude, Gemini ve Llama başvuru modelleriyle yeniden çalıştırılmış; sözcük ayırma, durak sözcük işleme ve noktalama seçimlerine duyarlılık ayrıca sınanmış. Ana çizimleri yeniden üretmeye yetecek kimliksizleştirilmiş veri de açık erişimde. Bir vekil ölçü için istenecek denetim dizisi aşağı yukarı budur.[1]

Bundan sonrasını taşıyacak şey, tarihi belli bir dış değişiklik. Makalenin kendisi bir tanesini kaydediyor: Temmuz 2025'te NIH, esas olarak yapay zekâ ile geliştirilmiş başvuruların başvuranın özgün çalışması sayılmayacağını duyurdu; NSF ise araştırmacı sorumluluğunu vurgulayıp kullanımın bildirilmesini özendirdi. Bu, aynı saptayıcının aynı tasarımla sonraki başvuru kuşaklarına uygulanmasıyla ölçülebilir bir kırılma. Yayın tarafında da açık bir sınama var: NIH'de en çok anılan işlerdeki farkın yokluğu, gecikmenin mi yoksa bileşimin mi sonucu olduğunu ancak daha uzun bir pencere ayırt eder.[1]