Üretmek ve seçmek

Bir araştırma eylemcisi bir gün boyunca pek çok çözüm üretince, hangisinin kullanılacağı da deneyin parçası haline geliyor. Malena ön yayınında bu ayrım açık: eylemcinin doğrulama puanına göre seçtiği çözüm ile araştırmacının gizli test sonucunu gördükten sonra seçebildiği en iyi çözüm ayrı ölçülüyor. İkinci ölçü aramanın bulabildiği en iyi adayı gösteriyor. Birinci ölçü, o adayın elindeki bilgilerle seçilebilip seçilemediğini de sınamış oluyor.[1]

Bu yüzden en yüksek sonradan görülen puan, kullanılabilir araştırma başarımını tek başına temsil etmiyor. Daha geniş arama iyi bir aday üretebilir; doğrulama ölçüsü onu seçemiyorsa kazanım son çözüme taşınmayabilir. Malena’nın karşılaştırma düzeni, üretme ile seçme işlemlerini aynı başlık altında eritmeden inceleme olanağı veriyor. Bilimsel araştırma görevinde işe yarayan ölçüm, yalnızca olası çözümlerin tavanını göstermekle kalmayıp seçim kararının hangi bilgiyle verildiğini de açıklamalı.[1]

Araştırmacılar 30 MLE-bench ve 40 NatureBench görevinde bu soruyu karşılaştırılabilir koşullara yerleştiriyor. Ana deneylerde temel model, donanım ve 24 saatlik süre sınırı sabit tutuluyor. Malena dosyaları okuyabilen, kod yazabilen ve komut çalıştırabilen tek bir oturum kullanıyor; diğer düzenler ek arama ve yönetim bileşenleri içeriyor. Bu karşılaştırma, araştırma ortamında araç kullanabilmenin katkısını daha karmaşık yönetim katmanlarının katkısıyla karıştırmamayı sağlıyor.[1]

Karşılaştırmanın sınırı

Güçlü modellerde ek katmanlar için anlamlı üstünlük saptanmaması, bütün düzenlerin eşdeğerliğini kanıtlamaz. Yazarlar yüzde 95 güven aralıkları veriyor; bazı karşılaştırmalarda aralıkların genişliği, farkın yönü ve büyüklüğü hakkında belirsiz sonuçlar bırakıyor. Daha küçük Gemma 4 modelinde MLEvolve’un ortalama tahmininin yüksek olması da model seçiminin karşılaştırmayı değiştirebildiğini gösteriyor. Bulguyu okurken yalnızca sıra tablosuna bakmak, bu belirsizliği görünmez kılar.[1]

Ek yönetim katmanlarının yararı temel model güçlendikçe azalıyor olabilir. Fakat dış sistemlere harcanan ayarlama çabasının farklılığı da sonuçları açıklayabilir; çalışma bu olasılığı sınırlılıkları arasında sayıyor. Herkese açık yarışmaların eğitim verisine karışması ayrı bir sorun. Araştırmacılar dört görevde eksik sınama girdilerini veya yanıt sızıntılarını düzeltmiş olsa da bu müdahale, modelin geçmiş eğitiminde ilgili görevlerle karşılaşmadığını göstermiyor.[1]

Malena’nın burada açtığı yöntem sorusu, daha çok bileşenin kaç puan getirdiğinden önce seçilen sonucun neyi temsil ettiği. Sabit bütçe, saklı sınama, seçim ölçüsü ve belirsizlik birlikte bildirildiğinde araştırma eylemcisinin hangi koşulda işe yaradığı daha açık değerlendirilebilir. NatureBench ek bir görev kümesi sunuyor; yine de bu iki kümedeki başarı, bütün bilimsel araştırmalarda doğrulanmış yarar anlamına gelmiyor. Ölçünün kapsamını belirtmek, sonucun değerini koruyan bir sınır.[1]