Bir atfın taşıdığı sınır

AstaBrief’in ağırlıkları ve eğitim verisi 2 Ekim’de yayımlandı. Ai2’nin modeli, araştırma sorusunu ve ilgili yayınlardan alınan parçaları kaynaklı bir rapora dönüştürüyor. Bu raporu kullanan araştırmacı için önemli bir soru var: cümledeki atıf, çalışmanın sınırlarını da taşıyor mu? Geliştirici ekibin açıklaması, belirli bir örneklemdeki bulgunun bütün nüfusa yayılmasını, geçmişte gözlenen sonucun genel geçer bir ifadeye dönüşmesini ve betimleyici bulgudan uygulama önerisi çıkarılmasını sorun olarak tanımlıyor. İlgili makaleye bağlantı vermek bu anlam kaymalarını görünür kılmaya yetmeyebilir. Benim bu modelde ilginç bulduğum araştırma sorusu, raporun kaynağındaki iddianın kapsamını ne ölçüde koruduğu.[1]

Ana değerlendirme, kullanıcıların yazdığı 200 bilgisayar bilimi sorusundan oluşan SQABench-CS2. Dört ölçü farklı işler yapıyor: gerekli içeriğin kapsanması, her paragrafın soruyla ilgisi, atfın bağlandığı iddiayı desteklemesi ve rapordaki iddiaların atıflarla desteklenmesi. Bunları ayrı ölçmek yerinde; konuya uygun ve kapsamlı bir raporda zayıf atıflar bulunabilir. Fakat bu tasarımın bilimsel sadakati yakalama gücü, destek ilişkisinin nasıl değerlendirildiğine bağlı. Örneklem sınırını koruyan cümleyle onu silen cümleye aynı puan veriliyorsa, ölçü bilimsel anlamdaki farkı kaçırır. Geliştiriciler de kapsam ve iddia gücünün korunmasını daha zengin bir değerlendirmeye dahil etme gereğini kabul ediyor.[1]

Eğitimde ödüllendirilen davranış

Qwen3-8B temelinden geliştirilen AstaBrief, gözetimli uyarlamanın ardından doğrudan tercih optimizasyonuyla eğitildi; bu ikinci aşama, tercih edilen rapor çiftlerinden öğreniyor. Gerçek kullanıcı soruları süzülünce 90.000 araştırma sorusu kalmış; raporların kalite elemesi 47.000 gözetimli eğitim örneği sağlamış. Tercih aşamasında ayrı bir soru grubundan yaklaşık 6.000 çift hazırlanmış. GPT-4.1 ve DeepSeek-R1’in aynı raporu seçtiği çiftler tutulmuş. Ai2’ye göre en güçlü süzme kazanımı, atıf yoğunluğu düşük raporları çıkarmaktan gelmiş. Böylece eğitim verisinde iddialara düzenli kaynak gösterme davranışı daha belirgin hâle geliyor; kaynak cümlesinin sınırlarını korumaksa ayrıca değerlendirilecek bir özellik olarak duruyor.[1]

Burada değerlendirme ile eğitim arasındaki ilişkiyi de hesaba katıyorum. AstaBrief, tercih eğitimi sırasında raporların ikili sıralaması için eniyilenmiş; karşılaştırıldığı DR Tulu aynı sıralama için eniyilenmemiş. Sıralamada iyi sonuç almak, tercih edilen yazım biçimini öğrenmenin etkisini de taşıyor olabilir. Başka bir açıklama, modelin kanıtı gerçekten daha iyi birleştirmesidir. İki açıklamayı ayırmak için benim önerim, geliştirici ekibin dışındaki değerlendiricilerin yalnızca akıcılık veya genel beğeniye bakmadan, kaynakla rapor arasındaki kapsam değişimlerini puanlaması. Eğitimde kullanılan tercih sinyalinin kapsamı korumayı ne kadar ödüllendirdiği ancak böyle daha açık sorulabilir.[1]

Bilimsel sadakati nasıl sınardım?

Ek insan değerlendirmesinin ölçeği de önemli: üç bilimsel araştırmacı toplam 14 soru sağlamış ve eşitliklere izin verilmiş. Genel tercihte DR Tulu öne çıkmış; araştırmacıların ikisi atıf doğruluğunda AstaBrief’i diğer sistemlere tercih etmiş. Bu sonuçlar farklı değerlendirme sorularına verilen yanıtlar. Bilim dalları arasında genelleme yapmak için küçük bir başlangıç örneği sunuyorlar. Ayrıca Ai2, eğitim ve değerlendirmelerin çoğunun 2025’te tamamlandığını, bütün deneylerin güncel öncü modellerle tekrarlanmadığını belirtiyor. Bugünkü açılma, o geliştirme deneylerini incelemeyi kolaylaştırıyor; karşılaştırmaların tarihi ve geliştirici ekip tarafından yapılmış olması, onlardan çıkarılan sonucun içinde kalmalı.[1]

Benim ekleyeceğim sınama, aynı kaynak parçaları üzerinde birbirine yakın rapor cümlelerini karşılaştırırdı: biri örneklemi, zamanı ve bulgunun betimleyici niteliğini korur; diğerinde bu sınırların biri genişler. Değerlendirici, her değişimin hangi sözcükle oluştuğunu gösterip hataları ayrı saymalı. Böylece kaynakla ilişkili bir cümleyi onaylamakla kaynağın söylediği kadarını aktarmak arasındaki fark ölçülebilir. Modelin daha kısa ve okunaklı yazarken gerekli sınırlamaları koruması da bu sınamaya dahil edilmeli. AstaBrief’in açılan eğitim verisi ve ağırlıkları böyle bir çalışmaya somut malzeme sağlıyor. Bilimsel rapor için aradığım nitelik, bulguyu yeniden anlatırken onun geçerli olduğu koşulları da cümlenin içinde tutmak.[1]