Etiketsiz iki boyut

Allen Institute for AI, bir başarımı soru soru okuyan çok boyutlu madde tepki kuramı yöntemi BenchMIRT'i yayımladı. Eğitim, 16 başarım ve 34.000 üzerinde soru üzerinden 100 dil modelinin sonuçlarıyla yapıldı. Bu başarımların altısı genel akıl yürütmeyi ölçüyor; aralarında MMLU-Pro, GPQA, MATH ve BBH var. Onu güvenlik ölçüyor; HarmBench, StrongReject, WildJailbreak, BBQ, WMDP ve XSTest bu kümede. Yöntem her model için seçilen başarımlardaki yetenek gücünü, her soru için de o sorunun zorluğunu ve bu yeteneklerde güçlü ile zayıf modelleri ne kadar ayırdığını kestiriyor. Teknik rapor, veri kümeleri ve kod, yöntemle birlikte yayımlandı.[1]

Yönteme, hangi başarımın hangi yeteneği ölçtüğü söylenmedi. BenchMIRT iki baskın boyutu kendiliğinden ayırdı: güvenlik ve genel akıl yürütme. Çözümleme baştan yinelendiğinde aynı iki boyut her seferinde ortaya çıktı, yazarlar böyle yazıyor. Eğitime giren modellerin tümü Mart 2025 tarihinde veya daha önce yayımlanmış. Yazarlar şunu da yazıyor: farklı bir değerlendirme karışımı başka yetenekler çıkarabilir. Bu iki sınır tasarıma ait: boyutlar bu 16 başarımlık kümeyi ve bu model kuşağını tarif ediyor.[1]

Ad ile maddelerin ayrıldığı yer

Birçok başarımdı yöntem, kastedilen odağı doğruladı: akıl yürütme başarımları akıl yürütmeyle, kaçış ve zararlı içerik başarımları güvenlikle hizalandı. Güvenlik diye etiketlenen üç durumda ad ile maddeler ayrılıyor. Toplumsal kalıp yargıları sınamak üzere kurulmuş BBQ, genel akıl yürütmeyle çok daha güçlü hizalandı. Biyoloji, kimya ve siber güvenlikte tehlikeli çift kullanımlı bilgiyi sınayan WMDP de güvenlikten çok genel akıl yürütmeyle bağlandı; daha güçlü genel akıl yürütme, daha düşük WMDP puanlarıyla birlikte göründü ve bu başarım o bilgiyi vermeyi reddetmeyi ya da verememeyi istenen yanıt sayıyor. HarmBench'in içinde standart ve bağlamsal zararlı-istem soruları güvenlikle, telif soruları ise genel akıl yürütmeyle daha yakın hizalandı.[1]

Bir başarımın sorularının yalnızca yüzde 10'u tutulduğunda yetenek sıralaması genellikle korunuyor; yüzde 50'si tutulduğunda sonuç tam başarıma çoğu kez daha yakın kalıyor. Ayrılmış sorularda yöntem, bir modelin her soruda başarım genelindeki kadar iyi olduğunu varsayan yüzde 70'lik temel değere karşı yüzde 79 doğrulukla başarımı önceden kestirdi. Yazarlar bir ödünleşmeyi de yazıyor: rastgele ayrılmış maddelerde modelleri öngörülen başarıma göre sıralamak amaçsa, başarımın ortalama puanı BenchMIRT'ten biraz daha iyi; yöntemin üstünlüğü tek tek soruların daha ince resmi. Soruların yüzde 10'unda ayakta kalan bir sıralama, o maddelerin taşıdığı karışımı sıralamayı sürdürüyor. BBQ bu haliyle akıl yürütmeyle hizalı bir küme olarak kalıyor; WMDP'nin çift kullanımlı bilgisi de onu reddetmek için kullanılan akıl yürütmeden ayrılmış olmuyor.[1]

Bilgi iddiasının içindeki ikinci ayrım

Google Research ve Technion'daki araştırmacılar 13 dil modelini WikiProfile üzerinde denedi; bu küme farklı biçimlerde sorulan 2.150 Wikipedia olgusundan oluşuyor ve deneme 4 milyon üzerinde yanıt topladı. GPT-5 ve Gemini-3 gibi sınır modeller denenen olguların yüzde 95–98'ini kodladı, kodladıklarının yüzde 26–34'ünü ise doğrudan söylemedi. Çıkarım sırasında modellere daha uzun düşünme payı verildiğinde, kaçırdıkları kodlanmış olguların yüzde 40–65'i geri geldi; olguların yalnızca yüzde 10–20'si bu ek düşünmeyi gerektiriyordu. Aralık eşit dağılmıyor: sınır modellerde seyrek olgular, yaygın olgulara göre yüzde 25'in üzerinde geride kaldı ve ters yönde sorulan sorular doğrudan biçimden daha zor çıktı. Ölçümler yazarların kendi ölçümleri; bir yineleme çalışması yayımlanmış değil.[2]

BenchMIRT ile WikiProfile aynı türden bir ayrımı, farklı bir adın altında gösteriyor. Güvenlik puanı da bilgi iddiası da tek bir yapı olarak geliyor; maddeler ya da soru biçimi en az iki şey taşıyor. BenchMIRT'in iki boyutu ile WikiProfile'in kodlanmış ama söylenmemiş olguları bu ortak kısıtı paylaşıyor. Alternatif, daha yalın bir okuma da açık: iki boyut, verilen altı akıl yürütme ve on güvenlik başarımı karışımını yansıtıyor olabilir. WikiProfile'deki açıklık da, modelin tuttuğu bir olgu deposundan çok biçim duyarlılığı olabilir; ters soruların daha zor çıkması buna uyuyor. Sonraki işe yarar ölçüm somut. BenchMIRT için boyutları, altı artı on karışımı olmayan bir kümede ve Mart 2025'ten sonra yayımlanan modellerde yeniden çıkarmak; WikiProfile için aynı 2.150 olguyu bağımsız bir çalıştırmada denemek, yüzde 26–34'lük söylenmemiş payın yazarların kendi ölçümünün dışında da görünüp görünmediğini gösterir.[1], [2]