Ölçülen ne

Microsoft Research'ün yayımladığı Echoverse, çok sayıda yüzeysel görev yerine durum tutan ve zamanla değişen az sayıda derin ortam üzerine kurulu: on alan dünyası ve iki yetenek dünyası. Dört tam ortamın kodu, veri kümeleri ve puanlanmış görev doğrulayıcıları GitHub ile Hugging Face üzerinde paylaşıldı. Yayımlanan ölçümlerde Qwen3.5-9B ortamların tamamında yüzde 36,5'ten yüzde 67,1'e çıkıyor; aynı karşılaştırmada başvuru modeli GPT-5.4 yüzde 80,7'de duruyor. Görevleri puanlayan doğrulayıcı GPT-4.1.[1]

Bu iki ölçüm aynı soruyu yanıtlamıyor. Eğitim ortamlarının içindeki artış, modelin eğitildiği dağılıma ne kadar iyi oturduğunu gösterir. Ortamların dışındaki artış ise yöntemin genel bir yetenek öğretip öğretmediğine dair olan sorunun karşılığıdır. Bir eğitim sisteminin değeri ikinci ölçümde belirlenir; birincisi tasarımın çalıştığını, ikincisi işe yaradığını söyler.[1]

Dışarıdaki üç sayı

Eğitimde görülmeyen ortamlarda pekiştirmeli öğrenme başarımı yüzde 58'den yüzde 69'a taşıdı: 11 puan. Tamamen dışarıdaki iki ölçütte tablo daralıyor; WebVoyager'da yüzde 66,5'ten yüzde 71,5'e, Online-Mind2Web'de yüzde 40,5'ten yüzde 43,4'e çıkıyor.[1]

Eğitimde görülmeyen ortamlarda 11 puanlık kazanç, tanıdık ölçütlerde 5 ve 2,9 puanlık kazanç: bu desen, sistemin ortam ailesi içinde taşınan etkileşim alışkanlıkları öğrettiğine uyuyor; genel bir bilgisayar kullanma yetkinliğinden çok, aynı kurgudan türeyen görevlerde işleyen bir alışkanlık. Buna karşı ileri sürülebilecek açıklama, iki dışarıdaki ölçütün farklı görev tanımları taşıması ve üst aralıklarında doyuma yaklaşmasıdır; bu durumda küçük artış yöntemin sınırını değil ölçütün sınırını gösterir.[1]

Yinelemeyi mümkün kılan şey

Bu ayrımı çözecek deney, yayımlanan malzemenin içinde duruyor. Puanlanmış doğrulayıcılar ve veri kümeleri paylaşıldığına göre, aynı çıktılar farklı bir aileden gelen bir doğrulayıcıyla yeniden puanlanabilir. GPT-4.1'in kendi ailesinden gelen davranışları kayırıp kayırmadığı böyle sınanır ve yüzde 67,1'in ne kadarının yöntemden, ne kadarının puanlayıcıdan geldiği ayrışır. Yayımlanan teknik rapor bir konferans hakemliğinden geçmiş bir çalışma değil; sonuçlar şirketin kendi ölçümü olarak okunmalı.[1]