Akıl yürütme belirteçleri her görevde karşılık vermiyor; Copilot çabayı ayarlanabilir yaptı
29 Ağustos'ta arXiv'de yayımlanan bir ön baskı, akıl yürütme belirteçlerinin getirisini ölçen Token Economy Score ölçüsünü öneriyor; adım adım sorular bilgi hatırlama kümelerinden daha verimli çıktı. GitHub'ın ağustos güncellemesiyle Visual Studio'daki Copilot, modelin düşünme çabasını düşük, orta ve yüksek olarak seçmeye izin veriyor. Araştırma verimliliği sorgularken ürün tarafı kullanıcıya doğrudan çaba düğmesi sunuyor.
Yapay Zekâ··Öğle
Token Economy Score görev biçimini ölçüyor
Yazarlar, akıl yürüten bir modelin akıl yürütmeyen bir temele göre sağladığı doğruluk kazancını ürettiği fazladan belirteç sayısına bölen Token Economy Score ölçüsünü öneriyor. Matematik, kod üretimi ve bilimsel akıl yürütmeden oluşan yedi başarım kümesindeki 151 model-ölçüt değerlendirmesinde görevin biçimi, zorluğundan daha iyi bir verim yordayıcısı çıktı: AIME 2025 gibi adım adım ilerleyen sorular yüksek puan aldı, MMLU-Pro gibi bilgi hatırlama kümeleri daha düşük kaldı. Yazarlar ayrıca akıl yürütme çabası ayarı yükseldikçe düzenli bir azalan verim gördüklerini ve fazladan düşünmenin doğruluğu düşürdüğü durumları aktarıyor. Önerileri, akıl yürütmeyi her yerde açık bırakmak yerine görev türüne, çaba düzeyine ve kullanım bağlamına göre açmak. Ön baskı 29 Ağustos'ta arXiv'de yayımlandı ve 2026 TPCTC konferansına kabul edildi.[1]
Copilot düşünme çabasını üç kademeye ayırdı
GitHub'ın ağustos güncellemesiyle kuruluşlar, depolar arasında yayımladıkları özel Copilot eylemcilerini Visual Studio'ya otomatik olarak tanıtabiliyor. Geliştirici, modelin düşünme çabasını düşük, orta ve yüksek olarak seçip akıl yürütme derinliğiyle belirteç tüketimi arasında denge kurabiliyor. Güncelleme ayrıca kullanım ayrıntısını ve plan bilgisini bağlam penceresine taşıyor ve sınıra yaklaşıldığında uyarıyor. Model listesinde sık kullanılanlar sabitlenebiliyor, kullanılmayanlar katlanabiliyor; model yetenekleri, bağlam penceresi boyutu ve gider bilgisi aynı yerde görünüyor. Git eylemcisi, birleştirme isteği açılmadan önce işlenmemiş değişiklikleri gözden geçirip bulgularını düzenleyicide satır içinde gösteriyor. Özellikler Free, Student, Pro, Pro+, Max, Business ve Enterprise planlarının tamamında açık. Bildirilen bulgular yazarların kendi koşularına aittir ve çalışma hakem değerlendirmesinden geçmemiş bir ön baskı olarak sunuluyor.[2]
Ölçüm ile ürün aynı soruyu farklı katmanda yanıtlıyor
Ön baskı, fazladan akıl yürütme belirteçlerinin her başarım kümesinde aynı getiriyi vermediğini göstererek kurumsal dağıtımlarda çabanın göreve göre ayarlanması gerektiğini savunuyor. Copilot güncellemesi bu savı ürün düzeyine indiriyor: geliştirici düşük, orta veya yüksek çaba seçerek belirteç harcamasını doğrudan kontrol edebiliyor ve kullanım ayrıntısı bağlam penceresinde görünüyor. İki gelişme aynı ekonomik gerilimi taşıyor — daha derin akıl yürütmenin maliyeti — ancak biri 151 model-ölçüt değerlendirmesiyle akademik ölçütlerde, diğeri IDE içi bir düğmeyle. Okuyucu için somut haber, verimlilik ölçüsünün yayımlanması ile düşünme çabası ayarının aynı hafta geliştirici aracına eklenmesi. Bildirilen bulgular yazarların kendi koşularına aittir ve çalışma hakem değerlendirmesinden geçmemiş bir ön baskı olarak sunuluyor.[1], [2]