Altı model yönlendiricisi deneyde rastgele seçimi geçemedi
Altı ticari model yönlendiricisini sınayan araştırmacılar, iyi seçilmiş iki model arasında rastgele karar vermenin aynı giderle en az aynı başarıyı sağladığını bildirdi. İngilizce görevlerde yapılan deney, güçlü modele gönderilecek sorunun güçlüğü kadar yanıt uzunluğunun da seçimi etkilediğini buldu. Tek ön baskıya dayanan sonuç, yönlendiricilerin gerçek kullanıcı trafiğindeki bütün davranışlarına genellenmiyor.
Yapay Zekâ··Öğle
Rastgele seçim deneyde geri kalmadı
Bir sorunun hangi modele gönderileceğine karar veren altı ticari yönlendirici, yeni ön baskıdaki deneyde iyi seçilmiş iki model arasındaki rastgele seçimi aynı giderle geçemedi. Araştırmacılar OpenRouter, Microsoft Azure, vLLM, Not Diamond, Nadir ve Orca düzeneklerini 14 ayarda sınadı. Bazı ayarlarda rastgele tabanla aradaki yüzde puan farkı 10’u aştı.[1]
Kısa yanıtlar seçimin yönünü değiştiriyor
Gider ile doğruluğu bir arada değerlendiren hedef, orta güçlükteki soruları güçlü modele göndermeyi ödüllendirebiliyor. En zor sorularda hem ucuz hem pahalı model başarısız olabiliyor. Kısa bir doğru yanıt da daha az üretim gideriyle aynı başarı puanını kazandırabiliyor. Yazarlar güçlüğe duyarsızlık, kısa yanıtları güçlü modele gönderme, sorunun kaynağına göre seçim yapma ve uygun olmayan model havuzları olmak üzere dört örüntü belirledi.[1]
Deney sekiz görev türünü kapsıyor
Değerlendirme, 17 başarım testinden alınan sekiz görev türünü kapsıyor. Araştırmacılar 800 değerlendirme sorusu için 26 modelin yanıtlarını oluşturdu. Seçilen model önce kaydedildi; yanıtı ortak koşullarda ayrıca oluşturuldu. Sorular İngilizce ve her yanıt yalnızca bir kez üretildi. Yazarların geliştirdiği iki modelli örnek yönlendirici, rastgele seçime göre sınırlı kazanım sağladı. Çalışma, gerçek kullanıcı trafiğinde yinelenen yanıtları ölçmüyor.[1]