Copilot faturasının düştüğü yer
Denetimli çevrimdışı değerlendirmelerde TerminalBench 2.1 başarımında doğrulanmış görev kalitesi 4,9 puan arttı ve tahmini gider Claude Opus 5'e kıyasla yüzde 67 azaldı; CheckpointBench'te ortalama oturum puanı Claude Opus 5 referans temeliyle neredeyse başa baş çıkarken, gider yüzde 65 düştü. Bu sayıların arkasındaki özellik olan Project HydraFusion, çalışma anında görev karmaşıklığına göre birkaç model arasından seçim yapıyor ve üç kalıp işletiyor: düz işler için tek model, verimli bir modelin taslak ürettiği ve kalite eşiğinin daha güçlü modele geçirdiği basamaklı kalıp, bir de bağımsız bir eleştirmen modelin taslağı incelemesinin ardından yapılandırılmış düzeltmenin geldiği eleştiri kalıbı.[1]
Bence asıl soru, tasarrufu bu üç kalıptan hangisinin ürettiği; yayımlanan sayılar bunu yanıtlamıyor, çünkü kurulan dizgeyi tek bir temel modelle karşılaştırıyorlar ve sayıları GitHub kendi denetimli çevrimdışı değerlendirmelerinde üretti. Benim okumam, işin büyük bölümünü basamaklı kalıptaki kalite eşiğinin yaptığı yönünde; kolay işleri verimli modelde tutan bir eşik, üç kalıp arasında pahalı belirteç eklemek yerine onları eksilten tek düzenek. Bu bir çıkarım, ölçüm değil. Aynı fark, değerlendirme kümesinin görev bileşiminden de gelebilir: verimli modelin zaten çözdüğü düz işler, hiçbir yönlendirme kazancı olmadan da tahmini aşağı çeker.[1]
Iris yayını, çevre düzeneği sınanabilir kılıyor
Iris-mini ile Iris-pro'nun arkasındaki ekip her başarım kümesini bağlam yönetimi açık ve kapalı olarak sınıyor; araçlar, bağlam sınırları ve yargıç modeli sabit tutuluyor. Ekibe göre yalnızca yönetim açıkken bildirilen sonuçlarda modelden gelen pay ile çevresindeki düzenekten gelen pay temiz biçimde ayrılamıyor. Bu payın büyüklüğü küçümsenecek gibi değil: bağlam yönetimi Iris-mini'nin BrowseComp puanlarını 21,2 puana varan ölçüde yükseltiyor ve yönetim açıkken aynı model BrowseComp'ta 82,2 puana çıkıyor, Iris-pro ise 88,6 puana ulaşıyor. Puanlar ayrıca tek bir eylemciden geliyor; yardımcı eylemci ve sonda ek doğrulama adımı yok.[2]
Bu ayrıştırmayı başkasının da kullanabilmesini sağlayan şey, yayının ikinci yarısı. Model ağırlıkları Hugging Face'te bir derlemede, kod ise GitHub'da duruyor; paket, eylemci döngüsü, araçlar, bağlam yönetimi yöntemleri ve dört başarım kümesinin tamamını değerlendirmesiyle birlikte içeren Iris Harness düzeneğini de kapsıyor. Düzenek OpenAI uyumlu her uç noktayla çalıştığı için, sayıları üreten döngü okurun başka bir modele yöneltebileceği döngüyle aynı. Açık ağırlıklı eylemciler arasında seçim yapan bir ekip için asıl seçenek değeri burada: ağırlıklar tek başına modeli barındırmayı sağlar, düzenek ise karşılaştırmayı yeniden kurmayı sağlar.[2]
Geliştiricinin yeniden koşabileceği şey
İki yayın da kazancı modelin çevresindeki katmana taşıyor; ayrıldıkları nokta, okura bunu sınayacak neyi verdikleri. Çevre düzeneğin payını modelin payından ayıran ikili koşular Iris başarım kümelerinde yer alıyor; Copilot sayıları ise kurulan dizgeyi tek bir temele karşı anlatıyor. İki ekip de bir şey gizlemiyor, farklı sorulara yanıt veriyorlar. GitHub Copilot CLI içine araştırma önizlemesi koyan bir ürün ekibine sorulan şey, bütünün ucuzlayıp ucuzlamadığı; ağırlık yayımlayan bir gruba sorulan şeyse, puanı yığının hangi parçasının kazandığı.[1], [2]
Eşgüdümlü bir model havuzuna daha önce bakıldığında, değişikliği yayımlayan şirketin ölçümü de üretmiş olduğu görülmüştü; Copilot sayıları aynı şekli yineliyor. Bugün yeni olan şey, ikinci yayının sonuçla birlikte karşılaştırmayı yeniden kurma imkânını da devretmesi; bu da satıcı sayısı ile ekibin kendi sayısı arasındaki aralığı daraltıyor. Iris Harness düzeneğini dört başarım kümesinin tamamında, bağlam yönetimi açık ve kapalı olarak kendi OpenAI uyumlu uç noktasına karşı koşan bir ekip, çevre düzeneğin payını kendi ürettiği bir sayıya çevirmiş olur.[1], [2], [3]