HydraFusion üç testte gideri düşürdü, niteliği yalnızca birinde artırdı
GitHub, Project HydraFusion'ı Copilot komut satırında araştırma önizlemesi olarak açtı. Yönlendirici, tek adımlık her kodlama işini tek model, kademeli geçiş ya da bağımsız eleştiri kalıplarından birine veriyor. GitHub'ın ölçümlerinde giderler üç başarım testinde yüzde 67, yüzde 36 ve yüzde 65 düştü; nitelik TerminalBench 2.1'de 4,9 puan arttı, DeepSWE ile CheckpointBench'te geriledi. Sonuçlar satıcı ölçümüne dayanıyor.
Yapay Zekâ··Gece
Üç yürütme yolu
GitHub, Project HydraFusion'ı Copilot komut satırında deneysel bir bayrağın ardında araştırma önizlemesi olarak kullanıma açtı. Düzenek, her tek adımlık kodlama isteği için üç yoldan birini seçiyor. İlkinde tek model işi doğrudan çözüyor. Kademeli geçişte verimli bir model taslak çıkarıyor ve bir nitelik kapısı gerektiğinde işi daha güçlü modele aktarıyor. Eleştiri yolunda ise ayrı bir model taslağı bağımsız olarak inceliyor; ilk model bu incelemenin ardından bir kez düzeltme yapıyor. Böylece yönlendirme kararı sağlayıcılar arasındaki model seçimini ve işin nasıl denetleneceğini birlikte belirliyor.[2]
Tasarruf üç testte, nitelik artışı birinde
GitHub'ın Claude Opus 5 temel çizgisine göre verdiği sonuçlarda HydraFusion, TerminalBench 2.1'de gideri yüzde 67 düşürürken niteliği 4,9 puan artırdı. DeepSWE'de gider yüzde 36 azalırken nitelik 1,5 puan geriledi; CheckpointBench'te yüzde 65 gider düşüşüne 0,1 puanlık nitelik kaybı eşlik etti. VentureBeat'in karşılaştırması, gider düşüşünün üç testin tamamında görüldüğünü, nitelik üstünlüğünün ise yalnızca TerminalBench 2.1'de ortaya çıktığını vurguluyor. Bu sayılar GitHub'ın kendi ölçümleri; bağımsız bir sınama yayımlanmadı.[1], [2]
Araştırma önizlemesinin sınırları
HydraFusion şimdilik yalnızca tek adımlık isteklere yanıt veriyor; çok turlu bir kodlama oturumunu yönetmiyor. Copilot komut satırının deneysel kipinde açılan araç, kullandığı her modelin kendi belirteç fiyatı üzerinden ücretlendiriliyor. Bu nedenle yönlendiricinin bir görevde ucuz modeli seçmesi, bütün kullanımlar için sabit bir gider sözü anlamına gelmiyor. Paylaşılan sonuçlar üç başarım testi ve şirketin seçtiği Claude Opus 5 temel çizgisiyle sınırlı. Araştırma önizlemesi, üç yürütme yolunun geliştiricilere açıldığını gösteriyor; daha geniş iş yüklerindeki nitelik ve gider dengesi henüz bağımsız olarak ölçülmedi.[1], [2]