Eigen RadarYapay Zekâ
Analiz

HydraFusion üç testte gideri düşürdü, niteliği yalnızca birinde artırdı

GitHub, Project HydraFusion'ı Copilot komut satırında araştırma önizlemesi olarak açtı. Yönlendirici, tek adımlık her kodlama işini tek model, kademeli geçiş ya da bağımsız eleştiri kalıplarından birine veriyor. GitHub'ın ölçümlerinde giderler üç başarım testinde yüzde 67, yüzde 36 ve yüzde 65 düştü; nitelik TerminalBench 2.1'de 4,9 puan arttı, DeepSWE ile CheckpointBench'te geriledi. Sonuçlar satıcı ölçümüne dayanıyor.

Yapay Zekâ··Gece
Parlak bir çalışma yüzeyinde ince parçacık akışı, merkezî çokgen açıklıktan siyah tekli hazneye, cam kademelere ve kehribar renkli karşılıklı hacimlere ayrılıyor.

Üç yürütme yolu

GitHub, Project HydraFusion'ı Copilot komut satırında deneysel bir bayrağın ardında araştırma önizlemesi olarak kullanıma açtı. Düzenek, her tek adımlık kodlama isteği için üç yoldan birini seçiyor. İlkinde tek model işi doğrudan çözüyor. Kademeli geçişte verimli bir model taslak çıkarıyor ve bir nitelik kapısı gerektiğinde işi daha güçlü modele aktarıyor. Eleştiri yolunda ise ayrı bir model taslağı bağımsız olarak inceliyor; ilk model bu incelemenin ardından bir kez düzeltme yapıyor. Böylece yönlendirme kararı sağlayıcılar arasındaki model seçimini ve işin nasıl denetleneceğini birlikte belirliyor.[2]

Tasarruf üç testte, nitelik artışı birinde

GitHub'ın Claude Opus 5 temel çizgisine göre verdiği sonuçlarda HydraFusion, TerminalBench 2.1'de gideri yüzde 67 düşürürken niteliği 4,9 puan artırdı. DeepSWE'de gider yüzde 36 azalırken nitelik 1,5 puan geriledi; CheckpointBench'te yüzde 65 gider düşüşüne 0,1 puanlık nitelik kaybı eşlik etti. VentureBeat'in karşılaştırması, gider düşüşünün üç testin tamamında görüldüğünü, nitelik üstünlüğünün ise yalnızca TerminalBench 2.1'de ortaya çıktığını vurguluyor. Bu sayılar GitHub'ın kendi ölçümleri; bağımsız bir sınama yayımlanmadı.[1], [2]

Araştırma önizlemesinin sınırları

HydraFusion şimdilik yalnızca tek adımlık isteklere yanıt veriyor; çok turlu bir kodlama oturumunu yönetmiyor. Copilot komut satırının deneysel kipinde açılan araç, kullandığı her modelin kendi belirteç fiyatı üzerinden ücretlendiriliyor. Bu nedenle yönlendiricinin bir görevde ucuz modeli seçmesi, bütün kullanımlar için sabit bir gider sözü anlamına gelmiyor. Paylaşılan sonuçlar üç başarım testi ve şirketin seçtiği Claude Opus 5 temel çizgisiyle sınırlı. Araştırma önizlemesi, üç yürütme yolunun geliştiricilere açıldığını gösteriyor; daha geniş iş yüklerindeki nitelik ve gider dengesi henüz bağımsız olarak ölçülmedi.[1], [2]

Kaynakça

  1. Haber kaynağıVentureBeatGitHub'ın HydraFusion'ı üç ölçütte de maliyeti düşürdü, kaliteyi yalnızca birinde geçti↩1↩2
  2. Haber kaynağıGitHubGitHub, Copilot komut satırına çok modelli yönlendirici Project HydraFusion'ı araştırma önizlemesi olarak açtı↩1↩2↩3