Tek uç nokta, arkasında bir havuz
Sakana AI, Fugu Max ve Fugu Ultra v2'yi hâlihazırda hizmet verdiği OpenAI uyumlu uç noktadan yayımladı ve çalışan bir kurulumun tek satırlık bir parametre değişikliğiyle taşındığını söylüyor. Asıl ilginç olan, o uç noktanın arkasında duran şey: NVIDIA Nemotron'un da içinde olduğu, değiştirilebilir bir açık ve özelleşmiş model havuzu; yönlendirici görevi bitirebilecek en hafif üyeyi seçiyor. Fugu Max'in fiyatı milyon giriş belirteci başına 2 dolar, milyon çıkış belirteci başına 6 dolar.[1]
Puanlar, okurun kendisinin ekleyeceği bir çekinceyle geliyor. Sakana AI, Fugu Max'in aralarında Terminal Bench 2.1 ve şirketin kendi iç ölçümü SWEFish'in bulunduğu altı başarımda en iyi genel puanı aldığını; Fugu Ultra v2'nin Chartography'de 48,3 puana ulaştığını, aynı ölçümde Opus 5'in 27,3, Fable 5'in 29,5 aldığını ve DeepSWE'de 74,3 puan çıktığını bildiriyor. Bu sayıların hepsini Sakana AI üretti, görev seçimini Sakana AI yaptı ve duyuru bağımsız bir yineleme sunmuyor.[1]
Aynı hamle, kod incelemesinin içinde
GitHub, aynı mimari tercihin daha dar bir sürümünü uyguladı. Copilot'ın Lite çaba düzeyi tek eylemci çalıştırmayı bıraktı; yerine bulguları tek bir incelemede birleştirilen bir eylemci topluluğu geldi. İnceleme eylemcisi artık Copilot SDK'sındaki kabuk araçlarının tamamına Copilot eylemci güvenlik duvarının arkasından erişiyor; değerlendirdiği kodda derleme yapabiliyor, sınama koşturabiliyor ve hedefli betikler yürütebiliyor. GitHub, topluluğun inceleme başına giderilen yorum sayısını yüksek önem dereceli bulgularda yüzde 47, ortada yüzde 31, düşükte yüzde 11 artırdığını ve inceleme giderini yaklaşık yüzde 8 düşürdüğünü bildiriyor.[2]
İkisini yan yana koyunca kazanç için gösterilen mekanizma aynı çıkıyor: tek modelin yerini eşgüdümlü bir model grubu alıyor ve kazancın hanesine bu grup yazılıyor. Kanıt da aynı ve sorun tam burada. Sakana AI karşılaştırmayı kendisi yürüttü, GitHub denemeyi kendisi yaptı; hiçbiri hangi üyenin hangi görevi üstlendiğini, öncesi ile sonrası arasında görev dağılımının nasıl sabit tutulduğunu ya da hataların neye benzediğini yayımlamıyor. Bu sayılardan birini okuyan geliştirici, işi eşgüdümün mü yoksa görev başına harcanan fazladan işlem gücünün mü yaptığını ayırt edemiyor.[1], [2]
Geliştiricinin sınayabileceği şey
Beş gün önce, Portal'ın çalışan kiplerinden yola çıkarak bir kodlama eylemcisinin faturasına dosya okuma ve yazmanın hükmettiğini, dolayısıyla bir ekibin gideri denetlediği yerin yönlendirme katmanı olduğunu savunmuştum. Fugu Max'in fiyat listesi bu görüşle uyumlu; aynı zamanda görüşün bedelini de gösteriyor: değiştirilebilir bir havuz yanlış yanıt verdiğinde, hatayı arayan ekibin önce hangi üyenin yanıtladığını bulması gerekiyor ve yönlendiricinin seçimi çağrıyı yapana görünmüyor.[1], [3]
Bunu çözecek bir sınama var. Bağımsız bir değerlendirici görev kümesini ve puanlama yöntemini sabit tutup Fugu Max için istek başına yönlendirme izlerini yayımlar ve Copilot Lite karşılaştırmasını sabit bir depo kümesi üzerinde 31 Aralık 2026'ya kadar yinelerse, kazancın eşgüdüme düşen payı havuzun bileşimine ve fazladan işlem gücüne düşen paydan ayrılabilir. Böyle bir karşılaştırma ortaya çıkana kadar iki duyurunun dürüst okuması şu: eşgüdümlü havuz, satıcı ölçümüyle desteklenen makul bir mekanizma.[1], [2]