Yönlendirmeyi küçük model yapıyor

Londra'daki Inherent, yeni yayımladığı Faraday adlı eylemcinin, yanıtlar önceden verilmeden yayımlanmış bilimsel makalelerin bulgularını Claude Opus 4.8 ve GPT-5.5'ten daha sadık biçimde yeniden ürettiğini söylüyor. Faraday, 27 milyar parametreli Qwen 3.6 üzerinde çalışıyor; bu da onu karşılaştırıldığı iki sistemin yanında küçük bırakıyor. Sonucun nasıl üretildiğini asıl belirleyen ayrıntı, kod yazması gerektiğinde neye uzandığı: Inherent kendi kodlama aracını kurmak yerine, bir araştırmacının hazır yazılıma dayanması gibi, Faraday'e OpenAI'nin GPT-5.5 Codex'ini çağırttı.[1]

Yani Faraday'in karşılaştırıldığı iki sistemden biri, işi yaptırdığı sistemin ta kendisi. Karşılaştırma ayakta kalırsa kazanç, hangi denemenin yapılacağına ve sonucun nasıl sınanacağına karar veren katmanda demektir; kodu yazan model de yeri değiştirilebilir bir parçaya döner. Ben böyle okuyorum, ama makul karşı okuma hemen yanı başında: Inherent, Faraday'i yineleme görevlerinde sonucu ödüllendiren pekiştirmeli öğrenmeyle eğitti, dolayısıyla üstünlük eşgüdümden çok görev dağılımına uyum sağlamaktan geliyor olabilir. Bu durumda bu görev kümesinde eğitilmiş bir yönetici, farklı görünen işlere hiçbir şey taşımaz.[1]

Nvidia'nın düzeneği aynı soruyu bir gün önce sormuştu

Faraday'den bir gün önce Nvidia, kendi eğitmediği bir modelin çevresine bellek, araçlar ve bir denetleyici bileşen saran Agentic Variation Operators adlı düzeneğe ilişkin araştırmasını yayımladı. İçinde Claude Opus 5 çalışırken kurulum ARC-AGI-3'te yüzde 100 aldı; modelin tek başına aldığı sonuç yüzde 30'du. Nvidia'nın yapay zekâ ürün biriminde başkan yardımcısı olan Adel El Hallak bir eylemciyi, modelin çevresindeki iskele ve onun kullandığı araçlar bütünü olarak tanımladı; açık düzeneklerin ekiplere doğruluğu yükseltmek için çok daha fazla düğme çevirme imkânı verdiğini söyledi.[2]

Yan yana konduğunda iki sonuç, hangi parçanın eğitildiği noktasında ayrışıyor. Nvidia'nın düzeneği, kiraladığı ağırlıkların çevresinde bir ekibin inceleyip ayarlayabildiği bir yapılandırma: bellek, araçlar, bir denetleyici. Inherent'in yöneticisi ise kendisi eğitilmiş bir model; büyük sistem onun altında bir araç olarak duruyor. Bu, aynı savın daha keskin bir hâli ve aynı sınırla geliyor: her iki örnekte de katmanı kuran taraf görev kümesini seçti ve puanlamayı kendisi yaptı. Nvidia haberinde hiç değilse dışarıdan bir sayı var; TechCrunch, OpenAI'nin iki düzenek ayarını değiştirerek kendi ARC-AGI-3 sonucunu üçe katladığını, ama Nvidia'nın skoruna ulaşamadığını aktarıyor. Faraday için benzer bir dış sayı aktarılmıyor.[1], [2]

Geliştiricinin asıl üstlendiği şey

Cloudflare'in kod denetimine baktığım sütunda, kazancın modelden önce geldiğini ve mühendislik bilgisinin sahibi belli kurallara dönüşmesiyle ortaya çıktığını savunmuştum. Faraday bu savı rahatsız edici bir yöne uzatıyor. Bir denetim hattındaki kural kümesi, onu yazan ekip için okunabilir ve düzenlenebilir kalır. Eğitilmiş bir yönetici ekibe bunların ikisini de vermiyor. Faraday'i benimseyen bir geliştirici altındaki kodlama aracını yine değiştirebilir; Inherent GPT-5.5 Codex'i seçti, başkasını da seçebilirdi. Ama neyin deneneceğine karar veren parça, geliştiricinin eğitmediği ağırlıkların içinde duruyor ve haber, bu ağırlıkların elde edilip incelenip incelenemeyeceğine dair bir şey söylemiyor.[3], [1]

Bu, bir hüküm yerine yapılmaya değer bir sınama veriyor. Üstünlük gerçekten yöneticideyse, Inherent'in görev kümesi ile GPT-5.5 Codex sabit tutulup Faraday yerine istemlerle yönlendirilen sıradan bir eşgüdüm katmanı konduğunda farkın büyük bölümü yeniden ortaya çıkmalı; üstünlük yineleme görevlerine uyumdan geliyorsa fark, Inherent'in derlemediği bir görev kümesinde daralmalı. Koşullu beklentim şu: bağımsız bir ekip 30 Kasım 2026'dan önce böyle bir koşu yayımlar ve fark, Inherent'in seçmediği görevlerde de ayakta kalırsa, eğitilmiş bir eşgüdüm katmanı savı şirketin kendi beyanı olmaktan çıkar. O koşu yayımlanana kadar elimizdeki şey, bir laboratuvarın kendi ürünü üzerinde yaptığı ölçüm.[1]