İki duyuru, iki ayrı ölçüm kurgusu
Microsoft'un duyurusunda tek bir sayı öne çıkıyor: güvenlik açığı arayan MDASH düzeneği, yeni MAI-Cyber-1-Flash modeliyle birlikte CyberGym başarımında %96'ya ulaşıyor, bu Anthropic'in Mythos'unun 12 puan üzerinde ve gider mevcut yapılandırmaya göre yaklaşık yarıya iniyor. Microsoft AI'ın ayrı yazısı ölçülen yapılandırmayı açıyor: MDASH, MAI-Cyber-1-Flash ve GPT-5.4 birlikte çalışıyor; karşılaştırıldığı mevcut yapılandırma ise GPT-5.4, GPT-5.4 mini ve GPT-5.3 codex'ten oluşuyor. Ajan sistemi Project Perception 3 Ağustos'ta herkese açık ön sürüme giriyor. Sayıların tamamı şirketin kendi ölçümü.[1]
NVIDIA aynı gün NOOA'yı yayımladı: bir ajanı tek bir Python sınıfı olarak kuran açık kaynaklı bir araştırma düzeneği, kodu GitHub'da, teknik raporu arXiv'de. Bildirilen sonuçlar aynı düzeneğin farklı modellerle çalıştırılmasına dayanıyor: SWE-bench Verified'da GPT-5.5 ile %82,2, Opus 4.6 ile %79,8; CyberGym L1'de GPT-5.5 ile %86,8; ARC-AGI-3'te GPT-5.5 ile %50,2, GPT-5.6-sol ile %85,1. NVIDIA da karşılaştırdığı düzeneklere göre yaklaşık yarı belirteç gideriyle eş veya daha iyi sonuç aldığını bildiriyor ve bu sayılar da şirketin kendi ölçümü.[2]
Karşılaştırma neyi sabit tutuyor?
Microsoft'un iki yapılandırması da model karışımı. Eski karışımda üç OpenAI modeli, yenisinde bir Microsoft modeli ile GPT-5.4 var. Yani ölçülen şey, düzeneğin kendisinin ne kattığı değil, düzeneğin içindeki modellerin değiştirilmesinden sonra çıkan sonuç. Düzeneğin katkısını görmek için düzeneği sabit tutup modelleri değiştirmek ya da modelleri sabit tutup düzeneği değiştirmek gerekir; duyuruda ikisi birden değişiyor. Bunun tersini düşünmek de mümkün: Microsoft bu ayrıştırmayı iç değerlendirmelerinde yapmış ve bir ürün duyurusuna sığmadığı için yazmamış olabilir.[1]
NOOA'nın sayı kümesi tam da bu ayrımı yapıyor ve sonuç düşündürücü. ARC-AGI-3'te düzenek aynı kalırken model değişiyor ve sonuç %50,2'den %85,1'e çıkıyor. SWE-bench Verified'da ise iki model arasındaki fark 2,4 puan. Aynı düzenek, bir görev kümesinde model seçimini neredeyse önemsizleştirirken diğerinde sonucun büyük kısmını modele bırakıyor. Bir geliştirici için okunacak şey ortalama değil bu dağılım: düzenek hangi işte modeli değiştirilebilir kılıyor, hangi işte kılmıyor?[2]
Geliştiricinin elinde ne kalıyor?
25 Temmuz'daki yazımda Opus 5 için, kararın model seçiminden istek başına çaba ayarına kaydığını savunmuştum. Bu iki duyuru kararı bir kez daha taşıyor: artık seçilen şey düzenek. Ama iki düzeneğin geliştiriciye bıraktığı hareket alanı aynı değil. NOOA'nın kodu indirilebiliyor ve modelinin değiştirilebildiği yayımlanmış sayılarla gösteriliyor; Project Perception'ın ön sürümü 3 Ağustos'ta açılıyor ve MDASH'in tek bir sağlayıcı dışındaki modellerle nasıl çalıştığına dair bir sayı henüz yok. Bunun tek açıklaması kapalılık olmayabilir: bir güvenlik ürününde model seçimini sabitlemek, desteklenen davranışı öngörülebilir kılmak için verilmiş bir mühendislik kararı da olabilir.[1], [2], [3]
Sınanabilir hale gelmesi için tek bir şey yeterli. Microsoft, 31 Ekim 2026'ya kadar MDASH'i aynı CyberGym kurgusunda Microsoft dışı bir modelle ölçüp yayımlarsa, %96 ile yarı gider bir yapılandırma iddiası olmaktan çıkıp düzenek iddiası haline gelir. Yayımlamazsa sayı yanlış olmaz; yalnızca hangi katmanın kazandırdığını söylemeyen bir sayı olarak kalır.[1]