Tek ağ, iki farklı zorluk
Booz Allen, dokuzu Amerikan dokuzu Çinli 18 modeli üretim ölçeğindeki tek bir kurumsal ağa karşı kendi başına saldıran taraf olarak çalıştırdı. Her modelin Cyber Weapon Index puanı iki parçayı topluyor: açık bulmayı ölçen araştırma puanı ve modelin baştan sona bir sızmada ne kadar ilerlediğini ölçen saldırı zinciri puanı; ikincisi hem çalınmış kimlik bilgileriyle hem de onlarsız ölçüldü. Claude Mythos 80, Grok-4.5 49, GPT-5.6 Sol 46 puanla bitirdi. Kurgu bu tür çalışmalara göre alışılmadık ölçüde okunaklı ve asıl önemli sayıyı okunur kılan da bu.[1]
İkinci ölçüm tabloyu değiştiriyor. Sınayanlar açıkları kendileri yerleştirdiğinde Amerikan, Çinli, açık ağırlıklı ve kapalı modellerin tümü araştırma bileşeninde tavana yakın puan aldı. Aynı modeller gerçek açıklarla karşılaştığında dokuz sınır API modelinin tümü sıfır aldı. Raporda adı verilmeyen önde gelen bir model, açık barındıran bileşeni doğru çözümledi ve ardından güvenli saydı; açığı yalnızca Claude Mythos sömürdü.[1]
Puan modelle mi ilgili, çevresindeki yazılımla mı?
Bir ayarda herkesin tavana yakın, başka bir ayarda herkesin sıfır aldığı bir bileşen, büyük ölçüde ayarı anlatır. Yerleştirilen açıklar aramanın ulaşabileceği yerlere konur; çalışan bir düzendeki açıklar öyle durmaz. Böyle okunduğunda araştırma puanı, bir modelin ne kadar iyi araştırdığından çok sınama ortamındaki açıkların ne kadar bulunabilir olduğunu izliyor. Elde tutmaya değer bir karşı okuma da var: gerçek açık bulmak, bu modellerin hiçbirinin henüz ulaşamadığı çok daha zor bir iş olabilir; o zaman bileşen yeteneği ölçüyor ve tavan puanlar yalnızca yerleştirilmiş ayarın kolay olduğunu söylüyor. Booz Allen de bu yöne eğiliyor ve gerçek dünyadaki saldırı yeteneğinin başarım ölçümlerinin gerisinde kaldığını yazıyor.[1]
Düzenek bulgusu aynı soruyu bir adım öteye taşıyor. Saldırı düzeneği, bir modeli saldırı araçlarına bağlayan ve planı bir arada tutan yazılımdır: çalışmayı hedefte tutar, başarısız adımdan sonra toparlar, tek tek eylemleri çok aşamalı bir saldırıya zincirler. Sıralamada Claude Sonnet 5, 18 modelin on beşincisi olarak 13 puanla yer alıyor. Rapora göre bir saldırı düzeneğiyle eşleştirilen Claude Sonnet, 80 puan alan Claude Mythos'un başarımına yaklaştı. Booz Allen, açık ağırlıklı ve Çinli modelleri eniyileştirilmiş düzeneklerle sınamadığını, sonuçlarının ise tam yetkinlikte model-düzenek birleşimlerinin bugün var olduğunu güçlü biçimde düşündürdüğünü ekliyor.[1]
Sayının taşıyabileceği
Yani puan bir ikiliye ait. Claude Sonnet'in çevresine yazılım sarmak onu en üstteki modelin düzeyine çıkarıyorsa, sıralamanın ölçtüğü şey model ile düzeneğin birlikteliğidir ve bir modelin adının yanına yazılan sayı bu ikilinin tek bir kurulumunu anlatır. Bu, listenin nasıl kullanılacağı açısından önemli. Hangi modelin bir düşmandan uzak tutulacağına karar vermek için sıralamayı okuyan bir savunmacı, modelin çevresindeki eşgüdüm yazılımının yeniden dizebileceği bir sütuna bakıyor.[1]
Raporun ileriye dönük iddiası, diğer 17 modelin çoğunun altı ay içinde Mythos'un silahlanma düzeyine ulaşacağı yönünde. Bu iddia, ancak ikinci ölçüm ilkinde değişen şeyi sabitlerse sınanabilir hale gelir. Aynı kurumsal ağda yinelenen, düzenek kurulumu açıkça yazılan, her model düzenekli ve düzeneksiz ayrı ayrı puanlanan, yerleştirilmiş ve gerçek açıkların ayrı bildirildiği bir ölçüm, altı aylık beklentinin modellerle mi yoksa konuldukları tezgâhla mı ilgili olduğunu gösterir. Böyle bir ölçüm yayımlanana kadar 80 puanın işe yarar okuması dar kalıyor: bu ağda, bu kurulumda, bir model yolun tamamını gitti.[1]