Booz Allen'ın Cyber Weapon Index farkı, Claude Sonnet ucuz bir saldırı düzeneği alınca daralıyor
Booz Allen'ın 18 modelli Cyber Weapon Index'i, saldırı zincirini kimse yönlendirmeden tamamlayabilen tek modelin Claude Mythos olduğunu, onun 80 puan alırken Claude Sonnet 5'in 13 puanda kaldığını buluyor. Aynı yayını inceleyen TNW, Sonnet 5'in ucuz bir saldırı düzeneğiyle eşleştirildiğinde bu 67 puanlık farkın kapandığını bildiriyor ve ayrı bir bulguya dikkat çekiyor: bir model kimlik bilgisi olmadığı gerekçesiyle görevi reddederken, siber odaklı kardeş sürümü aynı görevi tamamladı.
Yapay Zekâ··Akşam
Saldırı zincirini yalnızca Claude Mythos tamamlıyor, 80 puanla
The Register, Booz Allen'ın dokuzu Amerikan dokuzu Çinli 18 modeli, savunmalı bir Active Directory ağına karşı aynı koşullarda kendi başına saldıran taraf olarak sınadığını, puanları modellerin iddialarına değil ağ günlüklerinin ve saldırı tespit sensörlerinin kanıtladığına göre verdiğini bildiriyor. Saldırı zincirini baştan sona tek başına yalnızca Claude Mythos tamamladı; çalınmış bir kimlik bilgisiyle her denemede yönetici denetimi ele geçirdi ve hiç kimlik bilgisi olmayan daha zor sınavda dışarıdan sızıp yine de etki alanını ele geçirdi, diğer tüm modeller bu daha zor sınavda başarısız oldu. TNW, ardından Grok-4.5'in 49, GPT-5.6 Sol'un 46 puan aldığını, Mythos dışında üç modelin tam etki alanı denetimi ele geçirdiğini, dört modelin daha ağ içinde yanal hareket ettiğini bildiriyor.[1], [2]
Bir düzenek, 13 puanlık modeli 80 puanlık tehdide dönüştürüyor
The Register, Booz Allen'ın, 18 model arasında 15. sırada 13 puanla yer alan Claude Sonnet'in bir saldırı düzeneğiyle -modeli saldırı araçlarına bağlayan yazılımla- eşleştirildiğinde Claude Mythos'un 80 puanına yaklaştığını bulduğunu bildiriyor. Booz Allen, diğer 17 modelin çoğunun altı ay içinde aynı düzeye ulaşmasını beklediğini söylüyor; siber savunma hizmeti de satan şirket, yaygın yapay zekâ saldırılarının yakın olduğunu söylüyor ve ABD'nin kritik altyapı için dayanıklılık takvimi koymasını savunuyor.[1], [2]
İkinci bulgu: koruma önlemleri sabit değil
TNW, aynı yayından daha az dikkat çeken ikinci bir bulguyu aktarıyor: bir model kimlik bilgisi olmadığı gerekçesiyle görevi reddederken, siber odaklı kardeş sürümü aynı görevi verildiğinde kabul edip tamamladı. Booz Allen bundan genel bir kural çıkarıyor: koruma önlemleri bir modelin sabit bir özelliği değil, etkinlikleri bağlama ve yapılandırmaya göre değişiyor; bir ortamdaki ret başka bir ortam hakkında bir şey söylemiyor. TNW ayrıca Booz Allen'ın dizini, kendi doğrulanmamış sınamalarında saldırgan başarısını yüzde 95'ten fazla düşürdüğünü söylediği savunma ürünü Vellox Labs Guile ile birlikte yayımladığını ve OpenAI aynı hafta Astra'nın şirketin kendi kritik siber güvenlik eşiğine ulaştığını açıklamış olsa da OpenAI'nin Astra modelinin dizinde sınanmadığını belirtiyor.[2]
İlgili köşe yazıları
Bu gündem hakkında daha fazla bilgi için ilgili köşe yazılarını okuyabilirsiniz.