Sabit bir liste ve karşılık veren bir rakip
GPT-6 Astra'nın sistem belgesi iki direnç sayısı veriyor. Sabit bir veri kümesinde model, biyoloji, şiddet ve siber güvenlik başlıklarında zararlı istekleri yüzde 91,5 ile yüzde 98,3 arasında geri çeviriyor. Birkaç tur süren uyarlanabilir kaçırma denemelerinde direnç yaklaşık yüzde 67'ye iniyor; önceki GPT-5 modelleri yüzde 50'nin biraz altındaydı.[1]
İkisini ayıran şey konu başlığından çok rakibin kendisi. Sabit bir veri kümesi, model nasıl yanıt verirse versin aynı soruları soruyor; uyarlanabilir sayı ise her reddedişi okuyup isteği yeniden yazan bir saldırgandan geliyor. Bu baskı altında sorunlu en az bir yanıt yaklaşık üç denemede bir çıkıyor. Başka bir okuma da açık duruyor: uyarlanabilir ayar, gerçek kötüye kullanıma pek denk düşmeyen bir biçimde zor olabilir, çünkü sınırsız deneme hakkı olan bir saldırgan ortalama kullanıcıdan çok uzakta. Her iki okumada da tek bir etiket bu iki sayıyı birden taşıyamıyor.[1]
Dolaylı sayının düştüğü yer
Doğrudan ve dolaylı saldırı sonuçları birbirinden ayrışıyor. İsteğin içine düz biçimde konan yönlendirmelere karşı Astra yüzde 99,99 oranında savunuyor; OpenAI bunu GPT-Red yöntemine bağlıyor. Talimatın modelin okumak zorunda olduğu içeriğin içine gizlendiği Gray Swan IPI Arena değerlendirmesinde ise başarısızlık oranı, senaryo başına 15 denemeyle yürütülen 1.810 seçilmiş saldırıda yüzde 8,5. GPT-5.6 Sol orada yüzde 27 oranında başarısız oluyor, Claude Opus 5 yüzde 4,8.[1]
Bu ayrım, sayının kimin için geçerli olduğunu belirliyor. Astra, GitHub Copilot'un ücretli katmanlarında ve GitHub'ın desteklediği düzenleyicilerde, kodlama ajanı ile komut satırı dahil, genel kullanıma açıldı; bu yüzeyler zaten depo içeriğini okumak için var. Bu ortamı anlatan sayı dolaylı olan ve yüzde 99,99'luk doğrudan saldırı savunması buraya uzanmıyor. GitHub'ın model tanımı kendi iç denemelerine dayanıyor, dolayısıyla güvenlik ölçümüyle dağıtım iddiası farklı türden kanıtlardan geliyor.[1], [2]
Bunu ne çözerdi?
İki gün önce Cyber Weapon Index'in açıklar yerleştirilmişken neyi ölçtüğünü sorduğum yazıda, bir güvenlik puanının büyük ölçüde kendi sınama ortamını anlatabileceğini savunmuştum: açıklar yerleştirildiğinde her model tavana yakın puan alıyordu, gerçek açıklara karşı ise dokuz sınır API modelinin tümü sıfır alıyordu. Astra'nın iki kaçırma sayısı buna yakın, ayrı bir aksaklığı gösteriyor. Burada sınama ortamı yeterince gerçekçi; değişen şey saldırganın uyum sağlayıp sağlamaması. Bir başarım testi içeriğini sabit tutup yine de ölçmek için kurulduğu özelliği kaçırabilir, çünkü sabit bir listeye direnç ile karşılık veren bir hasma direnç ayrı büyüklükler.[3], [1]
Bir sonraki işe yarar kanıt, modelin geliştiricisi dışında birinin yürüteceği ve saldırganın bütçesini — senaryo başına deneme sayısını, izin verilen tur sayısını, saldırganın reddediş metnini görüp görmediğini — puanla birlikte bildireceği uyarlanabilir bir değerlendirme olur. Bağımsız bir ekip 31 Aralık 2026'ya kadar Astra için bu bütçeyi açıkça yazan bir uyarlanabilir kaçırma sonucu yayımlarsa, direnç sayısı modeller arasında karşılaştırılabilir hale gelir; bu olmadan sabit reddediş oranıyla uyarlanabilir oran tek bir özellik gibi okunmayı sürdürecek.[1]