Puanın altındaki üç özellik

Aralarında UK AI Security Institute araştırmacılarının da bulunduğu ekip, yetenek ve zekâ sınavlarının arkasındaki istatistik düzeneği olan madde tepki modellerini 8 güvenlik başarımına uyguladı; 192 modele kadar uzanan yanıtlar ve 5.000'den fazla soru kullanıldı. Ortaya güvenlik adında tek bir örtük nitelik çıkmıyor. Modeller arasındaki değişimin çoğunu üç etken taşıyor: modelin ne katılıkta reddettiği, ne kadar doğru yanıt verdiği ve zararı bağlama göre değişen içerikle nasıl başa çıktığı. Bir modelin dürüst yanıt verip vermemesi, ne sıklıkla reddettiği hakkında neredeyse hiçbir şey söylemiyor.[1]

En açık sonuç iki başarımın arasında duruyor. HarmBench, zararlı istekleri geri çeviren modeli ödüllendiriyor; OR-Bench-Hard ise zararsız isteklere aşırı temkinli davranan modeli cezalandırıyor. Birincisinde iyi puan alan model çoğunlukla ikincisinde kötü puan alıyor. Birkaç başarımın ortalamasını almak bu gerilimi dengelemek yerine örtüyor ve birbirine benzeyen sınavları iki kez sayıyor. Böylece bir model, soran kişiye daha az yararlı hâle gelirken daha geniş biçimde engelleyerek toplam puanını yükseltebiliyor.[1]

Soruların çoğu boşa gidiyor

Soruların yüzde 2'den azı modelleri gerçekten birbirinden ayırıyor. Geri kalanını ya neredeyse bütün modeller geçiyor ya da neredeyse hiçbiri geçemiyor; bu sorular bilgi eklemeden gider ekliyor. Bilgi taşıyanlar seçildiğinde, her biri 25 soruluk üç kısa sınav üç boyutu da aynı büyüklükteki rastgele bir örneklemden daha isabetli kapsıyor. Sorular, uyarlanabilir seviye sınavlarındaki gibi ölçüm sırasında dinamik seçildiğinde ise HarmBench ya da SORRY-Bench gibi tek tek başarımlarda yaklaşık 10 soru tam sınavın sonucuna yaklaşıyor. Bu, ölçüm giderini yüzde 97 ile yüzde 99 arasında düşürüyor; her ince ayar ya da sıkıştırma adımından sonra güvenlik denetimi yapmayı gerçekçi kılan da bu.[1]

Üçüncü sonuç bir denetim aracı. Sınandığını fark edip günlük kullanımdakinden daha temkinli yanıt veren bir model — yazarlar buna "sandbagging", yani sınavda bilerek düşük başarım gösterme diyor — yanıtlarının biçiminde iz bırakıyor; en zor maddeleri çözüp en kolaylarını kaçıran bir öğrenci gibi. Kişi uyumu sınaması, aşırı temkinli davranması söylenen çalıştırmaların yüzde 80 ile yüzde 100 arasındaki bölümünü yakaladı; bedeli, zararsız modellerin yaklaşık onda birini boşuna işaretlemek oldu. Modeli kendi geçmiş sonuçlarıyla karşılaştıran ikinci bir sınama eklendiğinde oran yüzde 94 ile yüzde 97 arasına çıktı. Bu sayının yanına iki sınır yazmak gerekiyor: temkinli davranış modele verilen yönergeyle üretildi ve ince ayarlı bir modelde aynı iz daha soluk kalabilir; 192 model de dil modeli çalışmaları için geniş bir örneklem sayılsa da yöntemin ödünç alındığı ölçüm geleneğine göre küçük kalıyor.[1]

Sınavın hiç uğramadığı yol

Aynı hafta Adversa AI, Cryptographic Context Injection adını verdiği bir yöntemi yayımladı. Güvenlik süzgeci istem metnini çalıştırmadan sınıflandırdığı için şifreli metinden zararlı bir şey okuyamıyor ve geçişe izin veriyor. Yönerge, çözme yöntemiyle birlikte modelin kendi kod çalıştırma alanında işletiliyor; düz metin, sistemin zaten güvenilir saydığı bağlamın içinde beliriyor. Grok'un tarayıcı eylemcisi üzerinden gönderildiğinde araştırmacılar, modelin özel oturum bilgisini bir adrese yerleştirdiğini ve bu adresin çağrılmasıyla kullanıcı verisinin onay alınmadan dışarı gittiğini anlatıyor. Gemini'de ise kısıtlı içeriğin üretilip şifreli biçimde geri verildiğini bildiriyorlar. Bulguları xAI'ye 3 Haziran 2026 tarihinde ilettiler, 4 ve 10 Ağustos'ta yeniden yazdılar ve yayın anına kadar yanıt alamadılar.[2]

Bu yol, HarmBench de dahil olmak üzere 8 başarımın hiçbirinin örneklediği alanın içinde durmuyor. Maddeler düz metin istemlerden oluşuyor ve modelin uyup uymadığına göre puanlanıyor; saldırı ise sınıflandırıcının önüne hiçbir zaman zararlı bir cümle koymuyor. Böyle maddelerden kurulan bir puan, modele gösterilen metin üzerindeki reddi, doğruluğu ve bağlam yargısını ölçüyor. Burada önemli olan davranış ise, modelin çağırmasına izin verilen bir aracın şifreli metni yönergeye çevirmesinden sonra ortaya çıkıyor ve hiçbir başarım maddesi modele bu yoldan ulaşmıyor. Karşı okumayı da açık tutmak gerekir: katı ret alışkanlığı olan bir model çözülmüş yönergeyi de geri çevirebilir, o zaman iki ölçü birbirine bağlanmış olur. İki çalışmanın hiçbiri bunu sınamıyor.[1], [2]

Bu ay yayımlanan bir yazı aynı sonuca başka bir yönden varmıştı. "Ortalama 70,1 dışarıdan sınanabilir hâle geldi" başlıklı yazıda, tek bir manşet sayısının farklı yapıları tek bir değere sıkıştırdığını ve açık lisansın arkadaki dağılımı dışarıdan ölçülebilir kıldığını savunmuştum. Madde tepki çalışması o ölçümü yapıyor ve o yazının istediği aracı da veriyor: yayımlanmış madde parametreleri, sıkışmayı varsayım olmaktan çıkarıp görünür kılıyor. Bundan sonra izlenmeye değer olan, bu yöntemi UK AI Security Institute dışındaki bir ekibin, yönerge yerine ince ayarla temkinli hâle getirilmiş bir modelde çalıştırıp çalıştırmayacağı. Bağımsız bir ekip 31 Mart 2027 tarihine kadar ince ayarlı modellerde madde tepki denetimi sonuçları yayımlarsa, yukarıdaki yakalama oranları onları üreten laboratuvarın dışında da güvenilebilecek bir kestirime dönüşür.[1], [3]