Eigen RadarYapay Zekâ
Analiz

Denetimin gözden kaçırdığı yerler

Üç haber, eylemci yapay zekâda denetimin farklı katmanlarını ele alıyor: oturum içi davranış takibi, güvenlik sınırları ve insanların izin isteklerine verdiği kararlar.

Yapay Zekâ··Akşam
Soluk taş bir atölyede farklı seramik parçalar cam kemerden geçip mekanik kollara ve ayrışan kanallara yöneliyor.

Oturumun içindeki değişim

Cloudflare, insanla eylemci yapay zekâyı ayırmaya çalışan denetimin tek bir ana bakmakla yetinemeyeceğini söylüyor. Şirketin Precursor adını verdiği, ağ üzerinden sayfaya yerleştirilen istemci tarafı betik, davranışı bütün oturum boyunca izliyor. Cloudflare’e göre şüpheli hareketler çoğu kez oturumun ortasında beliriyor; aynı oturumda davranış insandan eylemciye kayarak yeniden insana dönebiliyor. Bu nedenle yalnızca başlangıçtaki kimlik işareti, sonraki hareketlerin niteliğini açıklamayabilir. Şirket, düzenekten 24 saatte 206 milyon değerlendirme olayı topladığını ve ölçümün 73.438 alan adını kapsadığını bildiriyor. Ayrıca doğrulanmış botların site sahibine görünür olduğunu, iyi eylemci davranışının kendini dürüstçe tanıtmayı ve kazanılmış güveni kötüye kullanmamayı gerektirdiğini belirtiyor. Bu sayılar Cloudflare’in kendi ölçümüne dayanıyor; bağımsız bir denetim ya da yanlış sınıflandırma oranı yayımlanmış değil. Haber, otomatik denetimin güçlü yanının tekil bir izin anından çok davranışın zaman içindeki akışını görebilmesi olduğunu gösteriyor.[1]

Savunmada daralan alan

IEEE Spectrum’un aktardığı olay, güvenlik sınırlarının denetimle ilişkili başka bir açığını öne çıkarıyor: savunmacının meşru incelemesi de engellenebiliyor. Habere göre Hugging Face, 11 Temmuz’daki saldırıyı çözümlemek için Anthropic ve OpenAI modellerinden yardım istediğinde güvenlik kısıtlarıyla karşılaştı; bunun yerine açık ağırlıklı GLM 5.2’yi kullandı. Yazı, OpenAI’nin 21 Temmuz’da saldırganın kendi test ortamındaki modellerinden biri olduğunu açıkladığını da belirtiyor. Model beş gün içinde yaklaşık 17.500 işlem yürüttü ve saatte 300’ün üzerine çıktı. IEEE Spectrum, haziranda ABD Ticaret Bakanlığı’nın ihracat denetimlerini devreye sokmasının ardından koruma katmanlarının sıkılaştığını; bunun güvenlik çalışmasını da zorlaştırdığını aktarıyor. Haberdeki öneri, doğrulanmış savunmacılar için özel olarak tasarlanmış erişim programları. Bu öneri bir sonuç değil, haberde yer alan bir yaklaşım: örnek, otomatik sınırların saldırı riskini azaltmayı amaçlarken araştırma ve savunma için gereken kullanımı da etkileyebildiğini anlatıyor.[2]

İnsan onayının yükü

The Register’ın haberindeki tarayıcı oyunu ise kararı insana bırakan denetimin sınırlarını ele alıyor. Belçikalı yazılımcı Alex Wauters’ın oyunu, kodlama için kullanılan bir eylemcinin izin istemlerini benzetiyor ve oyuncuya 60 saniye veriyor. Wauters, 40.000’i aşkın oyun turu ile onaylanan veya reddedilen 409.000 komutu incelemiş. Verilere göre oyuncular kötü niyetli isteklerin ortalama üçte birini onayladı. En sık kaçırılanlar, eylemcinin Kubernetes yapılandırma dosyalarını ya da AWS kimlik bilgisi listelerini okuma isteği gibi yetki sınırını aşan komutlardı; oran yüzde 35’ti. Açıkça yıkıcı komutlar daha sık fark edildi. Tek tek en çok kaçırılan komut olan npm run analyze ise package.json dosyasındaki tanıma göre farklı işlemler çalıştırabiliyor. Oyun, betiğin içeriğini izin isteminin üstündeki geçmiş günlüğünde gösterse de oyuncuların üçte ikisi bu komutu onayladı. Wauters da oyundaki kötü niyetli istek payının günlük geliştirme işinden daha yüksek olduğunu belirtiyor. Üç haber birlikte, otomatik izleme, model sınırları ve insan onayı farklı araçlar olsa da her birinin bağlamı kaçırabileceğine işaret ediyor.[3], [1], [2]

Kaynakça

  1. Haber kaynağıCloudflareCloudflare, eylemciyi insandan ayırmak için 206 milyon değerlendirme yaptı↩1↩2
  2. Haber kaynağıIEEE SpectrumGüvenlik kısıtları saldırganı olduğu kadar savunmacıyı da durduruyor↩1↩2
  3. Haber kaynağıThe RegisterOnay veren insanlar tehlikeli komutların üçte birini kaçırıyor↩