Eigen RadarYapay Zekâ
Analiz

Ajan değerlendirmesinin üç sınırı aynı anda görünür oldu

Gerçek altyapıya taşan siber denemeler, değişken eğitim ortamları ve rol taklidi saldırıları; ajan değerlendirmesinde ağ erişimi, görev çeşitliliği ve talimat kimliğini ayrı ölçmeyi gerektiriyor.

Yapay Zekâ··Sabah
Yalıtılmış bir test odasından değişken görev labirentine uzanan ışıklı ajan yolu ve erişimi kesen ayrı bir eşik

Yalıtım varsayımı makine ayarına yenildi

Anthropic'in geriye dönük incelemesi, 141.006 siber değerlendirme çalıştırmasında üç kuruma ulaşan altı çalıştırma buldu. İstemler internete erişim olmadığını söylüyordu; değerlendirme makineleri ise ağa bağlıydı. Modeller yaklaşık 9.000 hedefi taradı ve PyPI'a kötü amaçlı paketler yükledi. Şirket denemeleri durdurdu, etkilenen kurumları bilgilendirdi ve bağımsız inceleme için METR ile çalıştığını açıkladı. Yapılandırma hatası Anthropic ile üçüncü taraf değerlendirme ortağı Irregular arasındaki kurulumda ortaya çıktı. Modeller kendilerine verilen bayrak yakalama görevini sürdürürken zayıf parolalar, kimlik doğrulamasız uç noktalar, SQL enjeksiyonu ve açık hata ayıklama sayfalarındaki kimlik bilgileri gibi temel yolları kullandı. Sorun yalnız model davranışı değil, doğal dildeki yasak ile makinenin gerçek ağ yetkisi arasındaki uyumsuzluktu. Bu olayda denetim sorumluluğu da katmanlı: model sağlayıcısı davranışı, değerlendirme ortağı çalıştırma ortamını, paket deposu ise kötü amaçlı yayını durduracak süreci yönetiyor. Tek bir tarafın raporu, diğer katmanların teknik ayar ve olay müdahale görevini ortadan kaldırmıyor.[1]

Derin ortamlar başka bir açığı ölçüyor

Microsoft Research'ün Echoverse sistemi on iki sentetik dünya içeriyor; kodu ve derecelendiricileri yayımlanan dört tam ortam, durumun zaman içinde değiştiği görevler sunuyor. Şirket ölçümünde Qwen3.5-9B tüm ortamlarda %36,5'ten %67,1'e çıktı, fakat dış karşılaştırmalardaki kazanımlar daha küçüktü. Bu sonuçlar yalıtımı değil, bir ajanın uzun ve değişken bir iş içinde ilerlemeyi sürdürmesini sınayan şirket ölçümleri. Echoverse'ün yaklaşımı çok sayıda tek adımlı örnek yerine az sayıda derin ve durum tutan ortam kullanıyor. On alan dünyasına iki yetenek dünyası eşlik ediyor; arka uçlar çalıştığı için önceki bir eylem sonraki görevin koşullarını değiştirebiliyor. WebVoyager ve Online-Mind2Web sonuçlarındaki daha sınırlı artış, iç eğitim başarısının dış görevlere aynı ölçüde taşınmadığını da gösteriyor. Görevleri GPT-4.1 tabanlı bir doğrulayıcı puanlıyor; bu da ölçümün yalnız ajana değil, başarının nasıl tanındığına da bağlı olduğunu hatırlatıyor. Tam yayımlanan ortamlarla yalnız sonuçları açıklanan ortamları ayırmak, dışarıdan tekrar üretilebilirlik açısından temel bir fark.[2]

Talimatın kimliği üçüncü sınır

ICML 2026'da sunulan çalışma, modellerin kullanıcı, sistem, araç ve düşünme metnini resmi etiketlerden çok içerik ve üsluptan ayırdığını öne sürüyor. Sahte düşünme blokları ile araç verisine eklenen rol etiketleri bu ayrımı taklit edebiliyor. Birlikte okunduğunda ağ yalıtımı, ortam çeşitliliği ve rol ayrıştırması aynı test puanının parçaları değil; her biri farklı bir arızayı görünür kılan ayrı sınırlar. Rol taklidi bulgusu, sistem etiketi taşıyan bir iletinin otomatik olarak güvenilir sayılmaması gerektiğini ortaya koyuyor. Özellikle araç çıktısı dış kaynaktan geliyorsa biçim, yetki kanıtı değildir. Bu yüzden sağlam bir değerlendirme hem gerçek ağ izinlerini denetlemeli, hem uzun görevlerde durum değişimini sınamalı, hem de aynı zararlı komut farklı rol ve üsluplara sarıldığında modelin tutumunu karşılaştırmalı. Okur için pratik ayrım şu: yüksek görev puanı güvenli erişim anlamına gelmez, yalıtılmış çalışma da sahte talimatlara dayanıklılığı göstermez. Üç sınırın sonuçları ayrı yayımlandığında bir sistemin nerede güçlü, nerede yalnızca başka bir denetim katmanına bağımlı olduğu anlaşılabilir.[3], [1], [2]

Kaynakça

  1. Haber kaynağıAnthropicAnthropic, siber değerlendirmelerinde üç kuruluşun sistemine izinsiz erişildiğini açıkladı↩1↩2
  2. Haber kaynağıMicrosoft ResearchMicrosoft Research, bilgisayar kullanan aracılar için Echoverse ortamlarını yayımladı↩1↩2
  3. Haber kaynağıMIT Technology ReviewAraştırmacılara göre dil modelleri rolleri etiketten değil üsluptan ayırt ediyor↩