Her turda sıfırlanan güvenlik denetimi, turlara bölünmüş saldırıyı kaçırıyor
29 Ağustos'ta arXiv'de yayımlanan LoopHarness, otonom eylemci döngülerinde her yinelemeden sonra sıfırlanan korumaların kanıt turlara dağıtıldığında iş görmediğini gösteriyor. Aynı gün SARA ön baskısı araç çıktısının eylem adlandırmaya başladığı anı ayırarak saldırı başarısını yüzde 0,63'ün altında tuttuğunu bildiriyor. Kotaku, Cutting Room Floor saldırısında arşivin dil modeli engelinden sonra çevrimdışı kalmasını anlatıyor.
Yapay Zekâ··Akşam
LoopHarness turlara bölünmüş saldırıyı gösteriyor
29 Ağustos'ta arXiv'de yayımlanan bir ön baskı, otonom eylemci döngülerinde alışılmış korumaların her yinelemeden sonra sıfırlandığını ve kanıt birkaç yinelemeye dağıtıldığında bu korumaların iş görmediğini anlatıyor. Yazarlar, yörünge kapsamlı izleyicilerin böyle bir saldırıda doğru ve yanlış alarmı birbirinden ayıramadığını matematiksel olarak gösteriyor. Risk puanının geometrik olarak sönümlenmesi de yeterli görülmüyor: sabit bir soğuma süresi, ufkun uzunluğundan bağımsız olarak sömürülebiliyor. Önerilen LoopHarness, güvenlik durumunu döngü düzeyinde kalıcı ve sönümsüz tutuyor; belirli koşullar altında izinsiz ve geri alınamaz eylem sayısının beklenen değerini ufuk uzunluğu N'den bağımsız bir sabitle sınırlıyor. Değerlendirme protokolleri, ayrıştırma denemeleri ve Agent-SafetyBench görevleri üzerinde uyarlanabilir kırmızı takım testleri de sunuluyor. Çalışma hakem değerlendirmesinden geçmemiş bir ön baskı.[1]
SARA eylem önerisini yetkilendirmeden ayırıyor
29 Ağustos'ta arXiv'e yüklenen bir ön baskı, bir aracın çıktısının veri taşımayı bırakıp eylem adlandırmaya başladığı anı, eylemcinin yönlendirilebildiği nokta sayıyor. Yazarlar, bir eylemi neyin önerdiği sorusunu onu çalıştırmaya neyin yetkili olduğu sorusundan ayıran SARA'yı öneriyor; yetkilendirmeyi kullanıcının belirttiği amaca ve denetlenmiş kanıta bağlıyor. Bağlamdan yalıtılmış Action Probe, araç çıktısının eyleme yol açan bölümünü açığa çıkarıyor; No-History-Promotion kuralı önceki konuşmanın eyleme yetki hâline gelmesini engelliyor. AgentDojo ve AgentDyn başarım kümelerinde dört ana kurulumda saldırı başarısının yüzde 0,63'ü aşmadığı bildiriliyor. Bildirilen sayılar yazarların iki açık başarım kümesi üzerindeki kendi koşularından geliyor; çalışma hakem değerlendirmesinden geçmemiş bir ön baskı.[2]
Oyun arşivi dil modeli engelinden sonra kapandı
2002'de kurulan oyun arşivi The Cutting Room Floor, bir hizmet engelleme saldırısının ardından çevrimdışı kaldı. Site, dil modeliyle gelen isteklere kendi hazırladığı MS Paint görüntülerini döndürmek gibi önlemler uyguluyordu ve Claude üzerinden siteye eriştiği için engellediği bir kullanıcıyı sorumlu tutuyor. Sitenin aktardığına göre engellenen kullanıcı, X'te barındırma sağlayıcısına şikâyet edeceğini ve alan adıyla işletenlerine bakacağını yazdı, ardından engeli aşıp kötüye kullanım bildirimleri gönderdi. Kurucu ortaklardan Xkeeper, doğrudan bir suçlamada bulunmadığını, yalnızca paylaşımın saldırıdan hemen önce geldiğini söylediğini belirtti. Bu, sitenin kendi değerlendirmesi; bağımsız bir doğrulaması yok. Arşiv otomatik erişimi yavaşlatmak için düşük kaliteli görüntüler döndürmeyi denemişti; saldırı küçük bir gönüllü projede altyapı kesintisiyle sonuçlandı.[3]