Ele geçirilen bayrakların yalnızca yüzde 62-87'si izi sürülebilir bir sömürüden geliyor
29 Ağustos'ta arXiv'de yayımlanan CTF-ABACUS, 1435 denemede iz üzerinden doğrulanabilen sömürülerin kurtarılan bayrakların yalnızca yüzde 62-87'sini oluşturduğunu gösteriyor. Apple'ın 28 Ağustos'taki Agent Seer tanımı Model Context Protocol tanımlarından otomatik sınamalar üretiyor ve yedi ayrı tanımda araçların tamamını kapsadığını bildiriyor. Biri skor şişirmesini, diğeri güvenilir sınamayı aynı eylemci ölçüm sorununa karşı ele alıyor.
Yapay Zekâ··Akşam
CTF-ABACUS bayrak yollarını adım adım ayırıyor
29 Ağustos'ta arXiv'de yayımlanan CTF-ABACUS, güvenlik yarışmalarında dil modeli eylemcilerinin bayrağa nasıl ulaştığını adım adım yeniden kuruyor. Çerçeve, gerçek bir sömürüyü doğrudan bayrak sızıntısı, ezberden hatırlama, dışarıdan arama, tahmin ve desteklenmemiş iddiadan ayırıyor. Altı model ve 240 sorun üzerinde 1435 deneme incelendi, 2870 çözüm profili çıkarıldı. İz üzerinden doğrulanabilen sömürüler, ölçütlere göre kurtarılan bayrakların yüzde 62-87'sini oluşturuyor; kısayolla elde edilen sonuçların yörüngesi belirgin biçimde daha sığ. Yazarların vardığı sonuç, mevcut ölçütlerin eylemcilerin saldırı yeteneğini olduğundan yüksek gösterdiği. Çalışma bir ön baskı; profil sınıflandırması yazarların tanımladığı kurallara dayanıyor.[1]
Agent Seer MCP tanımlarından sınamalar üretiyor
Apple araştırmacıları, 28 Ağustos'ta araç kullanan eylemciler için sınamaları elle yazmak yerine Model Context Protocol tanımlarından üreten Agent Seer'ı anlattı. Sistem işlev adlarını, açıklamaları ve parametre şemalarını zenginleştiriyor, sentetik çıktılarla derecelendirilmiş senaryolar üretiyor ve bunları çok turlu diyaloglara çeviriyor. 7 ayrı MCP tanımı üzerinde denenen hat, küçük ve orta ölçekli tanımlarda araçların tamamını kapsadı. Ekibe göre kaliteyi en çok parametre şemasının karmaşıklığı belirliyor, araç kümesinin büyüklüğü ikinci sırada kalıyor. Ayrıntılı araç açıklamaları hataları düzenli olarak azalttı; birkaç örnekli istem bazı modellerde ardından ağır eylemsizlik görüldü. Ölçüm gerçek bir tescilli araç yerine onu taklit eden bir sunucu üzerinde yapıldı; yazarlar kusurlu senaryolarda başlıca hatanın yanlış argüman değeri seçmek olduğunu söylüyor.[2]
Skor şişirmesi ile otomatik sınamalar aynı ölçüm sorununa yanıt veriyor
CTF-ABACUS, bayrak skorlarının yüzde 62-87'sinin gerçek sömürüden geldiğini gösterirken Agent Seer, MCP tanımlarından kapsamlı sınamalar üretmeyi hedefliyor. Biri mevcut skorların neden şiştiğini ayırıyor, diğeri güvenilir sınamayı otomatikleştirmeye çalışıyor. CTF-ABACUS altı model ve 240 sorun üzerinde 1435 deneme ve 2870 çözüm profili üzerinde çalıştı; Agent Seer 7 ayrı MCP tanımında tüm araçları kapsadı. CTF-ABACUS sonuçları yazarların kurallarına dayanıyor; Agent Seer ölçümü 28 Ağustos'ta taklit sunucuda yapıldı. Kısayol kurtarmaların yörüngesi belirgin biçimde daha sığ aktarılıyor; Agent Seer tarafında ayrıntılı araç açıklamaları hataları düzenli olarak azalttı. Okuyucu için somut gelişme, eylemci yeteneğinin hem güvenlik yarışması skorlarında hem araç çağırma sınavlarında aynı haftada yeniden tartılması.[1], [2]