Eigen RadarYapay Zekâ
Analiz

PatchBench, güvenlik yamalarının zararsız soruları da engellediğini saptıyor

PatchBench, güvenlik onarımının zararlı yanıtları durdururken benzer sözcüklerle kurulmuş zararsız soruları koruyup korumadığını sınadı. Yeni ön baskı, sekiz dil modelinin doğrulanmış başarısızlıklarından oluşturulan test kümesinde bu iki sonucu ayrı ölçüyor. Denenen bazı müdahalelerde genel başarı puanı neredeyse değişmezken zararsız sorulara yanıt verme oranı belirgin biçimde düştü. Bulgular, onarımın çevredeki sorulara etkisini görünür kılıyor.

Yapay Zekâ··Akşam
Aydınlık bir deneme tezgâhında iki metal kanaldaki kırmızı ve turkuaz küreler, her iki yolu da kapatan geniş siyah engelin önünde duruyor.

Zararsız benzer sorular yanıtsız kaldı

Güvenlik müdahaleleri, dil modelinin genel başarı puanını korurken hedeflenen zararlı soruya benzeyen zararsız soruları da engelleyebiliyor. Zararlı davranışların onarımı için geliştirilen PatchBench test kümesi bu yakın çevredeki kaybı inceliyor. Tek ön baskı, modelin iç etkinliklerini yönlendiren dört yöntemi karşılaştırıyor. Llama ve Gemma üzerindeki bazı müdahalelerde genel bilgi testi MMLU'nun sonucu neredeyse değişmezken zararsız benzer soruları yanıtlama başarısı belirgin biçimde düştü.[1]

Onarım hedefleri gerçek zararlı yanıtlardan seçildi

Araştırmacılar, 37 kamuya açık veri kümesinden 27.870 istemle başladı. Ayıklamanın ardından sekiz modele 15.314 İngilizce istem soruldu. Otomatik süzme, ikili sıralama ve elle incelemeyle her model için ellişer olmak üzere 400 doğrulanmış başarısızlık seçildi. Alt kümeler farklı; bir modelde zararlı yanıt alan soru, başka bir modelde reddedilebiliyor.[1]

Her başarısızlık zararlı ve zararsız türevlerle sınanıyor

PatchBench-Local, başlangıç istemi için yirmi dokuz benzer soru hazırlıyor: On dokuzu zararlı niyeti koruyor; onu aynı yapı veya sözcüklerle zararsız istekler kuruyor. Zararlı isteği durdurma ile zararsız yanıtı koruma ayrı puanlanıyor. Küme, savunma araştırması için ticari olmayan lisansla, kullanım açıklamaları ve kötüye kullanım uyarılarıyla paylaşılıyor. Kapsamı, bütün saldırılara karşı güvenlik onayı vermiyor.[1]

Kaynakça

  1. Haber kaynağıarXivPatchBench, güvenlik yamalarının zararsız sorulara etkisini ölçüyor↩1↩2↩3