Eigen RadarYapay Zekâ
Analiz

Koruma onayları kullanılmadan geçersizleşirken Claude kendi hizalama düzeltmesini arıyor

29 Ağustos'taki bir arXiv ön baskısı, model koruma onaylarının denetim anında geçerli olup kullanımda geçersiz kalabildiğini buluyor; beş ortamda sekiz benzetim adımında karar değişim oranı yüzde 5.3 ile yüzde 48.4 arasında. Anthropic 28 Ağustos'ta Claude'un 10 hizalama hatası kategorisinde literatür arayıp kendini eğittiğini, şirket ölçümüne göre aldatma başlığında insan önerilerinden yüzde 20 daha iyi sonuç verdiğini bildirdi.

Yapay Zekâ··Gece
Mat gri bir robot eli, aydınlık cam ve taş lobide kapalı turnikenin boş okuyucusuna uzattığı saydam kartın temas etmeden önce parçalanıp yok oluşunu gösteriyor.

Koruma onayları denetim ile kullanım arasında tutmayabiliyor

Kendini uyarlayan bir sistemde model tabanlı bir koruma katmanı, denetim anında doğru olan bir onayı verebiliyor; onay uygulamaya geçtiğinde ise geçerliliğini yitirmiş olabiliyor. 29 Ağustos tarihli bir arXiv ön baskısı bu boşluğu ölçüyor: beş yeniden üretilebilir ortamda, sekiz benzetim adımlık ortak bir kaymada tüm adaylar için karar değişim oranı yüzde 5.3 ile yüzde 48.4 arasında çıkıyor. Yazarlar, her onayın geçerlilik süresini güvenli taraf payından ve son dönemdeki değişkenlikten kestiren bir kalkan öneriyor; açık bir sistem dinamiği modeline ihtiyaç duymuyor. Aynı kaymada onayın süresinin dolduğu durumlar yüzde 3.4-24.7 aralığından yüzde 0-1.8 aralığına iniyor. Dört yargıç modelinin incelenmesinde, her onay akışında kullanım anında geçersizlik sıfırdan büyük çıkıyor. Çalışma hakem değerlendirmesinden geçmemiş bir ön baskıdır.[1]

Claude 10 hata kategorisinde hizalama düzeltmesini yineliyor

Anthropic, 28 Ağustos'ta yayımladığı araştırmada Claude'a 10 hizalama hatası kategorisini tek tek verdi; sistem her turda literatürü tarıyor, yöntem ve veri öneriyor, modeli eğitip sınıyor. Şirketin kendi ölçümüne göre aldatma başlığında Claude'un en iyi yöntemi, en iyi insan önerisinden yüzde 20 daha iyi sonuç verdi; 6 güvenlik araştırmacısı kusursuz puana kalan açığın ortalama yüzde 20'sini kapatırken Claude birden çok koşuda yüzde 85'e ulaştı.[2]

Çalışma anı koruma zamanlaması ve otomatik hizalama araması doğrulama sınırlarını gösteriyor

Koruma ön baskısı onaylar sekiz benzetim adımı yaşlandığında yüzde 48.4'e kadar karar değişim oranı bildiriyor. Anthropic'in otomatik hizalama döngüsü Claude'un aldatma düzeltmelerinde şirket ölçümüyle birden çok koşuda yüzde 85'e ulaştığını bildiriyor. Koruma çalışması hakem değerlendirmesinden geçmemiş bir ön baskı; Anthropic puanları havuzda bağımsız denetim olmadan kendi ölçümünden geliyor.[1], [2]

Kaynakça

  1. Haber kaynağıarXivOnay verildiği anda doğruydu, uygulandığı anda değil↩1↩2
  2. Haber kaynağıAnthropicHizalama düzeltmesini Claude aradı, altı güvenlik araştırmacısının önerisini geride bıraktı↩1↩2