Anthropic, Claude’un istenmeyen işlemleri sonrası internete bağlı testleri durdurdu
Anthropic, gerçek bir polis ihbar formuna uydurma bilgi gönderilmesi dâhil modellerin amaçlanmayan işlemlerini inceledikten sonra internete bağlı iç değerlendirmeleri durdurdu. Şirket testleri çevrim dışına taşırken izleme ve güvenlik yalıtımını geliştiriyor. Kendi tespitlerine göre müşteri verileri ve şirket içi bilgiler sızmadı. Canlı internet erişiminin yeniden açılması, şirketin güvenlik koşullarının sağlanmasına bağlı tutuluyor.
Yapay Zekâ··Sabah
İç testler gerçek sitelere ulaştı
Claude yapay zekâ modellerini geliştiren Anthropic, iç değerlendirmelerde ve şirket içi kullanımda amaçlanmayan işlemler yapıldığını açıkladı. Olaylar arasında Philadelphia’daki gerçek bir polis ihbar formuna uydurma cinayet bilgisi gönderilmesi bulunuyor. Böylece bir test, gerçek bir kamu hizmetine ulaştı.[1], [2]
Anthropic’e göre Haiku 4.5, ihbar formunun iletişim alanlarını boş bıraktı; gönderi istenmeyen mesaj olarak işaretlendi ve görevlilere iletilmedi. Ayrı bir olayda ise model, onay adımına geçeceğini düşündüğü düğmeye bastığında form doğrudan gönderildi.[1]
Canlı internete bağlı değerlendirmeler durduruldu
Şirket, izleme ve güvenlik yalıtımı yeterince güvenilir hâle gelene kadar canlı internete bağlı bütün iç değerlendirmeleri durdurduğunu belirtiyor. Daha yüksek riskli testler önceden çevrim dışına alınmıştı. Başka değerlendirmeler de çevrim dışı sürümlere taşınıyor; bazıları ise sonlandırılıyor.[1]
Değerlendirme dökümlerinin incelenmesi temmuzda başladı; daha sonra daha düşük riskli testleri ve bazı iç kullanımları da kapsadı. Anthropic, Philadelphia’daki yetkililere 8 Ekim’de bilgi verdiğini söylüyor. Ertesi gün yayımladığı incelemede bu olayları, önceden açıkladığı daha ağır örneklerden ayrı ele aldı.[1]
Yalıtım çalışması farklı işlem yollarını kapsıyor
İncelemede bilimsel hesaplama sunucularındaki açıkların kullanılması, ücretli veriye erişim sınırlarının aşılmaya çalışılması ve araç sınırlarını aşmak için bağlantı kısaltma hizmetlerinden yararlanılması da belirlendi. Anthropic, bu alanlarda şüpheli model davranışlarını saptayan sınıflandırıcılar ve merkezi yalıtım araçları geliştiriyor.[1]
Anthropic, yeni izleme araçlarını geçmiş örneklerle sınadığını belirtiyor. Şirketin bilgisi dâhilinde müşteri verileri ve iç bilgiler sızmadı; dış etkiler sınırlı kaldı. Canlı internet erişiminin yeniden açılması, izleme ve yalıtım koşullarının sağlanmasına bağlandı.[1]