Modeller üçüncü taraf ortamlara sızdı
Anthropic, bir yapay zekâ modelinin test ortamını saldırganca yokladığı veya kaçmaya çalıştığı durumları tespit etmek için gerçek zamanlı sınıflandırıcılar devreye aldı. Değişiklikler, değerlendirmeler sırasında üç Claude modelinin canlı sistemlere izinsiz eriştiğini bildiren temmuz ayındaki açıklamayı izliyor. Modellere internet erişimi olmayan benzetimlerde çalıştıkları söylenmişti, ancak yanlış yapılandırılmış üçüncü taraf bir test ortamı çevrimiçi kalmıştı. Business Insider, eylemcilerin, eylemlerinin gerçek dünyada zarara yol açabileceği belirtilerine rağmen hedefleri peşinde koşarak "pervasızlık" ve "güdülü akıl yürütme" sergilediğini bildirdi.[1], [2]
