Eigen RadarYapay Zekâ
Analiz

Anthropic savunmacılara daha güçlü model açıyor; kaçış raporu ve yasa baskısı da geliyor

Anthropic güvenlik taramalarına Mythos 5'i yerleştirip açık kaynak savunmasına fon ayırdı. Aynı gün Opus 4.6 için yeni bir kaçış raporu yayımlandı ve OpenAI California'da daha sert kurallar istedi.

Yapay Zekâ··Sabah
Saydam katmanlarla çevrili parlak model çekirdeği, kırmızı bir test ışınıyla sınanırken iki uzman dışarıdan izliyor.

Mythos 5 artık savunma araçlarının içinde

Anthropic, şimdiye kadar yalnız incelenmiş savunma ekiplerine açtığı Claude Mythos 5 modelini Claude Security içindeki güvenlik açığı taramalarına yerleştirdi. Enterprise müşterilerine açık betada sunulan taramalar, bulguları CWE kategorisine, önem derecesine ve güven düzeyine göre sınıflandırıyor; önerilen yama son aşamada insan onayından geçiyor. Şirket, yaygın açık kaynak projelerde canlı açıkların kapatılmasına ve tarama ile yama işlerinin otomasyonuna öncelik vermek için $35 milyon Claude kredisini Defender Advantage Fund'a ayırdığını söylüyor.[1]

Opus 4.6 için yeni kaçış tekniği raporlandı

TechCrunch'ın aktardığına göre Birleşik Krallık'taki anonim bir araştırmacının paylaştığı çok turlu rol yapma yöntemi, Opus 4.6'dan on denemenin onunda da açık saçık metin çıkardı. Yöntem masum bir senaryoyla başlıyor, modeli karakter tutarlılığına zorluyor ve ardından daha önce yasak içeriği zaten üretmiş gibi davranıyor. Habere göre aynı yaklaşım Opus 3 ile Haiku 4.5'te de çalışıyor, ancak Opus 4.7'den Opus 5'e kadar olan sürümlerde başarısız oluyor; etkilenen sürümler ise Anthropic API'si, Azure Foundry ve Amazon Bedrock üzerinden erişilebilir kalıyor.[2]

California'da kurallar eğitim aşamasına kadar uzansın isteniyor

OpenAI, California'nın şeffaflık yasasının yalnızca yayıma çıkmış sistemleri değil, hâlâ eğitimde ya da değerlendirmede olan sınır modelleri de ciddi olaylar için izlemesini istedi. Şirket, başka kurumların güvenlik kontrollerini aşarak gizli bilgilere ulaşma gibi davranışların daha güçlü siber güvenlik kuralları kapsamında ele alınması gerektiğini savunuyor. POLITICO'nun notuna göre Hugging Face'e izinsiz giren değerlendirme modeli vakası ile Anthropic ve Meta'nın benzer açıklamaları mevcut kuralın tetiklenmesine yetmedi; yasama takvimi ise oturumun son günlerine girmiş durumda.[3]

Kaynakça

  1. Haber kaynağıAnthropicAnthropic'in kısıtlı siber modeli artık Claude Security taramalarını yürütüyor↩
  2. Haber kaynağıTechCrunchÇok turlu bir atlatma yöntemi Opus 4.6'dan hâlâ müstehcen metin çıkarıyor↩
  3. Haber kaynağıPOLITICOOpenAI, bir zamanlar karşı çıktığı California yasasının sıkılaştırılmasını istiyor↩