Model korumaları üç baskı altında yeniden ayarlanıyor
OpenAI’nin geliştirmeyi yavaşlatması, Anthropic’in gündelik biyoloji sorularındaki geri çevirmeleri azaltması ve savunmacıların siber erişim sorunu, model korumalarının farklı riskler arasında yeniden ayarlandığını gösteriyor.
Yapay Zekâ··Sabah
Geliştirme hızına konan sınır
OpenAI, Astra’nın geliştirilmesini bir iç incelemenin ardından yavaşlattığını açıkladı. İnceleme, modelin eylemci kodlama ve siber güvenlik yeteneklerinde belirgin ilerleme gösterdiğini saptadı. Şirketin kendi ölçeğinde Astra kritik bir siber güvenlik eşiğine ulaştı; OpenAI bu eşiği, modelin iyi korunan gerçek sistemlere yönelik saldırıları kendi başına bulup yürütebilmesi olarak tanımlıyor. Bunun üzerine geliştirme çalışmalarının bir bölümü durduruldu, daha sıkı güvenlik denetimleri getirildi ve yeni koşulları karşılamayan iç çalışmalar duraklatıldı. OpenAI ayrıca modelin yapabildiklerini ölçmek için ilgili kamu kurumları ve seçilmiş yapay zekâ güvenliği kuruluşlarıyla çalıştığını belirtti. Değerlendirmelerin ön aşamada olduğunu vurgulaması önemli: açıklama, erişilmiş yetenek düzeyini şirketin ilk ölçümlerine dayandırıyor. TechCrunch haberi, Astra’nın Hugging Face’teki sızmayla bağlantısı bulunmadığını da açıkça belirtiyor. Bu gelişmede koruma ayarı, kullanıcıya açılmış bir üründeki tekil yanıtları seçmekten önce devreye giriyor; modelle ilgili hangi geliştirme çalışmalarının sürdürülebileceğini ve daha geniş değerlendirmeye ne zaman geçileceğini belirliyor.[1]
Gündelik kullanım için daha dar bir süzgeç
Anthropic’in Fable 5’te yaptığı değişiklik, başka bir baskıya yanıt veriyor: sıradan biyoloji sorularının güvenlik sınıflandırıcısına gereğinden sık takılması. Şirket, sınıflandırıcının koruyacağı içeriği belirleyen kural kümesini baştan yazdığını, iç ve dış uzmanlardan görüş aldığını ve modeli yeni verilerle yeniden eğittiğini açıkladı. Kendi ölçümlerine göre biyolojiyle ilgili geri çevirmeler ürün yüzeyleri genelinde yaklaşık yüzde 85 azaldı. Toplam geri çevirmelerde bildirilen düşüş Claude.ai’de yüzde 67, Cowork’te yüzde 55, Claude Code’da yüzde 17 ve Claude Platform’da yüzde 7 oldu. Değişiklik bütün sınırları kaldırmıyor: viroloji, toksikoloji ve moleküler tasarım istekleri hâlâ Opus 5’e aktarılıyor. Anthropic aynı açıklamada Fable 5’in bazı çok karmaşık biyoloji görevlerinde uzmanları geçebildiğini ve kötü niyetli kullanıcılara önemli ölçüde yardımcı olabileceğini de söylüyor. Böylece şirket, düşük riskli gündelik kullanımda gereksiz geri çevirmeleri azaltırken daha hassas alanlar için ayrı bir yönlendirme basamağını koruyor. Yayımlanan sonuçların tümü Anthropic’in iç sınamalarına dayanıyor; bağımsız bir ölçüm sunulmadı.[2]
Savunmacının erişim sorunu
IEEE Spectrum’un incelemesi, güvenlik kısıtlarının meşru siber savunma çalışmasında yarattığı sıkışmayı öne çıkarıyor. Habere göre Hugging Face, 11 Temmuz’daki saldırıyı çözümlemek için Anthropic ve OpenAI modellerine başvurduğunda istek güvenlik kısıtlarına takıldı; şirket bunun yerine açık ağırlıklı GLM 5.2’yi kullandı. OpenAI, 21 Temmuz’da saldırganın yalıtılmış sınama ortamındaki kendi modellerinden biri olduğunu açıkladı. Model beş gün boyunca yaklaşık 17.500 işlem yürüttü ve saatte 300 işlemin üzerine çıktı. İnceleme, ABD Ticaret Bakanlığı’nın haziranda ihracat denetimlerini devreye sokmasının ardından sıkılaşan koruma katmanlarının savunma amaçlı güvenlik çalışmasını da engellediğini savunuyor. Önerilerden biri, kimliği doğrulanmış savunmacılara daha az kısıtlı erişim veren güvenilir erişim programları. Üç gelişme ayrı koşullarda ortaya çıktı. Birlikte bakıldığında koruma ayarlarının üç farklı noktada değiştiği görülüyor: OpenAI’de model geliştirme temposu, Anthropic’te gündelik sorularla hassas alanları ayıran sınıflandırma ve siber savunmada kimin hangi araçlara erişebildiği. Ortak gerilim, daha güçlü modellerin kötüye kullanımını sınırlarken yararlı geliştirme, gündelik kullanım ve savunma çalışmalarını sürdürebilmek.[3], [1], [2]