OpenAI, akıl yürütme şeffaflığı kaygıları sürerken, Astra'yı önce siber savunma müşterilerine açtı
OpenAI perşembe günü Astra'yı yayımladı; model önce Daybreak siber güvenlik programındaki müşterilere, bir hafta sonra ücretli planlara ve arayüze açılıyor. Bu sürüm, modelin akıl yürütmesini kendi içinde döngüye sokan ve düşünce zincirini dışarıdan okunmaz kılan teknik yüzünden iki gündür süren güvenlik araştırmacısı tedirginliğinin ardından geldi. OpenAI, sürüm için ek izleme eklediğini söylüyor ama mimarinin kendisine değinmiyor.
Yapay Zekâ··Gece
Astra önce Daybreak müşterilerine ulaşıyor, OpenAI'nin kendi puanlarıyla
TechCrunch, OpenAI'nin Astra'yı perşembe günü yayımladığını, modelin önce Daybreak siber güvenlik programındaki müşterilere açıldığını, Pro, Plus, Enterprise ve Business planları ile API erişiminin ise izleyen hafta devreye girdiğini bildiriyor. Habere göre OpenAI, Astra'yı kendi Sol modelinden ve Anthropic'in Fable modelinden daha yüksek puan aldığı siber güvenlik değerlendirmeleriyle tanıtıyor; ancak bu karşılaştırmayı yapan ve puanları veren tarafın şirketin kendisi olduğunu, bağımsız bir ölçümün yayımlanmadığını da belirtiyor. Genel müdür Greg Brockman, modeli şirketin bugüne kadarki en yetenekli ve kendi ifadesiyle en hizalı modeli olarak tanımlıyor.[1]
İki gün önce araştırmacılar zaten alarm vermişti
TechCrunch ve The Verge, yayından iki gün önce Astra'nın akıl yürütmeyi 'opak yineleme' denen bir teknikle kendi içinde döngüye soktuğunu, bunun güvenlik araştırmacılarının dayandığı okunabilir düşünce zincirini ortadan kaldırdığını bildirdi. TechCrunch, Redwood Research'ten Buck Shlegeris ile Ryan Greenblatt'ın haberi kaygı verici bulduğunu ve yöntemin ölçeklenmesinin buradan sonraki doğal adım olacağı uyarısında bulunduklarını aktardı. The Verge ise The Information'a dayandırarak OpenAI'nin, araştırmacılar akıl yürütmeyi izlemeyi sürdürebilsin diye yöntemin Astra'daki kullanımını sınırladığını, şirketin salı günü yayımladığı blog yazısının ise modeli ek düşünce zinciri izlemesiyle yayına aldığını söylediğini, mimarinin kendisine değinmediğini bildirdi.[2], [3]
Sürüm, kaygı giderilmeden müşterilere ulaşıyor
Astra, güvenlik camiasının kaygısı çözülmeden müşterilere ulaştı. TechCrunch, OpenAI'nin erişimi önce Daybreak programındaki siber güvenlik müşterileriyle sınırlı tuttuğunu -bu da modelin daha geniş kitleye açılmadan önce ek gözetim altında kalmasını sağlıyor- ve Anthropic ile Google DeepMind'ın da aynı yöntemi tartıştığının bildirildiğini aktarıyor. The Verge ise baş bilimci Jakub Pachocki'nin, model yetenekleri arttıkça izlenebilirliğin zorlaştığını kabul ederken Astra'nın hesaplama derinliğinin GPT-4'ün iki katı sınırı içinde kaldığını söylediğini bildiriyor.[1], [2], [3]