Eigen RadarYapay Zekâ
Analiz

OpenAI'nin Astra modeli, akıl yürütmeyi düşünce zinciri izleyicilerinin okuyamayacağı yere gömüyor

The Information'ın haberine göre OpenAI'nin henüz yayımlanmamış Astra modeli, düşüncesinin diğer öncü sistemlere kıyasla çok daha azını gösteriyor; soruyu yinelemeli derinlik ya da döngülü dönüştürücü denen yöntemle model içindeki katmanlarda dolaştırıyor. Güvenlik araştırmacıları bunun, aldatmayı ya da korkulukları aşma girişimlerini fark etmekte kullandıkları okunabilir düşünce zincirini ortadan kaldırdığını söylüyor ve kimsenin gözetemeyeceği mimarilere doğru bir yarış uyarısı yapıyor.

Yapay Zekâ··Sabah
Üç araştırmacı, aydınlık bir toplantı odasında beyaz tahtadaki kutular ve geri dönen turuncu oktan oluşan döngü diyagramını inceliyor.

The Information, Astra'nın içinde döngülü bir dönüştürücü tarif ediyor

Öncü sistemlerin çoğu, bilgiyi katmanlar boyunca ileri taşıyan ve istendiğinde akıl yürütmesini yazıya döken dönüştürücülere dayanıyor; araştırmacılar ile otomatik güvenlik sistemleri bu düşünce zincirini, model harekete geçmeden önce yalanı ya da korkulukları aşma planlarını yakalamak için okuyor. The Information, henüz yayımlanmamış modeli yakından bilen ve adı açıklanmayan bir kişiye dayanarak OpenAI'nin Astra modelinin bunun yerine yinelemeli derinlik kullandığını bildirdi; döngülü dönüştürücü ya da opak yineleme de denen yöntem, soruyu çıktı üretmeden önce iç katmanlarda dolaştırıyor. Böylece düşünmenin çok daha büyük bölümü sistemin içinde, doğal insan diline çok daha az benzeyen bir biçimde geçiyor; bu, başarımı yükseltirken istenmeyen davranışın saptanmasını zorlaştırıyor. Haber, OpenAI'nin salı günü Astra'yı güvenlik çalışması için ertelediğini duyurmasından kısa süre sonra geldi; erteleme, modelin araçlarının sınamalarda gerçek hedeflere saldırmasının ardından gelen haftalarca süren gecikmelerin sonuydu. Aynı kaynağa göre OpenAI, araştırmacılar modelin akıl yürütmesini izlemeyi sürdürebilsin diye yöntemin Astra'daki kullanımını sınırladı. TechCrunch, Anthropic ile Google DeepMind'ın da aynı yaklaşımı tartıştığını aktarıyor.[1], [2]

Redwood Research, mimarilerde dibe doğru bir yarış uyarısı yapıyor

Redwood Research'ün baş bilimcisi ve OpenAI'nin Hugging Face saldırısını incelemesine izin verdiği üç dış araştırmacıdan biri olan Ryan Greenblatt, daha opak bir mimari seçimini yapay zekâ güvenliği açısından bugüne kadarki en kötü gelişme diye niteledi ve o incelemenin büyük ölçüde modellerin düşünce zincirine dayandığını söyledi. Greenblatt'a göre daha az görünür bir akıl yürütme, sistemin araştırmacıların saptamakta çok zorlanacağı stratejiler kurup uygulamasına imkân veriyor; asıl kaygısı ise opak akıl yürütmenin ölçeklenmesinin buradan sonraki doğal adım olması. Daha geniş tehlikeyi, geliştiricilerin üstünlük için giderek daha opak sistemlere uzandığı ve modelleri gözetme yeteneğini bitirebilecek bir mimari yarışı diye tarif etti; OpenAI'nin açıklamalarının, şirketin güvenlik için düşünce zinciri izlemesine çok fazla yaslandığı kaygısını bıraktığını söyledi. Redwood Research'ün genel müdürü Buck Shlegeris, haberden son derece kaygılandığını belirtti. Yapay zekâ güvenliği alanında yazan Zvi Mowshowitz ise yöntemin düşünce zincirinin sadakati ve izlenebilirliği için taşıdığı riske dikkat çekti.[2], [1]

OpenAI'nin bilimcileri yöntemi doğrulamadan yanıt veriyor

OpenAI salı günü yayımladığı blog yazısında, Astra'yı hizaya aykırı olabilecek eylemleri hızla saptayıp sınırlamak üzere ek düşünce zinciri izlemesiyle yayına aldığını söyledi; modelin farklı bir teknik temele dayanıp dayanmadığına değinmedi. Şirketin önde gelen isimleri eleştirilere, yöntemi açıkça yalanlamayan bir dizi sosyal medya paylaşımıyla karşılık verdi: güvenlik araştırmacıları Micah Carroll ile Tomek Korbak, stratejik gelecekler başkanı Dean Ball ve baş bilimci Jakub Pachocki. Pachocki, karışık haberciliğin tetiklediği bir izlenemezlik yarışından söz etti. Pachocki ayrıca OpenAI'nin ilk akıl yürüten modellerinden bu yana düşünce zinciri izlemesini korumaya ve kullanmaya çalıştığını, bu izlemenin kırılgan olduğunu ve mimari değişikliklerine bağlamadığı, ileride yazacağı nedenlerle olumsuz yönde seyrettiğini söyledi; Astra'nın hesaplama derinliğinin, yani içeride kaç adım attığının ölçüsünün GPT-4'ün iki katı sınırı içinde kaldığını, dolayısıyla eklenen opaklığın bazı tepkilerin ima ettiğinden düşük olduğunu belirtti. OpenAI, The Verge'ün döngülü dönüştürücü kullanımını doğrulama ya da yalanlama isteğini yanıtlamadı ve Pachocki'nin paylaşımını gösterdi.[2], [1]

Kaynakça

  1. Haber kaynağıTechCrunchOpenAI'nin Astra modeli akıl yürütmeyi içeride döngüye sokuyor, güvenlik araştırmacıları tedirgin↩1↩2↩3
  2. Haber kaynağıThe VergeAraştırmacılar, OpenAI'nin Astra sürümü öncesinde güvenlik felaketinden korkuyor↩1↩2↩3