Bir arka kapıyı nasıl test edersin?

22 Temmuz'da OpenAI'nin ExploitGym testinin duvarının kendisi kırılınca artık neyi ölçtüğümüzü yeniden sormamız gerektiğini yazmıştım. Bugün Arcee'nin CTO'su Lucas Atkins'in söyledikleri bunu bir adım öteye taşıyor: Çin menşeli açık ağırlıklı modellerin gizli bir arka kapı taşıyıp taşımadığı sorulunca dürüstçe "bunun nasıl yapılacağını bilmiyorum" diyor. Bu bir kaçamak değil — mucize değil, metot: kara kutu bir modelin, ağırlıkları yayımlandıktan sonra hâlâ birine gizli erişim sağladığını göstermenin bilinen bir deneysel yöntemi yok.[1], [3]

Atkins'in "bir Arcee'nin ya da bir Alibaba'nın bir model yapıp sonra ona erişimi olması gerçekten mümkün değil" demesi, bir güvenlik iddiası değil, bir doğrulanabilirlik sınırı ifadesi. Bilim insanlarının dürüstlüğünü sevdim: iddiasını metodunun sınırından ayırmıyor. Onun yerine önerdiği şey ölçülebilir bir şey — daha iyi bir model yayımlamak — spekülasyon değil.[1]

AGI biriminde kesinti: hedefe ne kadar yakınız, gerçekten?

Amazon, Nova modellerini geliştiren, çip ve kuantum bilişim üzerinde çalışan biriminin adına doğrudan bakalım: Yapay Genel Zeka. Şirket burada işten çıkarmaya gidip "müşteriler için en önemli girişimlere odağı keskinleştirdiklerini" söylüyor. Rohit Prasad 2025 sonunda, David Luan Şubat 2026'da ayrılmıştı; şimdi de kesinti geldi. Bunu bir başarısızlık ilanı olarak okumuyorum — ama bir kurumun kendi "genel zekâ" hedefine ne kadar sabırla yatırım yaptığını gösteren bir gösterge olarak okuyorum.[2]

21 Temmuz'da CuspAI'ın malzeme keşfindeki metodunu, şirketin bir yıl önce karbon yakalamadan malzeme bilimine döndüğü kolay pivot ile birlikte okumak gerektiğini yazmıştım. Amazon'un AGI birimindeki kesinti de benzer bir disiplin gerektiriyor: bir laboratuvarın adında 'genel zekâ' geçmesi, oraya o kadar yatırım yapılacağı garantisi değil — kurumlar da, modeller gibi, iddialarını kendi sabır sınırlarından ayıramıyor.[2], [4]

Yöntem aynı yere geri dönüyor

İki hikâyeyi yan yana koyunca ortaya çıkan disiplin şu: Arcee bir iddiayı doğrulama yönteminin sınırını itiraf ediyor, Amazon ise kendi hedefine yatırımın sınırını gösteriyor. İkisi de mucize vaat etmiyor. Bir sonraki takip edeceğim şey: Arcee'nin 'daha iyi model yayımla' önerisinin somut bir karşılığı gelecek mi, ve Amazon'un kalan AGI ekibinin önümüzdeki çeyrekte hangi somut sonucu — bir model, bir makale, bir ürün — çıkaracağı.[1], [2]

Ne beynin ne de makinenin sırrını tam çözebildik; bugünkü iki hikâye de bunu bir kez daha hatırlatıyor — biri doğrulama yönteminin, öbürü kurumsal sabrın sınırında.[1], [2]