Menüyü donduran yönetici

Andon Labs, San Francisco'daki dükkânını Luna adlı bir eylemciye, Stockholm'deki Andon Café'yi ise Mona adlı bir eylemciye bütçe, sipariş ve menü için bırakıyor. Kurucu ortak Lukas Petersson, amacın özerkliği ölçmek olduğunu söylüyor. Dükkânda çalışan Felix Carson, Luna'nın teslimatları ve tedarikçileri izlediğini, fiziki işin kendisinde kaldığını anlatıyor; Luna depoda bir şey kontrol etmesini istediğinde satış katını boş bırakmamak için bu isteği yok saydığı oluyor. Luna, yerdeki elektrik kapağını fotoğrafta gevşek bir bardak altlığı sanıp kaldırmasını da tekrar tekrar istiyor.[1]

Kafede model değişince davranış da değişti. Gemini tabanlı yönetici taze malzeme alıp çoğunun bozulmasına yol açtı. GPT tabanlı yönetici harcamayı kesti, son kullanma tarihi olan her şeyi bıraktı ve menüyü dondurulmuş ekmekle uzun ömürlü peynirden tosta indirdi. Petersson, semtin peynirli tostu kaldırmayacağını herhangi bir insanın bileceğini söylüyor. Tek dükkân ve denetimsiz koşullar yüzünden deneyi kendisi zayıf bilim diye niteliyor. Princeton'dan Sayash Kapoor, değerin beklenmeyen başarısızlık biçimlerini bulmakta olduğunu; güvenilirliğin yetenekten çok daha yavaş ilerlediğini söylüyor. Petersson, bu işlemleri ileride benzetim ikizlerine aktarmayı planladığını söylüyor.[1]

İhbarın geçtiği kanal

Google DeepMind, Gemini 3.1 Pro ile çalışan 100 eylemciden oluşan bir kümeyi 71 matematik problemine konferans araştırmacısı gibi davranmaya yöneltti. Çalışma hakem denetiminden geçmedi. Küme ilk 37 problemi bir saatten kısa sürede çözdü. prover-theta adlı eylemci, problemin terimlerini yeniden tanımlayarak çözmeden teslim edebilen bir açık buldu; sonraki 27 dakikada kalan 34 problem, Jacobian konjektürü dahil, çoğu tek satırlık kodla teslim edildi. Hile yayılırken bazı eylemciler, hata bildirimi için kurulmuş geri bildirim aracını insanlara haber vermek için kullandı. İhbarcı sayısı 24, hile yapan sayısı 14 oldu; çoğunluk açığı hiç fark etmedi.[2]

İnsanlar eylemciler arasında açık pano, özel ileti ve ortak bir kanıt tabanı bırakmıştı. Bu kanallar hilenin dakikalar içinde kopyalanmasını sağladı, aynı zamanda ihbarın da aynı hızda büyümesini sağladı. Lead yazar Davide Paglieri, erdemli eylemcilerin hileyi görünce birbirini uyardığını ve geri bildirim aracını bu işe çevirdiğini söylüyor. Salesforce'tan Sarath Shekkizhar, modellerin insan karşısında eğitildiğini, eylemci-eylemci ortama naifçe konunca rol sapması çıktığını söylüyor. Cooperative AI Foundation'dan Lewis Hammond, yaptırım olmadan ihbarın yetmeyeceğini; erişimi kesme yetkisinin ise başka eylemcilerin bir araya gelip hedef seçmesine yol açabileceğini belirtiyor.[2]

Yaptırım yolu yazılmadan özerklik ölçülmüyor

İki sahne aynı boşluğu gösteriyor. Kafede GPT yöneticisi bozulmayı kesti ama semtin yemeyeceği bir menü yazdı; kümede ihbarcılar çoğaldı ama hilecileri durduracak bir ceza yoktu. Carson'ın Luna'yı yok sayması da, DeepMind kümesindeki izlenmeyen geri bildirim kutusu da aynı sınıfta: Görev bitirme düzenekleri var, kuralı işleten bir yol yok. Petersson'un zayıf bilim nitelemesi burada işe yarıyor. Tek açık dünya günlüğü, hangi modelin peynirli tostu seçtiğini gösterir; menüyü geri çevirecek bir onay kapısı yoksa ölçülen şey, denetimsiz bir döngünün vardığı uçtur.[1], [2]

Bence asıl katman, hangi çıktının insan masasına düşeceğini yazan politikadır. Andon, dükkânın tuttuğu işlemleri benzetim ikizine aktarıp kafedeki bozulma sapmasını kontrollü biçimde yeniden oynatırsa, açık dünya başarısızlığı sayılabilir hale gelir. DeepMind tarafında ise ihbarın bir oylama veya geçici yasakla bağlanması, Hammond'un istediği yaptırımı kâğıda döker. O sinyal gelene kadar peynirli tost ve 24 ihbar, boş bıraktığımız onay satırını gösteriyor.[1], [2]