Deneyde tam olarak ne ölçüldü?

Kurulum sade: her eylemci iki anlamsız seçenekten biriyle başlıyor, sırayla diğerlerinin seçimini görüyor ve yeniden seçiyor. Turlar arasında belleği yok, istemlerde çoğunluğa uyma ya da anlaşmaya varma talimatı geçmiyor, ortada doğru bir yanıt da yok. Claude, GPT ve Llama ailelerinden 10 modelde çoğu eylemci yine de daha yaygın seçeneğe kayıyor; küçük farklar büyüyerek bütün grubu tek bir seçimde topluyor.[1]

Araştırmacılar bu kaymanın gücüne 'çoğunluk kuvveti' diyor ve her modelin aynı matematiksel yasaya uyduğunu, aralarında yalnızca tek bir sayının değiştiğini bildiriyor. O sayı bir grubun dağılmadan ne kadar büyüyebileceğini belirliyor: Llama 3 70B için yaklaşık 30, GPT-4o için yaklaşık 80, GPT-4 Turbo için 1.000 dolayında. Claude 3.5 Sonnet sınanan en büyük grup olan 1.000 eylemcide uzlaşmayı koruyor ve deney onun üst sınırına hiç ulaşmıyor.[1]

Sıralama modellerin dil yetenekleriyle birlikte yükseliyor, bu yüzden 'daha yetenekli model daha büyük grupta anlaşıyor' cümlesi kolayca kuruluyor. Ölçülen büyüklük ise bir işbirliği becerisinden çok, görünür bir çoğunluğa bakıp kendi yanıtını ona göre değiştirme eğiliminin şiddeti. Model tek başına daha inatçı olduğunda da aynı sayı aşağı iner ve sıralama bir beceri sıralamasından çok bu eğilimin sıralaması olarak okunur.[1]

Kurulumdan çıkarılanlar

Deney gerçek kararların pek çok özelliğini bilerek dışarıda bırakıyor: doğru yanıt, bellek, ödül, eşitsiz bilgi ve pratik bir sonuç. Gerçek bir işbirliği ise işin bölüşülmesini, karşıdakinin ne bildiğinin anlaşılmasını, ortak bir hedefi ve çoğunluk yanıldığında ona direnmeyi gerektirir. Çalışma bu yeteneklerin hiçbirini sınamıyor ve bunu açıkça belirtiyor.[1]

Bu yüzden sayıların insan gruplarıyla karşılaştırılması dikkat istiyor. Bazı modeller, insanların istikrarlı bir sosyal ağda tutabildiği düşünülen ve kendisi de tartışmalı olan 150 ile 300 kişilik aralığın üzerinde eşgüdüm kuruyor. İnsanlar ilişkiler, dil, kurumlar ve ortak hedefler üzerinden eşgüdüm kurarken buradaki eylemciler yalnızca basit seçimlerden oluşan bir akışı izliyor. Aynı sonuç, daha yetenekli modellerin uzun bir istemdeki çoğunluk örüntüsünü daha güvenilir biçimde izlemesinden de doğabilir; bu durumda ölçülen şey toplumsal bir yetenek yerine bağlamı kullanma becerisi olurdu.[1]

Sayıyı hangi kanıt yerinden oynatır?

Bu köşe, adının çağrıştırdığından daha dar bir şeyi ölçen bir başlık sayısıyla daha önce de karşılaştı: 13 Ağustos'ta SL2T'nin yayımlanan tek puanının, 50'den fazla işaret diliyle eğitilmiş bir modelin tek bir dil çiftindeki başarımını ölçtüğünü yazmıştım. 1.000 sayısı da benzer bir yerde duruyor: kendisini üreten kurulumun içinde doğru, o kurulumun dışında bir yorum.[1], [2]

Sayıyı yerinden oynatacak kanıt belli: aynı çoğunluk kuvveti ölçümünün, doğru yanıtı olan, bellek tutan ve yanlış çoğunluğa direnmeyi ödüllendiren bir görevde yinelenmesi. Böyle bir kurulumda uzlaşma sınırının aşağı inmesini bekliyorum, çünkü orada çoğunluğa uymanın bir bedeli olur. Bağımsız bir ekip 2027 nisanının sonuna kadar bu koşullarda bir ölçüm yayımlarsa, modellerin sıralaması aynı kalsa bile mutlak sınırların bu çalışmadakinden düşük çıkması izlenecek sonuç olacak.[1]

Çalışmanın bugünkü hâliyle gösterdiği şey dar ama işe yarar: eylemci topluluklarının değerlendirilmesi, modelleri tek tek ölçmekle bitmiyor. Ortak bir kod tabanında çalışan eylemcilerin, yalnızca orada zaten yaygın olduğu için verimsiz bir işlevi yeniden seçmesi, bu kurulumun dışına çıkmayı gerektirmeyen bir örnek. De Marzo'nun özetiyle, tek tek uyumlu eylemcilerden oluşan topluluklar salt uyum yüzünden istikrarlı ve topluca sapmış durumlara yerleşebiliyor.[1]