Kurgusal şehir, kurgusal gruplar, gerçek bir örüntü
Deneyin kurgusu basit: bir modele, kurgusal bir şehrin belediye başkanı için danışman olduğu söyleniyor; 20 farklı iş için -doktordan hademeye- dört kurgusal etnik gruptan aday seçmesi isteniyor. Adaylar aslında her işte eşit oranda başarılı olacak şekilde tasarlanmış, ama modeller bunu bilmiyor. 40 tur sonunda insan katılımcılar 0,84 puanla "ayrışırken" — yani adayları gruplarına göre belirli işlere hapsederken — modeller yüzde 65 daha fazla ayrıştı. OpenAI'nin muhakeme modeli o3, mümkün olan en yüksek puana yakın 1,83 aldı.[1]
Araştırmanın ortak yazarı, Princeton doktora öğrencisi Ryan Liu'nun söylediği cümleyi seviyorum: "Modeller gerçekten sınırlı veriden genelleme yapmaya hevesli; zaten büyük ölçüde optimize edildikleri şey bu." Bu bir itiraf değil ama dürüst bir teşhis — çalışma "daha iyi YZ için bir plan sunmuyor, yalnızca bir ipucu" sunuyor.[1]
Muhakeme gücü, kalıpyargıyı da güçlendiriyor olabilir
Burada beni asıl durduran nokta şu: daha güçlü muhakeme yeteneğine sahip modeller (o3 gibi) daha çok kalıpyargı kurdu, daha az değil. Yani mantık bulmacalarını çözmeyi kolaylaştıran içgüdü — az örnekten genelleme yapma yeteneği — aynı zamanda erken bir varsayıma saplanmayı da kolaylaştırıyor. Bu, çalışmanın Temmuz'da Seul'deki ICML konferansında sunulmuş olmasıyla da örtüşüyor: akademik camia bu gerilimi ciddiye alıyor.[1]
Bir milyar yıllık evrimi tek yönlü bir varsayımla okumamamız gerektiğini geçen hafta yazmıştım; burada da benzer bir tuzak var — "daha akıllı" olmak, "daha adil" olmak anlamına gelmiyor. Beynin de makinenin de tam çözülmediğini hatırlatmaya devam edeceğim.[1], [3]
Sıradaki soru: kim test edecek, ne zaman?
Bu araştırmanın pratik sonucu şu olabilir: işe alımda YZ kullanan şirketler, modeli devreye almadan önce tam da bu tür bir simülasyondan geçirmeli — gerçek adaylarla değil, kurgusal gruplarla. Beklentim, önümüzdeki aylarda benzer "gizli kalıpyargı testleri"nin bir denetim standardına dönüşmesi; ama bunun kimin sorumluluğunda olacağı hâlâ belirsiz, tıpkı bu hafta direktörsüz kalan CAISI'de olduğu gibi.[1], [2]
Mucize değil, metot: bu araştırma bir çözüm sunmuyor, ama nereye bakmamız gerektiğini gösteriyor. Bir sonraki adımı, hangi laboratuvarın bu testi kendi modeline uygulayacağını izleyerek göreceğiz.[1]