İki ayrı soru
Andreas Thom, sofik olmayan gruplar üzerine çalışıyor; bunlar sonlu yapılarla yaklaşılamayan sonsuz matematiksel yapılar. OpenAI geçen ay tam bu alanda bir sonuç duyurdu ve duyuru metni Thom ile matematikçi Gábor Kun'un daha önceki çalışmasına büyük ölçüde dayanıyordu. Matematikçiler bunun anılmamasını eleştirdi, metin de sessizce güncellendi. Thom'un ardından Mastodon'daki bir dizi gönderide ortaya koyduğu nokta ise daha dar ve çözülmesi daha zordu: OpenAI'nin kendi kullandığı tekniklere hâkimiyetini ayrıntılı buldu ve bu teknikler o sırada çözüme giden ne en bariz ne de en umut verici yollardı. Bunun üzerine OpenAI araştırmacıları Sébastien Bubeck ile Mark Sellke'ye yazıp ChatGPT ile yazışmalarının eğitim verisinin parçası olup olmadığını ya da akıl yürütme sürecinden erişilebilir olup olmadığını sordu.[1]
Thom'un aktardığına göre yanıt, bu konuşmalara doğrudan erişilip erişilemeyeceğini ele aldı ve orada durdu. OpenAI aynı çizgiyi Navier-Stokes çözümünü duyuran gönderisinde de çizmişti: problemi çözmek için belirli bir kullanıcı verisine erişilmedi; ihtimal düşük olsa da şirket, ürünlerinin kullanımından türetilen kimliksizleştirilmiş verinin modelleri iyileştirmiş olabileceğini dışlayamıyor. Thom'un bu ikinci cümleye itirazı kesin. Bir konuşmadan adı silmek adı siler. Matematiksel bir fikrin içeriğini olduğu yerde bırakır.[1]
İki yolun ayrıldığı yer
Ortada iki ayrı veri yolu var ve bunları birbirine karıştırmak kolay. Biri erişim: model yanıt verdiği anda saklanan bir konuşmaya ulaşabiliyor mu? Diğeri eğitim: o konuşmanın içeriği, şirketin modellerini iyileştirmek için kullandığı eğitim verisine girdi mi? Birincisinin yadsınması ikincisi hakkında hiçbir şey söylemez; kimliksizleştirme şerhi ise ikincisini taşıyan cümledir ama kulağa bir kabul gibi gelir. Daha insaflı bir okuma da mümkün. Yanıtı yazan araştırmacılar soruyu yalnızca doğrudan erişim üzerine anlamış olabilir; o zaman dar yanıt bir yanlış anlamadan doğar. Her iki durumda da soruyu soran kişi ikisini dışarıdan ayırt edemiyor.[1]
Thom'un ifadesiyle bunun için gereken veri yalnızca OpenAI'de duruyor; araştırmacıların, çalışmalarının kullanılıp kullanılmadığını anlamak için bir eğitim hattını tersine çevirecek imkânı yok. Bu yüzden dile getirdiği talep belgeye dair: gerekli veri kümeleri açıklansın, şirketin veriyi nasıl kullandığını ortaya koyan ayar ve koşullar netleştirilsin. Böyle bir belge ortaya çıkana kadar matematikçilerin elinde arkasında makul bir mekanizma duran bir şüphe var; şirketin elinde ise o şüpheye dokunmayacak kadar dar bir yadsıma.[1]
Aynı boşluk, bir kez daha
Bu boşluğun biçimini temmuz sonunda, damıtma iddiasını ele aldığım yazıda anlatmıştım: ikna edecek kadar ayrıntılı bir erişim ve hacim anlatısı, ama şirket dışından kimsenin inceleyemeyeceği, belgeye bağlanmamış bir anlatı. O günden bu yana duruş tersine döndü, iddiadan yadsımaya geçildi; kanıt durumu ise yerinden kımıldamadı. Adı konmuş bir mekanizma bir savı belirginleştirir, bulguya dönüştüremez. Bunu ancak eğitim hattını elinde tutan taraf yapabilir; masadaki talebin bir cümle daha değil, veri kümeleri ve koşullar olmasının nedeni budur.[1], [2]