Aranamayan arşiv, pekâlâ aranıyormuş
İki yıldır süren telif davasında OpenAI'ın savunma hattı tutarlıydı: eğitim verilerimizi arayamayız, sohbet kayıtlarını taramak teknik olarak külfetli ve kullanıcı mahremiyetine aykırı. Sonra nisan ayındaki ifade tutanağı geldi. Yayıncıların dilekçesine göre OpenAI'ın veri mahremiyeti mühendisi Vinnie Monaco, şirketin telifli gazetecilik içeriği için eğitim verilerinde zaten dahili aramalar yaptığını ve — dava açılmadan önce başlayarak — ihlalin boyutunu ölçmek için yaklaşık 78 milyon anonimleştirilmiş ChatGPT sohbetinden oluşan bir veritabanı kurduğunu anlatmış. Davadan hemen sonra da 'Project Giraffe' adlı araç setinin parçası olan bir 'Bloom' filtresiyle çıktılardaki kopya içerikleri tespit edip kayıt altına almışlar.[1]
Yayıncıların baş avukatı Ian B. Crosby'nin cümlesi olayın özeti: 'OpenAI müvekkillerimizin gazeteciliğini kopyalamanın adil ve yasal olduğuna gerçekten inansaydı, bunu yaptığı gerçeğini saklamazdı.' OpenAI sözcüsü Drew Pusateri iddiaları 'açıkça yanlış' diye reddediyor ve Times'ı kullanıcı mahremiyetini ihlal etmeye çalışmakla suçluyor. Kim haklı, mahkeme söyleyecek. Ama teslim edilen 20 milyon sohbetlik örneklemin, mahkemenin ifadesiyle 'kullanılamaz' kılacak kadar karartılmış olması, güven inşa eden bir görüntü değil.[1]
Nadella'nın 'artık veri' uyarısı: iki kez ödüyorsunuz
Aynı hafta Satya Nadella'nın blog yazısı, güven meselesini medyadan tüm kurumlara genişletti. Nadella'ya göre kapalı model kullanan şirketler zekâ için iki kez ödüyor: 'bir kez parayla, bir kez de o zekâyı işe yarar kılmak için açığa vurmak zorunda olduğunuz tescilli bilgiyle.' Modeller 'artık veriden' öğreniyor — istemlerden, ajanların kullandığı araçlardan ve özellikle model yanıldığında yaptığınız düzeltmelerden. Nadella'nın ironi tespiti de yerinde: interneti serbestçe kazıyarak model eğiten şirketler, sıra kendi modellerinin damıtılmasına gelince kısıtlayıcı sözleşmeler dayatıyor.[2]
Ben görüntü ve medya cephesinden bakıyorum ve iki haberin aynı kapıya çıktığını görüyorum: üretim zincirinin en değerli halkası — gazetecinin arşivi, kurumun düzeltmeleri, sanatçının üslubu — sessizce başkasının modeline sızıyor ve bunun muhasebesini tutan tek taraf, modeli işletenler. 78 milyon sohbetlik o veritabanının varlığını dava sürecindeki bir ifadeden öğreniyoruz; artık verinin nereye gittiğini ise hiç öğrenemeyebiliriz. Şüphecilik mesleki deformasyonum, biliyorum. Ama bu hafta şüphecilere epey malzeme çıktı.[1], [2]