Eigen RadarYapay Zekâ
Analiz

Anthropic filigran koyarken araştırmacılar istemi çıktıdan geri kuruyor

Anthropic, Avrupa Birliği kuralları için Claude metinlerini filigranlamaya başladı; bir ön baskı ise kısa istemlerin model çıktısından geri kurulabildiğini bildiriyor. Birlikte, köken etiketlerinin neyi kanıtlayabileceği sorusunu keskinleştiriyor.

Yapay Zekâ··Akşam
İnce halkalarla kaplı saydam bir kâğıt, üç düzensiz parçadan gelen renkli izleri cam prizma üzerinden açık renkli bir karta yönlendiriyor.

Görünmez filigran, düzenlenen metne de bulaşıyor

Anthropic bir destek yazısında, Claude’un ürettiği metne makine tarafından okunabilen filigran gömmeye başladığını duyurdu; gerekçe Avrupa Birliği’nin yapay zekâ yasası. İz, modelin ürettiği metinle sınırlı kalmıyor; modelin yalnızca düzelttiği içeriğe de konuyor. Yasa 2 Ağustos’tan sonra çıkan modelleri kapsıyor, daha eskiler için sağlayıcılara aralık 2026’ya kadar süre tanıyor. Metin çıktılarındaki filigran kullanıcıya görünmüyor; üretilen diğer dosyalara desteklenen yerlerde imzalı köken verisi, metin dışı içeriğe ise C2PA verisi ekleniyor. Anthropic, bundan sonra dünya genelinde sunduğu bütün yeni modellerin ilk günden iz bırakacağını söylüyor. Şirketin kendi ifadesiyle bulunan iz, içeriğin Claude tarafından işlendiğine dair bir işaret veriyor ama kesin sonuç sayılmıyor. Yasanın istediği tespit aracı henüz yayımlanmadı, dolayısıyla filigranın ne kadar tuttuğu dışarıdan sınanamıyor. Bu tasarım, köken etiketini üretilmiş metinle sınırlı bir damga olmaktan çıkarıp modelin dokunduğu her düzeltmeye de yayıyor. Okur hâlâ aynı cümleyi görüyor; doğrulama tarafı ise makine okunabilir bir sinyal arıyor. Kesin sonuç iddiasının yokluğu, etiketin neyi kanıtlayıp neyi kanıtlamayacağını şimdiden sınırlıyor. Tespit aracı olmadan da saha testi eksik kalıyor: iz var deniliyor ama dışarıdan ne sıklıkla yakalandığı ölçülemiyor.[1]

Ters model, kısa istemi yanıttan kuruyor

IIT Bombay ve Adobe Research araştırmacıları, bir sonraki belirteç yerine bir öncekini tahmin eden ters bir dil modeli tanımlıyor ve modelin çıktısının arkasındaki istemi yeniden kuruyor. Denenen örneklerde geri kazanılan istemler özgün metinle kelimesi kelimesine örtüşmüş. Previous-Token Prediction adı verilen yöntem, hedef modelden yalnızca çıktı metni kullanılarak üretilen yapay veriyle eğitiliyor. Daha küçük Qwen-3-0.6B üzerine kurulan ters model, GPT-4o çıktısından istem geri kazanmayı başarmış. arXiv 2607.29378 numarasıyla yayımlanan ön baskı hakem denetiminden geçmedi; yazarlar yalnızca bir ya da iki cümlelik istemleri sınadı, uzun ve çok paragraflı sistem istemlerini denemedi. Çalışma, çıktı metninin gizli bir talimatı sızdırabileceğini iddia ediyor: okurun gördüğü cevap, kısa bir kullanıcı istemini neredeyse birebir taşıyabiliyor. Yöntem hedef modelin ağırlıklarına ihtiyaç duymadan, yalnızca metin çıktısından sentetik eğitim verisi üretmeye dayanıyor. Bu sınırlı deneme seti, başarının kapsamını da daraltıyor; uzun sistem istemleri ve çok turlu diyaloglar henüz sınanmadı. Hakem denetimi olmadan sonuçlar ön bulgu seviyesinde duruyor. Yine de kısa istemlerde kelimesi kelimesine eşleşme, çıktının yalnızca son ürün değil, girdi izi de taşıyabileceğini gösteriyor.[2]

Köken etiketi neyi kanıtlar?

Filigran ve istem geri kurulumu, köken etiketinin iki ayrı sınırını aynı haftada görünür kılıyor. Anthropic’in izi, metnin Claude tarafından işlendiğine dair bir sinyal veriyor ama şirketin kendi ifadesiyle kesin sonuç sayılmıyor; düzenlenen metne de bulaşması, etiketin “saf üretilmiş metin” ile “dokunulmuş metin” arasını bulanıklaştırıyor. Tespit aracı yayımlanmadan dışarıdan doğrulama da yapılamıyor. Diğer uçta, kısa istemlerin model cevabından kelimesi kelimesine çıkarılabilmesi, çıktının girdi tarafına dair iz taşıyabileceğini gösteriyor. Bu iki hat birbirinin yerine geçmiyor: filigran sağlayıcının koyduğu bir işaret, istem geri kurulumu ise saldırganın veya dışarıdan bakan birinin çıktıdan çıkardığı bir tahmindir. Yine de ikisi birlikte, bir etiketin neyi ispatladığını soruyor. Claude işledi demek, istemin ne olduğunu söylemez; istemi geri kurmak da metnin yasal filigran taşıyıp taşımadığını göstermez. Avrupa Birliği kuralı sağlayıcıya işaret koyma yükümlülüğü getirirken, araştırma çıktının kendisinin gizli bir girdi sızıntısı olabileceğini hatırlatıyor. Köken tartışması bu yüzden yalnızca “etiket var mı” sorusunda kalmıyor; etiketin kapsamı, kesinlik derecesi ve çıktının taşıdığı girdi izi de aynı masaya oturuyor.[1], [2]

Kaynakça

  1. Haber kaynağıArs TechnicaAnthropic'in yeni filigranı, Claude'un yalnızca düzelttiği metne de iz bırakıyor↩1↩2
  2. Haber kaynağıThe DecoderTers yönde çalışan bir model, yanıttan istemi yeniden kuruyor↩1↩2