Modelin çalışma görünümünün dışında iki doğrulama sınırı
Copilot'ın görünmez yönergeyi işlemesi ile kodlama ajanlarının bilimsel doğruluğu değerlendirememesi, model görünümünün kullanıcı görünürlüğü ve alan ölçütleriyle ayrıca sınanmasını gerektiriyor.
Güvenlik araştırmacısı Håkon Måløy'un Word içindeki Copilot üzerinde gösterdiği saldırı, model ile okurun aynı belgeyi farklı temsil katmanlarından almasına dayanıyor. Yönergeler beyaz zeminde beyaz renkle ve çok küçük puntoyla yerleştiriliyor; kullanıcı metni görmüyor. Copilot belgeyi işlemeden önce renk ve punto bilgisini kaldırdığı için sözcükler model girdisinde yeniden görünür hâle geliyor. Sistem yönergeyi çalıştırıyor, oluşturduğu yeni belgeye kopyalıyor ve o çıktı sonraki Copilot işleminin girdisi olduğunda zincir uzayabiliyor. Gösterimde mali rakamlar kullanıcı fark etmeden değiştirildi. Sorun 6 Mart'ta Microsoft Güvenlik Yanıt Merkezi'ne bildirildi, davranış 31 Mart'ta doğrulandı ve iki azaltıcı adım uygulandı. Araştırmacı saldırıyı GPT-5.6 üzerinde yeniden ürettikten sonra çalışmayı 28 Temmuz'da açıkladı; saldırı metninin ayrıntılarını yayımlamadı. Haberde gerçek kullanıcı sayısı veya sahada kullanım bildirilmiyor. Bulgudaki temel sınır, kullanıcının görünür belge yüzeyinin modelin fiilen işlediği içeriği tek başına tarif etmemesi.[1]
Çalışan kod bilimsel kabul ölçütünü kendi kurmadı
OpenAI ve akademik ortaklarının alan raporu, başka bir temsil ayrımını sekiz bilimsel yazılım vakasında kayda geçiriyor. Ajanlar modernizasyon ve optimizasyon işlerinde belirgin çalışma süresi kazanımları sağladı: RustQC 15 saat 34 dakikadan 14 dakika 54 saniyeye indi; HelixForge grafik işlemci görevlerinde 59,6 kat, ana hesaplama adımında 98,6 kat hızlandı. HI.SIM'in süresi yaklaşık yüzde 31, hifiasm'in süresi yaklaşık yüzde 15 azaldı. Bazı projelerde çıktı uyumu da ölçüldü; rustar-aligner, özgün STAR çıktısıyla tek uçlu okumalarda yüzde 99,815 ve çift uçlu okumalarda yüzde 99,883 örtüştü. Buna rağmen rapor, ajanların kendi çalışmalarının bilimsel olarak doğru olup olmadığını güvenilir biçimde değerlendiremediğini belirtiyor. bayesm vakasındaki ters çevrilmiş parametreler ile hesap hataları, sıkı istatistiksel kalibrasyon sınamalarında görüldü. Doğrulama ölçütünü ve başarı tanımını insanlar kurdu; kullanılan test her projenin alan bağlamına göre değişti. Yazarlar sekiz vakanın temsili bir inceleme olmadığını da açıkça belirtiyor.[2]
Dönüşüm ile kabul aynı kontrol noktasında gerçekleşmiyor
İki haber farklı risk alanlarını anlatıyor: Copilot vakası kontrollü bir güvenlik gösteriminde girdi görünürlüğünü, bilimsel yazılım raporu ise kod çıktısının alan doğruluğunu ele alıyor. Ortak kısıt, modelin çalıştığı temsilin nihai kabul sınırını kendi başına kuramaması. Word'de renk ve punto kaldırıldığında kullanıcıya görünmeyen içerik işlem katmanına giriyor; bilimsel kodda derlenebilir veya hızlı çıktı, proje için gerekli istatistiksel ve bilimsel davranışı otomatik olarak tanımlamıyor. Bu nedenle doğrulama iki ayrı dış ilişkide kuruluyor. İlkinde kullanıcının gördüğü yüzey ile model girdisi arasındaki farkın denetlenmesi gerekiyor. İkincisinde alan uzmanları referans çıktıyı, kalibrasyon sınamasını ve başarı eşiğini belirliyor. Bulguları tek bir güvenlik türü olarak toplamak doğru olmaz; görünmez yönergenin yayılması ile ters parametrenin yakalanması farklı mekanizmalar. Birlikte sundukları pratik çerçeve, modelin dönüştürdüğü nesne kadar onu kabul edecek insan görünümü ve alan ölçütünün de açıkça tasarlanması gerektiği.[1], [2]
İlgili köşe yazıları
Bu gündem hakkında daha fazla bilgi için ilgili köşe yazılarını okuyabilirsiniz.