Tasarım ne ölçtü?

Yazarlar BBQ ve SafetyBench başarım kümelerinden katmanlı örneklemeyle 401 istem seçti ve her istemi üç kez çalıştırarak toplam 4.812 yanıt topladı. Karşılaştırılan iki erişim yolu, ChatGPT sohbet arayüzü ile OpenAI'nin API'si; her ikisi de web araması açıkken ve kapalıyken denendi. Ölçülen şey yalnızca doğruluk olmadı: yanıt tutarlılığı, yanıt metni benzerliği, kaynak dayanağı ve yanıt vermekten kaçınma davranışı da değerlendirildi.[1]

Sonuçlar tek bir yönde toplanmıyor. Arama kapalıyken sohbet arayüzü her iki başarım kümesinde de API'den daha düşük doğruluk verdi. Aramanın açılması doğruluğu 8 puana varan oranda düşürdü ve bir kümede hangi erişim yolunun önde olduğunu tersine çevirdi. Aynı istemin yinelenen çalıştırmaları, istemlerin yüzde 21'ine varan bölümünde tutarsız yanıt üretti; iki yol yanıtlarını farklı kaynaklara dayandırdı ve yanıt vermekten kaçınma davranışı da aralarında tutarsız çıktı.[1]

Sonucun taşıyamadığı yük

Bu bir denetim çalışması ve kapsamı dar tutulmuş: tek bir model ailesi, iki başarım kümesi, bir sağlayıcının iki erişim yolu. Başka sağlayıcılarda etkinin yönü ve büyüklüğü hakkında bir şey söylemiyor. Düşüşün kaynağı da ayrıştırılmış değil; aramanın açılmasıyla gelen sayfaların içeriği, getirme adımının seçimi ve arayüzün çevresindeki yönlendirme metinleri aynı anda devreye giriyor. En güçlü rakip açıklama, hatanın arama özelliğinden çok getirilen sayfaların taşıdığı yanlış bağlamdan gelmesidir.[1]

Bu iddiayı bir basamak yukarı taşıyacak tasarım bellidir. Aynı yordamın ikinci bir sağlayıcının sohbet yüzeyi ve API'si üzerinde, önceden bildirilmiş bir çalışma planıyla ve arama sırasında getirilen sayfalar saklanarak yinelenmesi gerekir; o zaman erişim yolunun etkisi ile getirilen içeriğin etkisi ayrışır. Çalışma hakem değerlendirmesinden geçmedi. Bu haliyle güvenlik değerlendirmelerinin nasıl raporlanması gerektiğine dair bir uyarı olarak okunabilir, model ailesi hakkında genel bir yargı olarak okunamaz.[1]