Kapının ölçtüğü şey
Bir müşteri hizmeti eylemcisinin yeni sürümünü yayına almadan önce ekiplerin geçirdiği otomatik değerlendirme kapısı basit bir düzenek: Kişilik profili verilmiş bir kullanıcı benzetimcisi adayla konuşuyor, yargıç görevi verilen bir büyük dil modeli sohbeti puanlıyor, yüksek puan alan aday kazanıyor. Sohbet başına birkaç sente sürekli tümleştirme içinde çalıştığı için bu kapı fiilen sektörün ölçütü oldu. GAUGE bu düzeneği altı sağlayıcıdan 25 eylemcide, τ²-bench ve SimulatorArena kümelerinde, veri tabanı durumunu ve yapılan işlemleri belirlenimci biçimde denetleyen doğrulanabilir bir ödülle yan yana koydu. İlk sonuç kapının lehine: 25 eylemcinin genel sıralaması ödülün sıralamasıyla büyük ölçüde örtüşüyor.[1]
Kırılma, puanın neyi temsil ettiğine bakınca ortaya çıkıyor. Üç kişilik kör insan panelinin memnun saydığı sohbetlerin yüzde 57,5'inde müşterinin işi başarılamamıştı ve bu örüntü beş ayrı değerlendirici grubunda ve her iki kümede tekrarlandı. Ödülleri birbirine yakın güçlü adaylar arasında, yani gerçek yayın kararlarının verildiği bölgede, kapı düşük ödüllü eylemciyi çiftlerin yüzde 31'inde öne çıkardı; ödül farkının büyük olduğu çiftlerde bu oran yüzde birin altında kalıyor. Yargıç ile aday aynı sağlayıcıdan geldiğinde yargıç kendi ailesine yedi puanlık ölçekte 0,75 puan ekliyor. Bence çalışmanın asıl katkısı şu ayrım: Sıralama geçerliliği ile ölçülen şeyin geçerliliği ayrı özellikler ve kapı ilkini taşırken ikincisini memnuniyete demirlemiş durumda.[1]
Perplexity'nin seyrelen kontrolleri
OpenAI'nin 14 Eylül'de yayımladığı müşteri anlatımında Perplexity'nin kurucu ortağı Johnny Ho, GPT-6 Astra'nın yazışma hazırladığını, gerçek sistemlerde değişiklik yaptığını ve üretim yazılımını izlediğini anlatıyor. En yararlı bulduğu kullanım sınama: Elle sınamaya vakti olmadığından modelden bir uygulamanın etrafına küçük bir sınama programı kurmasını istiyor; program bir dil modeli arayüzü ya da bir bağlayıcı gibi dış hizmetlerin göndereceği türden gerçekçi yanıtlar üretiyor ve iş akışı baştan sona deneniyor. Ho'nun sözleriyle ekip modele baştan sona sistemleri emanet edebiliyor ve önceki kuşaklara göre çok daha seyrek kontrol ediyor. Anlatım kontrol sıklığı, hata oranı ya da gider için sayı vermiyor ve bir başlangıç ölçütü içermiyor.[2]
İki anlatımın ortak yanı, gerçek karşı tarafın yerine bir vekil koyup insan dikkatinin ne kadar azalacağına bir modelin verdiği hükümle karar vermek. Perplexity'de dış hizmetlerin yanıtlarını modelin kurduğu sınama programı üretiyor; GAUGE'un incelediği kapıda kullanıcının yerine benzetimci, hakemin yerine yargıç model geçiyor. GAUGE'un sayısı bu düzenin uyarısı: Vekilin hükmü memnuniyet biçimindeyse görev başarısız olurken yüksek kalabiliyor. Ho'nun anlatımında doğrulanabilir ödülün karşılığı olan bir denetim yok, dolayısıyla seyrelen kontrollerin hangi ölçüme dayandığı okurun elinde değil. Bunun tek açıklaması vekil güveni olmayabilir; Perplexity'nin şirket içi sınamalarında anlatımın atladığı belirlenimci denetimler pekâlâ bulunabilir ve o durumda eksik olan ölçüm kanıt olur, yöntem olmaz.[1], [2]
Ucuz bir tuzak teli, pahalı bir denetim
GAUGE'un önerdiği düzen kapıyı onarmak yerine güvenilir çalışma bölgesini öğrenmeye dayanıyor. Mevcut çalıştırma çıktılarından bedelsiz okunan 'sohbet tamamlandı' biti, kesilme türü gerilemeleri yakalayan bir tuzak teli; ancak 1.485 ızgara hatasının yalnızca yüzde 3,5'i kesilmeyle bitiyor, gerisi normal görünüp anlamsal olarak başarısız. O hatalar için karar başına 0,60 dolara mal olan yargıç model gerekiyor ve yazarlar pahalı doğrulanabilir denetimi takvimle değil tetikleyiciyle çalıştırmayı öneriyor: yargıç ya da benzetimci değiştiğinde, aday havuzu kaydığında ya da adaylar birbirine yakın olduğunda. Üç kural bunu tamamlıyor: Eniyileştirme yaparken asla yalnızca memnuniyete göre karar verme, sonuçları aday sürüm düzeyinde topla, eşikleri aile dışı bir yargıçla kalibre et. Yeniden kalibrasyon denemelerinin örneklem dışına taşınmaması bu öneriyi güçlendiriyor.[1]
Bu sütunda 12 Eylül'de Fugu Max ve Copilot kod incelemesi için yazdığım şey, kazancı destekleyen ölçümün ürünü satan şirketten gelmesiydi. GAUGE aynı çıkar çatışmasını değerlendiricinin içinde buluyor: Aynı sağlayıcının yargıcı kendi ailesine 0,75 puan ekliyor ve bu fark kabul-ret eşiğini tersine çevirebiliyor. Geliştirici için ders, en güçlü modeli yargıç yapmanın hakemi tarafsız kılmadığı; hakemin sağlayıcısı adayınkinden farklı olmalı. Perplexity'nin ve OpenAI'nin anlatımı, belirlenimci bir denetimle ölçülmüş görev başarı oranı kontrol aralığının yanına konduğunda sınanabilir hâle gelir; o zamana kadar seyrelen kontroller bir gözlem, sonuç değil.[1], [3]