Örnekleme düzeltmesi, birleşik dil modeli politikalarını hedef dağılıma yaklaştırıyor
Tek ön baskı, belirteç olasılıklarını birleştirmekle bütün yanıtlar için hedeflenen dağılım arasındaki farkı inceliyor. Matematiksel sonuç, eşit aday bütçesinde Metropolis–Hastings düzeltmesinin önem örneklemesiyle yeniden seçime göre hedefe daha uzak olmadığını gösteriyor. Çalışma matematik ve konuşma deneyleri de sunuyor. Hedef dağılıma yakınlık, görev başarısı ile genel güvenliğin aynı ölçüde iyileştiğini kanıtlamıyor; bütün adayları üretmenin gideri ayrıca değerlendiriliyor.
Dil modelinin doğruluk ve kısalık gibi hedeflere göre eğitilmiş ayrı politikaları olabiliyor. Bunları üretim sırasında birleştirmek, her tercih için yeniden eğitim yapmadan hedefler arasında denge kurmayı amaçlıyor. Tek ön baskı, sonraki belirtecin olasılıklarını birleştirmenin bütün yanıtlar için istenen dağılımdan neden sapabildiğini inceliyor. Yerel hesaplama, ilerideki devamların toplam olasılığını içermiyor. Bu yüzden tamamlanmış yanıtın ağırlığı, başlangıçta hedeflenenden farklı olabiliyor; yanıt düzeyinde düzeltme ihtiyacı buradan doğuyor.[1]
Matematiksel karşılaştırmada aday bütçeleri eşit
Yazarlar, yanıt üretilirken kaydedilen normalleştirme değerlerinden yararlanan mevcut Metropolis–Hastings düzeltmesini inceliyor. Karşılaştırma yöntemi, bağımsız üretilmiş adaylar arasından önem örneklemesiyle yeniden seçim yapıyor. Matematiksel sonuç, eşit aday bütçesinde düzeltmenin hedef dağılıma uzaklığının, ele alınan dışbükey sapma ölçütleri ailesinde daha büyük olmadığını gösteriyor. Seçim üretimden sonra yapılabiliyor. Her adayı yeniden puanlayacak ek bir ödül modeli gerekmiyor; iki yöntem aynı aday sayısı üzerinden değerlendiriliyor.[1]
Seçilen kısa yanıtın toplam üretim gideri yüksek kalabiliyor
Deneyler, bütün yanıtların sayılabildiği küçük problemlerden Gemma-4-E2B-it modelinin doğruluk ve kısalık uyarlayıcılarıyla üretilen tam yanıtlara uzanıyor. Büyük deneylerde GSM8K matematik soruları ve HH-RLHF konuşmaları kullanılıyor. Konuşma puanları insan değerlendirmesi yerine ödül modelinden geliyor. Seçilen yanıt kısa olsa bile bütün adaylar üretiliyor; toplam gider buna bağlı. İki yöntem de havuzda olmayan bir yanıtı getiremiyor. Hedef dağılıma yakınlık, genel güvenlikten ve her görevde başarıdan ayrı tutuluyor.[1]