PHRBench, yanlış öncülü düzeltmekle doğru yanıta ulaşmayı ayırıyor
PHRBench, on sekiz dil modelinin sorulara bilerek eklenmiş yanlış bilgileri nasıl ele aldığını izledi. Kimya, biyotıp, fizik ve kod görevlerinde son yanıtın doğruluğu ile yanlış öncülün düzeltilmesi ayrı değerlendirildi. Tek ön baskıya dayanan deneylerde yanlış bağlam bütün modellerin doğruluğunu düşürdü; hatayı düzeltme girişimleri de her zaman doğru sonuca ulaşmadı. Değerlendirme, çok aşamalı sistemlerde yanlış bilginin sonraki yanıtlara taşınmasına odaklanıyor.
Yapay Zekâ··Akşam
Yanlış bağlam yanıt doğruluğunu düşürdü
Önceki bir modelin yanlış bilgisi, sonraki yanıtın öncülü haline gelebiliyor. Linghao Meng ve çalışma arkadaşlarının geliştirdiği kontrollü değerlendirme kümesi PHRBench, bu süreci on sekiz dil modelinde izliyor. Tek ön baskı, 4.820 örnekle kod üretimi, fizik, biyotıp ve kimyayı kapsıyor. Yanlış bağlam, değerlendirilen modellerin tamamında doğruluğu düşürdü.[1]
Kabul etme, kaçınma ve düzeltme ayrı ölçülüyor
Yanıtlar, yanlış öncülü benimseme, etrafından dolaşma ve açıkça düzeltme davranışlarına göre ayrılıyor. Başarılı toparlanma için hem düzeltme hem doğru son yanıt gerekiyor. Bazı model ailelerinde daha büyük modeller daha fazla düzeltme girişiminde bulundu; buna karşılık yanlış bağlam altında doğruluk kaybı da daha yüksek oldu. Düzeltme girişimi yanlış yanıtla sonuçlanabildi.[1]
Her temel soruya doğru bağlam ve tek bir anlam öğesini değiştiren yanlış sürümler ekleniyor. Hatalar, alanın bir kuralıyla çelişiyor, ilgili koşulları değiştiriyor veya geçersiz bilimsel açıklama getiriyor. Görevlerde çoktan seçmeli soruların yanında açık yanıtlar da yer alıyor; değişiklikler cevabı açığa çıkarmayacak biçimde hazırlanıyor.[1]
İstemin özellikleri toparlanmayı tahmin etmeye yarıyor
Ekip, yanıt üretimi başlamadan toparlanmayı tahmin etmek için yapısal ve anlamsal yirmi dört özellik çıkardı. İstem uzunluğu, kurala aykırılık ve hatanın yeri bu deney düzeninde bilgi taşıdı. Bilerek oluşturulmuş görevler, belirli yanlış öncüllere verilen tepkileri ölçüyor; gerçek kullanımdaki genel uydurma bilgi oranını belirlemiyor.[1]