Eigen RadarYapay Zekâ
Analiz

O*NET-BENCH, yanıt sıralaması ile kabul ölçümlerini ayrı sınadı

O*NET-BENCH ön baskısı, iş görevlerine verilen yanıtları puanlayan yapay zekâ modellerini çalışanların değerlendirmeleriyle karşılaştırıyor. 33 değerlendirme düzeninde, yanıt sıralamasındaki daha iyi eşleşme ortalama puanların veya kabul oranlarının aynı ölçüde uyumlu olduğu anlamına gelmiyor. Kalibrasyon ortalama yanlılığı azaltırken bireysel farklılıklar sürüyor. İnceleme mevcut anket verisini kullanıyor; çalışan puanlarını nesnel doğruluk değil, eşleşmesi aranan yargı olarak ele alıyor.

Yapay Zekâ··Gece
Bir değerlendirici, masadaki ahşap kiriş ve kolon modelinin metal bağlantısını inceliyor.

Sıralama ile kabul ayrı ölçülüyor

O*NET-BENCH ön baskısı, dil modeli yargıçlarının yapay zekâ yanıtlarını sıralarken çalışanlarla daha iyi eşleşmesine rağmen ortalama puanlarda veya kabul oranlarında daha az uyum gösterebildiğini buldu. Bir ince ayar ailesinde sunum, örnekler ve çıktı biçimi birlikte değiştirildi. Sunumun tek başına etkisi diğer değişikliklerden ayrıştırılmıyor. Çalışma, yanıt sıralamasını ortalama puanlardan ve kabul edilebilir bulunan yanıt payından ayrı değerlendiriyor.[1]

Veri mevcut çalışan anketinden geliyor

Tek ön baskıya dayanan inceleme, mevcut bir anketin 45.796 puanlık sabit örneklemini kullanıyor; yeni insan verisi toplamıyor. ABD’de Prolific üzerinden seçilen katılımcılar, deneyimli olduklarını bildirdikleri mesleklere ait görevleri değerlendirdi. Birden dokuza uzanan ölçekte yedi ve üzeri kabul edilebilir sayıldı. Test bölümündeki 4.501 puan, altı model ailesinden 33 değerlendirme düzeniyle karşılaştırıldı. Çalışanlar ve görev kimlikleri veri bölümleri arasında ayrıldı.[1]

Kalibrasyon bireysel farklılıkları kaldırmıyor

Kalibrasyon, hedeflediği ortalama yanlılığı büyük ölçüde kaldırırken bireysel puanlar arasındaki önemli farklılıklar sürüyor. Her yanıta yalnızca bir çalışan puanı veriliyor; anlaşmazlığın hangi taraftan kaynaklandığı belirlenemiyor. Çalışan yargıları karşılaştırmanın hedefi; nesnel doğruluk olarak kabul edilmiyor. Bazı test incelemeleri keşif niteliğinde ve yanıtların birlikte sunulduğu istemlerde sıralama rastgele değiştirilmiyor. Bulgular bu değerlendirme düzenleriyle ilgili; çalışma iş kaybını ölçmüyor.[1]

Kaynakça

  1. Haber kaynağıarXivO*NET-BENCH, dil modeli yargıçlarında sıralama ile kabul oranının ayrıştığını buldu↩1↩2↩3