Eigen RadarYapay Zekâ
Analiz

Atria ajanları daha çok adım attı, son model kararlarını çoğunlukla insanlar verdi

Atria Dawn Preview geliştiricileri yüzlerce görev günlüğünü inceledi. Dört haftada insan girdisi başına ajan eylemi artarken son yöntem ve parametre kararlarının yüzde 85,5’ini, hedef ve kapsam kararlarının yüzde 93,4’ünü insanlar verdi. Bulgular ekibin kendi model geliştirme sürecine ait; uzayan ajan iş akışı bağımsız karar yetkisi anlamına gelmiyor.

Yapay Zekâ··Sabah
İki yazılım geliştirici, ekrandaki iş akışı şemasını birlikte inceliyor.

Ajanlar insan girdisi başına daha çok işlem yapıyor

Fudan Üniversitesi’nden araştırmacıların da bulunduğu ekip, araştırma ve mühendislik işleri için geliştirilen Atria Dawn Preview modelindeki iş bölümünü inceledi. 56 katılımcının 700’den fazla görev günlüğü ile kullandıkları ajanların günlüklerini ele aldı. Görevlerin yüzde 96,5’inde yapay zekâ kullanıldı. Dört hafta içinde insan girdisi başına ortanca ajan eylemi 11’den 28,5’e yükseldi. Ajanlar araç çağırabiliyor, ara çıktıları sınamalarla, ölçümlerle veya kaynak kanıtıyla karşılaştırabiliyordu. İşlem sayısındaki artış iş zincirinin uzadığını gösteriyor; projenin yönünü kimin belirlediğini tek başına söylemiyor.[1], [2]

Hedef ve yöntem kararlarının çoğu insanlarda kalıyor

Yöntem ya da parametre seçilirken en yaygın düzen, yüzde 55,4 ile ajanın seçenek önermesi ve insanın seçmesiydi. Son yöntem ve parametre kararlarının yüzde 85,5’ini insanlar, yüzde 9,2’sini yapay zekâ verdi. Hedef ve kapsamın son kararında insan payı yüzde 93,4 oldu. Ekip, tamamlanmış 455 yapay zekâ destekli görev hakkında da katılımcılara sordu. Katılımcılar bunların 151’ini aynı kapsam ve nitelikte yapay zekâ olmadan yapılamayacak işler olarak değerlendirdi; bu görevler 27 kişiye dağılmıştı. Değerlendirmeler projenin kendi katılımcılarından geldi, farklı laboratuvarlarda yapılmış bağımsız bir deneyden değil.[1], [2]

Kaydedilen güçlüklerin çoğunda insan yardımı gerekiyor

Zorluk kaydı bulunan 588 görevin yüzde 76’sı insan müdahalesiyle ilerledi; yüzde 23’ünde ajan sorunu kendi başına çözdü. İnsanlar çoğunlukla ek bağlam verdi veya gereksinimleri açıkladı, ardından sorunu teşhis edip yöntemi değiştirdi. Görevin tamamen insan tarafından devralınması yüzde 0,7, kısmi elle düzeltme yüzde 3,2 düzeyindeydi. İnsan geri bildirimi sonrasında çıktı değişikliklerinin yüzde 75,4’ünü yine ajanlar yaptı. Ekip, son karar biçimsel olarak insanda kalsa bile uzun bir ajan iş zincirini yakından incelemenin güçleşebileceği uyarısında bulundu. Bunlar, ekibin kendi modelini geliştirirken yaptığı gözlemler; bütün yapay zekâ laboratuvarlarının çalışma biçiminin ölçümü değil.[1]

Kaynakça

  1. Haber kaynağıThe DecoderModel geliştiren ekipte ajanlar yöntem önerdi, kararları insanlar verdi↩1↩2↩3
  2. Haber kaynağıDataistAtria ajanları daha çok geliştirme adımı attı, kararlar insanlarda kaldı↩1↩2