Adımlar çoğaldı, ölçülen şey değişmedi

Atria Dawn Preview modelini geliştiren ekip, 56 katılımcının 700’ü aşkın görev günlüğünü ve kullandıkları ajanların izlerini inceledi. Dört hafta boyunca insan girdisi başına ortanca ajan eylemi 11’den 28,5’e çıktı. Bu oran, her insan yönlendirmesinin ardından ne kadar işlem yapıldığını anlatıyor. Bir ajanın araştırma hedefini seçip seçmediğini ya da önerdiği yöntemi kimin onayladığını tek başına söylemiyor. Çalışmanın kendi ayrımı bu yüzden değerli: üretim adımlarını karar noktalarından ayırıyor.[1]

Bu ayrım özellikle uzun ajan zincirlerinde gerekli. Aynı insan kararı daha fazla araç çağrısı ve ara çıktı doğurabilir; oran yükselirken yetki dağılımı yerinde kalabilir. Alternatif bir okuma da mümkün: ekip üyeleri seçim hakkını kâğıt üzerinde tutup önlerine gelen seçenekleri ayrıntılı incelememiş olabilir. Günlüklerde son kararı kimin verdiği görülür; o kararın hangi bilgiyle ve ne kadar dikkatle verildiği aynı ölçüden çıkarılamaz. Atria bulgusu, artan eylem sayısını bağımsız araştırma yeteneğiyle eşitlemeyi güçleştiriyor.[1]

İnsan seçimlerinin sınırı

Yöntem ve parametre kararlarında en yaygın düzen, yüzde 55,4 ile ajanın önerip insanın seçmesiydi. Son yöntem ve parametre kararlarının yüzde 85,5’ini insanlar verdi; hedef ve kapsam için bu pay yüzde 93,4 oldu. Ayrıca tamamlanan 455 yapay zekâ destekli görevin 151’i, katılımcıların kendi değerlendirmesine göre, aynı kapsam ve nitelikte bu destek olmadan yapılamayacaktı. Bu son sayı bağımsız bir verimlilik deneyi değil; katılımcıların kendi işlerine ilişkin karşı olgusal yargısıdır.[1]

Bir sonraki sınama, kararın yalnızca imzasını saymaktan daha ileri gitmeli. Katılımcıya seçeneklerin gerekçesi, sınama sonuçları ve karşıt bulgular gösterildiğinde karar değişiyor mu? Farklı bir ekip aynı görevleri üstlendiğinde ajan önerileri yine seçiliyor mu? Atria’nın tek ekipten gelen günlükleri, iş bölümünü ayrıntılı biçimde görünür kılıyor. Kararın niteliği ve başka laboratuvarlara taşınabilirliği içinse bağımsız ekiplerle, önceden belirlenmiş karar ölçütleriyle yeni bir çalışma gerekiyor.[1]