Eigen RadarYapay Zekâ
Analiz

ThinkingBox, eylemcilerin iş sisteminde bıraktığı sonucu sınamaya açıldı

Microsoft ve Hugging Face, 507 iş akışından oluşan ThinkingBox ortamını erişime açtı. Sınama, tamamlandığını söyleyen eylemci yapay zekânın iş sisteminde gerçekten hangi değişiklikleri yaptığını değerlendiriyor. Yalıtılmış araç oturumları, eksik işlemleri ve istenmeyen ek değişiklikleri ayırıyor. Araştırmacılar, 18 modelin görevleri 20 kez yinelediği deneylerde işin bir kez tamamlanmasıyla tutarlı biçimde tamamlanmasını ayrı ele alıyor.

Yapay Zekâ··Sabah
Ahşap masa üzerinde, arka yüzü görünen monitör, bağlı masaüstü bilgisayar, klavye ve fare.

ThinkingBox, eylemcinin işi bitirdiği andaki verileri inceliyor

Microsoft ve Hugging Face, ThinkingBox ortamını makine öğrenmesi araç ve veri kümelerini barındıran Hugging Face üzerinden erişime açtı. Sınama, yazılım araçları kullanarak işlem yapan eylemci yapay zekânın iş sisteminde bıraktığı son durumu inceliyor. ThinkingBox’taki 507 iş akışı perakende, otomobil sigortası, seyahat, dijital bankacılık ve danışmanlığı kapsıyor. Eylemcinin işi bitirdiğine ilişkin yanıtı, sistemde gerçekten yaptığı değişikliklerle karşılaştırılıyor.[1], [2]

Her tekrar, temiz bir başlangıç durumuyla yalıtılmış araç oturumunda yürütülüyor. Kullanıcı benzetiminin özel bağlamı bulunuyor; bilgilerin bir bölümünü ancak eylemci gerekli soruyu sorduğunda paylaşıyor. Değerlendirme, gerekli alan değerlerini, eksik güncellemeleri ve istenmeyen ek işlemleri denetliyor. Görevlerin 477’si yalnızca durum değişiklikleriyle puanlanıyor. Diğer 30 görevde, son yanıta ilişkin ölçütler de değerlendirmeye katılıyor. ThinkingBox’ta perakende için 98, sigorta için 100, seyahat için 104, dijital bankacılık için 104 ve danışmanlık için 101 görev yer alıyor.[1]

Beklemede kalması gereken teslimat şikâyeti kapatılıyor

Geliştiriciler sınamayı, Nashville kentindeki dağıtım merkezinde bekleyen mutfak cihazıyla örneklendiriyor. Benzetimde teslimat 15 gün gecikmiş durumda. Eylemci 9 araç çağrısı yapıp şikâyeti çözülmüş olarak işaretliyor. Oysa görev kuralları şikâyetin beklemede kalmasını gerektiriyor. Eylemci bir dizi araç işlemi yapmış olsa da şikâyetin sistemdeki son durumu yanlış oluyor. Örnekteki müşteri, sınama ortamında oluşturulmuş bir benzetim.[1]

Tekrarlar, görevi tamamlamakla tutarlılığı ayrı ölçüyor

Araştırma ekibi 18 modeli sınadı ve her görevi 20 kez yineledi. Ortak görev kümesinde değerlendirilen 12 model için 121.680 deneme bulunuyor; bunların 79.853’ü başarısız sayılıyor. Ekibin açıklamasına göre başarısız denemelerin yüzde 67,24’ünde süreç temiz biçimde tamamlanıyor, durum değişiyor ve araç hatası görülmüyor. Yanlış değer, istenmeyen ek işlem ve eksik değişiklik sınıfları örtüşebiliyor. Bu değerlendirmede işlemsel hatalar da başarısız sonuçlar arasında tutuluyor.[1]

Ortam, Hugging Face’in etkileşimli sınama ortamları için sunduğu OpenEnv altyapısına bağlanıyor. Farklı görevlerle değerlendirme, eğitim ve deney yapılmasına olanak tanıyor; çalıştırma altyapısı ile veri kümesinin sürüm kimlikleri sabitleniyor. Geliştiriciler, iş akışının doğru tamamlanmasıyla tekrarlanan denemelerdeki tutarlılığı ayrı ayrı ölçüyor. Yayımladıkları sayısal sonuçlar bu ortamda yürütülen deneylere ait; gerçek müşterilerin kullanıma sunulmuş sistemlerle yaptığı işleri izleyen bir saha çalışmasına dayanmıyor.[1]

Kaynakça

  1. Haber kaynağıMicrosoft / Hugging FaceThinkingBox, yapay zekâ iş akışlarını bıraktıkları sonuçla sınamaya açıldı↩1↩2↩3↩4↩5
  2. Haber kaynağıSuperpower DailyMicrosoft, ThinkingBox sınamasını Hugging Face üzerinden açtı↩