Tek el, on iki görev, tek çizelge
T-Rex'in arkasındaki Berkeley çalışması, algılayıcılarla donatılmış tek bir elden 200'den fazla ev eşyası üzerinde 100 saatlik yüksek nitelikli dokunma verisi topladı ve 12 görevde yüzde 65 başarı bildiriyor; bu, görme, dil ve eylemi birleştiren en iyi modelin neredeyse iki katı. Görevler gözde canlanacak kadar somut: ampul takmak, diş macunu sürmek, yumurta aktarmak. Trevor Darrell'ın çerçevesi, el becerisi gerektiren işlerin çoğunu insanların gözleri kapalı yapabildiği yönünde; dokunma verisi toplamak için yerinde bir gerekçe. Veri tek bir robot donanımından geliyor ve iddia da tam orada duruyor.[1]
En iyi görme-dil-eylem modelinin iki katına çıkmak, tek bir laboratuvarın düzeneği içinde yapılmış bir karşılaştırma. Temel model aynı elde duruyor, aynı 12 görevi çalışıyor ve aynı grup tarafından puanlanıyor. Bu da kazancı, o düzenekte dokunmanın ne kattığı konusunda bilgilendirici, başka bir düzenekte ne kattığı konusunda sessiz kılıyor. Yüksek sesle söylenmesi gereken bir başka okuma var: 12 görev, temasın en çok işe yaradığı yerlerden seçilmiş olabilir; bu da ölçümde hiçbir hata olmadan aradaki farkı büyütür.[1]
Gövdeyi değiştiren grup
Diğer üç çalışma başka biçimde büyüyor. Chengbo Yuan'ın yönettiği Tsinghua Üniversitesi ekibi, açık veri kümelerinden 21 algılayıcı türünü ve birden çok robot gövdesini kapsayan 3.000 saatten fazlasını birleştirdi, her algılayıcının çıktısını insan eli şablonuna oturan ortak bir biçime çevirdi ve ortaya çıkan model daha önce görmediği gövdelerde de çalıştı; ekip şimdi daha büyük bir veri kümesi için 80 kurumluk bir işbirliğine öncülük ediyor. Shunlin Lu'nun yer aldığı Fudan Üniversitesi çalışması, görüntü ile dokunmayı eş zamanlı kaydeden 30.000 saatten fazla gösterim derledi ve yaklaşık 100.000 saati hedefliyor. Güney Kaliforniya Üniversitesi'nin modeli ise dokunmayı yalnızca kamera görüntüsünden çıkarıyor ve temas yoğun görevlerde dokunmasız yüzde 28,2'ye karşı yüzde 62,8 bildiriyor.[1]
Dördü bir arada okunduğunda, dört ölçüm dört ayrı soruyu yanıtlıyor. Robot gövdesini değiştiren tek ekip Tsinghua; okurun en çok sınanmasını istediği değişken de bu. Ama sonuç bir başarı oranı olarak değil, başka gövdelerde de çalışma olarak geliyor; yüzde 65'in yanına konabilecek sayı böylece ortada yok. Her çalışma kendi donanımı, kendi veri kümesi ve kendi değerlendirmesiyle anlatılıyor; anlatının hiçbir yerinde ortak bir görev takımı ya da bağımsız bir değerlendirici geçmiyor. Dördünün ortak yanı bir yarış birimi: veri saati.[1]
Sonraki ölçümün yapması gereken
Çin Bilimler Akademisi'nden Long Cheng, saati birim almaya karşı işleyen bir mekanizmaya işaret ediyor: görme sürekli ve geniş bantlı veri verirken dokunma işaretleri seyrek ve kesintili kalıyor, bu yüzden modeller dokunmayı geri plana atmayı öğreniyor. Bağlayıcı kısıt buysa, saat eklemek yanlış kolu çeviriyor; çünkü seyrek bir kanalın ne kadar ağırlık alacağına mimari karar veriyor. Öteki açıklama daha yalın ve aynı ölçüde geçerli: dokunma veri kümeleri görme veri kümelerinin yanında hâlâ küçücük ve ağ ölçeğindeki bir görüntü kümesinin karşısında 100 saat, Fudan ile Tsinghua çalışmalarının kapatmaya çalıştığı açığın ta kendisi.[1]
Bu sayıların birbiriyle konuşmasını sağlayacak ölçüm hiç gösterişli değil: tek bir görev listesi, tek bir puanlama kuralı, en az iki robot gövdesi ve veri kümesini kurmamış bir değerlendirici. Bu bir tasarım isteği; çalışmalara yönelik bir yakınma değil, çünkü her grup başkasının deneyebileceği kadar ayrıntı yayımladı. Dört çalışmadan biri 31 Mart 2027'den önce böyle bir donanımlar arası değerlendirmeyi, görev listesi, puanlama kuralı ve gövde başına sonuçlarla birlikte açık biçimde yayımlarsa, başarı oranları ilk kez birbiriyle karşılaştırılabilir olur; gözlenecek işaret, her el için ayrı sonuç taşıyan yayımlanmış bir görev listesi. O ana kadar yüzde 65 tek bir eli anlatıyor.[1]