Eigen RadarYapay Zekâ
Analiz

Reka, metin, video ve robot eylemlerini Rho-1’de birleştirdi

Reka, metin, görüntü, video ve robot eylemlerini ortak bağlam içinde işleyen Rho-1’in araştırma önizlemesini yayımladı. Gösterimler, bir sahne oluşturup düzenlemenin yanında robot benzetiminde denetim sinyalleri üretmeyi kapsıyor. Şirket, uzun videolarda sahnenin tutarlılığı ve belirli bölgelerin düzenlenmesi gibi yeteneklerin hâlâ sınırlı olduğunu belirtiyor. Önizleme bir kavram kanıtı sunuyor; fiziksel robotlarda güvenilir kullanım sağlandığını ortaya koymuyor.

Yapay Zekâ··Akşam
Masadaki ekranda beyaz bir küpe uzanan robot kolu, ekranın yanında küçük bir deniz feneri modeli.

Rho-1 farklı veri türleri için ortak bağlam kullanıyor

Yapay zekâ geliştiricisi Reka, 5 Ekim’de Rho-1’in araştırma önizlemesini yayımladı. Model, metin, görüntü, video ve robot denetim eylemlerini tek sinir ağında ve ortak bir bağlam penceresinde birleştiriyor. Anlama ve üretim akışları aynı dikkat mekanizmasını ve bellek durumunu paylaşıyor. Metin ve sembolik komutlar, modelin işlediği birimler olan ayrık belirteçlerle kodlanıyor. Görüntüler, video kareleri ve fiziksel eylemler için sürekli gösterimler kullanılıyor.[1], [2]

Bir sahne görüntüden video düzenlemeye taşınıyor

Şirketin bir gösteriminde Rho-1, deniz feneri görüntüsü oluşturuyor, nesnenin çevresine kutu çiziyor, görüntüyü videoya dönüştürüyor ve sahneye kar fırtınası ekliyor. Başka örneklerde devam eden video akışına yön talimatları veriliyor. Bu işlemler ortak model bağlamı içinde gösteriliyor. Örnekler şirketin gösterimleri; farklı sahnelerde veya kullanıcı isteklerinde güvenilirliğe ilişkin bağımsız ölçüm sunulmuyor.[1]

Robot eylemleri benzetimde gösteriliyor

Robot örneği, robot görevleri için kullanılan LIBERO benzetim ortamında yürütülüyor. Rho-1 gözlemleri ve bilek kamerasının görüntülerini alarak yedi eylem kanalı üretiyor. Reka, internet videolarından denetim sinyalleri çıkaran bir ters dinamik modelini de anlatıyor. Şirket bu aşamayı kavram kanıtı olarak sunuyor. Uzun videolarda oda yerleşiminin kayabildiğini, video boyunca nesne konumlandırmanın sınırlı kaldığını ve farklı komutlarla belirli bölgeleri düzenlemenin tutarsızlaşabildiğini kabul ediyor.[1]

Kaynakça

  1. Haber kaynağıRekaReka, metin, görüntü ve robot eylemlerini birleştiren Rho-1’i gösterdi↩1↩2↩3
  2. Haber kaynağıThe DecoderRho-1, metin, görüntü, video ve robot denetimini tek ağda işliyor↩