GameWAM kare ve tuş vuruşunu birlikte öngörürken Apple MCP'den sınamalar üretiyor
29 Ağustos'ta arXiv'de yayımlanan bir ön baskı, sonraki görsel kareyi ve klavye-fare izlencesini birlikte üreten GameWAM dünya eylem modelini tanıttı. Apple araştırmacıları Model Context Protocol tanımlarından eylemci sınamalarını üreten Agent Seer'ı anlattı; parametre şemasının karmaşıklığı kaliteyi en çok belirliyor. Biri arayüzde paralel eylem öngörüsü, diğeri araç tanımlarından otomatik sınamalar sunuyor.
Yapay Zekâ··Öğle
GameWAM kare ve girdiyi paralel üretiyor
29 Ağustos'ta arXiv'e yüklenen bir ön baskı, yazarların oyun oynamak ile grafik arayüz kullanmayı aynı döngüde birleştiren ilk dünya eylem modeli olarak tanımladığı GameWAM'ı sunuyor. Model, sonraki görsel kareyi ve ona karşılık gelen klavye-fare izlencesini birlikte üretiyor; sonra öbekler hâlinde yeni gözlemlerden yeniden planlayarak uzun oturumlarda yolunda kalıyor. Yazarlar, karşılaştırdıkları temel sistemlerden daha az sayıda yerel eylem yürüterek benzer görev başarısına ulaştıklarını bildiriyor ve modelin bir eylemin nereden geldiğine duyarlı hâle geldiği Low-Frequency Action Source Imprinting adını verdikleri bir hata biçimini anlatıyor. 44 sayfalık çalışma arXiv'de yayımlanan ve hakem değerlendirmesinden geçmemiş bir ön baskı. Bildirilen bulgular yazarların kendi koşularına aittir ve çalışma hakem değerlendirmesinden geçmemiş bir ön baskı olarak sunuluyor.[1]
Agent Seer MCP tanımlarından senaryo üretiyor
Apple araştırmacıları, araç kullanan eylemciler için sınama senaryolarını elle yazmak yerine Model Context Protocol tanımlarından üreten Agent Seer'ı anlattı. Sistem işlev adlarını, açıklamaları ve parametre şemalarını zenginleştiriyor, sentetik çıktılarla derecelendirilmiş senaryolar üretiyor ve bunları çok turlu diyaloglara çeviriyor. 7 ayrı MCP tanımı üzerinde denenen hat, küçük ve orta ölçekli tanımlarda araçların tamamını kapsadı. Ekibe göre kaliteyi en çok parametre şemasının karmaşıklığı belirliyor, araç kümesinin büyüklüğü ikinci sırada kalıyor. Kusurlu senaryolarda başlıca hata türü argüman değerlerinin yanlış seçilmesi; kaba taneli ölçütler bu ayrımı çoğunlukla kaçırıyor. Hat, her yeni araç tanımı için elle yazılmış sabit bir kütüphaneye bağlı kalmak yerine sentetik çıktılarla derecelendirilmiş senaryolar üretmeyi amaçlıyor. Bildirilen bulgular yazarların kendi koşularına aittir ve çalışma hakem değerlendirmesinden geçmemiş bir ön baskı olarak sunuluyor.[2]
Öngörü ile sınamalar eylemcinin iki ayrı ihtiyacını karşılıyor
GameWAM, grafik arayüzde bir sonraki kareyi ve girdiyi birlikte modelleyerek uzun oturumlarda yeniden planlamayı mümkün kılıyor; yazarlar daha az yerel eylemle benzer başarı bildirse de Action Source Imprinting hatası eylemin kaynağına duyarlılığı gösteriyor. Agent Seer ise araç tanımlarından sınamalar üreterek eylemcilerin MCP üzerinden bağlandığı işlevlerin doğru argümanlarla çağrılıp çağrılmadığını ölçmeye odaklanıyor. İki çalışma eylemcinin farklı katmanlarını hedefliyor: biri algı ve eylem üretimi, diğeri araç çağrısı doğruluğu. Apple ekibi kusurlu senaryolarda yanlış argüman seçiminin baskın hata olduğunu söylüyor; GameWAM yazarları düşük frekanslı eylem kaynaklarının modelde iz bırakabildiğini uyarıyor. Okuyucu için somut gelişme, aynı hafta hem arayüz düzeyinde dünya modeli hem de protokol düzeyinde sınamaların duyurulması. Bildirilen bulgular yazarların kendi koşularına aittir ve çalışma hakem değerlendirmesinden geçmemiş bir ön baskı olarak sunuluyor.[1], [2]