WikiSkill eylemci becerilerinin yanında kalıcı bir bilgi tabanı tutarken Apple MCP sınamalarını otomatik üretiyor
29 Ağustos'taki bir arXiv ön baskısı WikiSkill'i tanıtıyor; çalıştırma izlerini, biriken bilgiyi ve çalıştırılabilir becerileri sonraki güncellemelerin dayandığı kalıcı bir bilgi tabanında ayırıyor. Apple araştırmacıları 28 Ağustos'ta Model Context Protocol tanımlarından derecelendirilmiş eylemci sınamaları üreten Agent Seer'ı anlattı; 7 MCP tanımında tüm araçları kapsadı. İkisi de eylemcilerin yeteneği nasıl sakladığı ve doğruladığı sorusuna yanıt veriyor.
Yapay Zekâ··Gece
WikiSkill izleri kalıcı bir eylemci bilgi tabanında topluyor
arXiv'de 29 Ağustos'ta listelenen bir ön baskı, bir eylemcinin yeniden kullanılabilir becerilerinin yanında kalıcı bir bilgi tabanı tutan WikiSkill'i tanıtıyor. Ham çalıştırma izleri, biriken bilgi ve çalıştırılabilir beceriler birbirinden ayrı tutuluyor; deneyim sürekli olarak bu bilgi tabanında toplanıyor ve sonraki beceri güncellemeleri bunun üzerine kuruluyor. Altı yazar, denedikleri ölçüt ve modellerde bu düzenin mevcut beceri geliştirme yöntemlerini geçtiğini bildiriyor. Ayrıştırma denemeleri ağırlığı birikmenin kendisine veriyor: kalıcı bilgi tabanı devreden çıkarıldığında beceri gelişimi zayıflıyor. Yazarlar ayrıca becerilerin modeller ve model aileleri arasında aktarılabildiğini, bir modelin kendi ürettiği becerilerin başka bir modelin ürettiklerinin gerisinde kalabildiğini yazıyor. Çalışma hakem değerlendirmesinden geçmemiş bir ön baskıdır.[1]
Apple araştırmacıları 28 Ağustos'ta, araç kullanan eylemciler için sınama senaryolarını elle yazmak yerine Model Context Protocol tanımlarından üreten Agent Seer'ı anlattı. Sistem işlev adlarını, açıklamaları ve parametre şemalarını zenginleştiriyor, sentetik çıktılarla derecelendirilmiş senaryolar üretiyor ve bunları çok turlu diyaloglara çeviriyor. 7 ayrı MCP tanımı üzerinde denenen hat, küçük ve orta ölçekli tanımlarda araçların tamamını kapsadı. Ekibe göre kaliteyi en çok parametre şemasının karmaşıklığı belirliyor, araç kümesinin büyüklüğü ikinci sırada kalıyor. Kusurlu senaryolarda başlıca hata türü argüman değerlerinin yanlış seçilmesi; kaba taneli ölçütler bu ayrımı çoğunlukla kaçırıyor.[2]
Kalıcı bellek ve otomatik sınamalar eylemci güvenilirliğini hedefliyor
WikiSkill, yazarların kendi ölçütlerinde önceki beceri geliştirme yöntemlerini geçtiğini söyledikleri birleşik bir bilgi tabanının yanında gelişen becerileri saklıyor. Agent Seer, 7 MCP tanımında tüm araçları kapsayan tanım odaklı sınamalar üretiyor. WikiSkill karşılaştırmaları ön baskıdaki yazar ölçümlerine dayanıyor; Agent Seer sonuçları bağımsız denetim olmadan Apple tanımlarından geliyor.[1], [2]