Eigen RadarYapay Zekâ
Analiz

Eylemci yazılımında taşınabilirlik ile sınama ayrışıyor

GitHub'ın ortak eklenti biçimi eylemci araçlarının istemciler arasında taşınmasını kolaylaştırırken MindTopo, modellerin tek görüntüde tanıdığı uzamsal ilişkileri bir eylem dizisi boyunca korumakta zorlandığını gösteriyor.

Yapay Zekâ··Sabah
Aydınlık bir atölyede anonim bir geliştirici, farklı biçimli üç istemci yuvasını bağlayan ray üzerindeki ortak modül taşıyıcısını dairesel yuvaya yerleştiriyor.

Tek paket, birden çok istemci

GitHub, Agent Plugins 1.0'ı VS Code, Copilot CLI, GitHub Copilot SDK ve Copilot uygulamasında bütün Copilot paketleri için genel kullanıma açtı. Açık standart, eylemci becerileriyle MCP sunucularını tek bir kurulabilir eklentide topluyor; bir kez hazırlanan paketin uyumlu her eylemci istemcisinde çalışması amaçlanıyor. Önceki düzende her istemci ayrı bir tanım dosyası ve dizin yapısı istediği için aynı paketleme işi yineleniyordu. Yeni biçim tek bir plugin.json şeması kullanıyor, üreticiye özgü parçaları com.github.copilot gibi ad alanı dizinlerinde tutuyor. Mevcut GitHub Copilot eklentileri taşınmadan çalışmayı sürdürebiliyor; kurumlar da eklentileri managed-settings.json üzerinden yönetebiliyor. Awesome Copilot pazarı dağıtım yüzeyi sağlarken AWS, Anysphere, Microsoft, OpenAI, Vercel ve Google çekirdek bakımcılar arasında sayılıyor. Bu duyuru, eylemci yazılımının hangi dosya düzeniyle taşınacağına ve kurumların bu paketleri nasıl yöneteceğine odaklanıyor. Standardın sağladığı ortaklık, eklentinin bir istemciden diğerine aktarılmasındaki biçim farkını azaltıyor; eklentinin içindeki modelin her görevde doğru plan kurduğunu ise kendi başına söylemiyor. Dağıtım ile davranışın ölçülmesi bu nedenle yazılım yığınının ayrı katmanlarında kalıyor.[1]

Bir görüntüyü anlamak planı sürdürmeye yetmiyor

Microsoft Research ile çeşitli üniversitelerden araştırmacıların yayımladığı MindTopo, çok kipli büyük dil modellerinin topolojik sezgiyi eylem sırasında koruyup koruyamadığını ölçüyor. Başarım sınaması süreklilik, ayrışma, sıra, çevreleme ve düğüm özelliklerini 10 görevde ele alıyor; durağan akıl yürütme ile etkileşimli planlamayı ayrı düzeylerde inceliyor. Araştırmacılar, tek bir görüntüde topolojiyi tanımak ile aynı kavrayışı bir dizi eylem boyunca sürdürmek arasında belirgin bir aralık bulunduğunu bildiriyor. Bir model bağlı bir yolu, çevrelenmiş alanı ya da düğümü başlangıç sahnesinde doğru tanıyabiliyor, fakat sahne üzerinde ardışık değişiklikler yaparken bu bilgiyi yitirebiliyor. Aktarılan sonuçlara göre planlama başarısızlıklarının çoğu görüntüyü ilk anda yanlış okumaktan çok, o anda makul görünen bir hamlenin sonraki sonuçlarını izlememekten kaynaklanıyor. Maze, Assembly, Pipe, One Stroke ve Sheep gibi görevler, kesin doğru yanıt sağlayan denetimli benzetim ortamlarında yürütülüyor. Böylece değerlendirme yalnızca son cevabı değil, modelin değişen bir sahnede ilişkileri koruyup koruyamadığını da görünür kılıyor. MindTopo'nun odağı paket uyumluluğu veya istemci dağıtımı değil; görev yürütme sırasında gerekli durum bilgisinin korunması. Bu ayrım, eylemci araçlarının kullanılabilirliğinin biçim birliğinden daha geniş bir sınama alanı gerektirdiğini gösteriyor.[2]

Ortak biçim ile davranış ölçümü farklı soruları yanıtlıyor

İki gelişme birlikte, eylemci yazılımında ilerlemenin iki ayrı yüzünü tarif ediyor. Agent Plugins 1.0, beceriler ile MCP sunucularının uyumlu istemcilere aynı paketle ulaştırılmasını ve kurumların bu paketleri ortak ayarlarla yönetmesini hedefliyor. MindTopo ise bir modelin durağan sahnede doğru gördüğü ilişkiyi etkileşimli plan boyunca taşıyıp taşıyamadığını sınanabilir bir soruya dönüştürüyor. Birincisi geliştiricinin aynı bileşeni her istemci için yeniden paketleme yükünü azaltırken ikincisi, bileşen dağıtıldıktan sonra görev davranışının hangi koşullarda aksayabildiğini gösteriyor. Kaynaklar tek bir ürünün bu iki işi birlikte çözdüğünü ileri sürmüyor. GitHub duyurusu eklenti biçimini ve dağıtım alanlarını açıklıyor; Microsoft Research çalışması ise denetimli benzetimlerdeki model davranışını bildiriyor. Bu nedenle ortak okuma, taşınabilirliğin başarımın yerine geçtiği sonucuna değil, iki katmanın ayrı ölçütlere sahip olduğuna dayanıyor. Eklentinin farklı istemcilerde kurulabilmesi biçimsel uyumluluk hakkında bilgi verir. Bir modelin ardışık hamlelerin sonuçlarını izlemesi ise görev düzeyindeki sınamayla görünür olur. Eylemci ekosisteminin yeni ortak paketleri daha geniş bir dağıtım yüzeyi oluştururken, MindTopo gibi sınamalar bu yüzeyde kullanılan modellerin planlama sınırlarını ayrı ve somut görevlerle tarif ediyor.[1], [2]

Kaynakça

  1. Haber kaynağıGitHub ChangelogGitHub, Agent Plugins 1.0'ı VS Code, Copilot CLI ve Copilot uygulamasında genel kullanıma açtı↩1↩2
  2. Haber kaynağıMicrosoft ResearchMicrosoft Research, modellerin eyleme geçerken topolojiyi takip edip etmediğini ölçen MindTopo sınamasını yayımladı↩1↩2