Eigen RadarYapay Zekâ
Analiz

Ajan üretim hattı üç ayrı katmana ayrılıyor

Presence insan destekli kurumsal kurulum, Embabel okunabilir düzenleme kodu, Meta ise ayrı bir hafıza ajanı sunuyor; üç haber uzun görevlerde güvenilirliğin tek bir model özelliğine indirgenemediğini gösteriyor.

Yapay Zekâ··Sabah
Mor bir dağıtım koridorundan çıkan uzun ajan iş akışını üstte dönen hafıza halkasına bağlayan sentetik sistem

Presence güvenilirliği hizmet paketinde arıyor

OpenAI, Presence'ı ajanları müşteri hizmetleri ve kurum içi iş akışlarında üretime taşımaya yönelik bir kurumsal teklif olarak duyurdu. Teklif, şirketin özelleştirilebilir Workspace Agents araçları üzerine kuruluyor ve şimdilik yalnızca uygun görülen kurumsal müşterilere açılıyor. İş akışının seçimi, sistemlerin tümleştirilmesi, kuralların tanımlanması ve üretim testleri yalnızca yazılım belgelerine bırakılmıyor; OpenAI'ın sahaya çıkan mühendisleri bu aşamalarda müşteriye uyarlanmış destek veriyor. Açıklanan yapı bu nedenle güvenilirliği tek başına model çıktısında değil, kurulum ve işletim sürecinde de ele alıyor. Bununla birlikte fiyat yayımlanmadı ve dışarıdaki bir ekibin aynı düzeni kendi ortamında tekrar edebilmesini sağlayacak ölçüler haberde yer almıyor. THE DECODER ayrıca Avrupa Birliği Yapay Zekâ Yasası gibi belirli uyum gerekliliklerinin nasıl karşılanacağının belirsiz kaldığını aktarıyor. Presence'ın haberden görülebilen sınırı açık: müşteri erişimi ve mühendislik desteği tarif ediliyor, fakat kurulum süresi, insan incelemesinin payı veya hata geri alma başarısı gibi karşılaştırılabilir bir sonuç açıklanmıyor. Bu, üretim güvenilirliğinin hizmet katmanında ele alındığını gösterirken o katmanın müşteri dışından ölçülmesini şimdilik mümkün kılmıyor.[1]

Embabel düzenleme katmanını kod olarak açıyor

Embabel 1.0 aynı üretim sorununa indirilebilir bir Java çerçevesi tarafından yaklaşıyor. Spring Framework'ün kurucusu Rod Johnson'ın ortak yaratıcısı olduğu proje, ajanı elle sıralanmış istem ve araç çağrıları yerine hedefler, eylemler ve bunları bağlayan koşullardan oluşan tipli alan nesneleriyle tanımlıyor. Spring AI üzerine kurulduğu için OpenAI, Anthropic, Gemini, Bedrock, Mistral ve DeepSeek gibi sağlayıcıların yanı sıra Ollama gibi yerel uçlarla çalışabiliyor. Hedef odaklı planlama eylem sırasını çalışma zamanında belirliyor; koşullar görev sırasında değişirse plan yeniden değerlendirilebiliyor. Tek tek eylemler belirli bir modele yönlendirilebiliyor, model türleri rol takma adlarıyla temsil edilebiliyor ve planlama aynı ajan içinde açık durum makineleriyle birleştirilebiliyor. Buradaki görünür katman, bir müşteriye özel hizmet sürecinden çok okunabilen ve farklı görev kümelerinde çalıştırılabilen düzenleme mantığı. Bu açıklık kendi başına daha yüksek başarı kanıtlamıyor; haberde Embabel ile Presence'ı aynı görevde karşılaştıran bir ölçüm bulunmuyor. Yine de iki duyurunun sınanabilir nesneleri farklı: Presence desteklenen bir konuşlandırma sunarken Embabel hedef, eylem ve koşul ilişkilerini geliştiricinin inceleyebileceği yazılım yapıları halinde sunuyor.[2]

Meta görev geçmişini ayrı bir ajana bölüyor

Meta AI ekibinin yayımladığı düzenek güvenilirlik sorununu üçüncü bir katmanda, uzun görev boyunca durumun korunmasında ele alıyor. Araştırmacıların davranışsal durum aşınması dediği durumda eylem ajanı kısıtları unutuyor, başarısız komutları tekrarlıyor ve önceki hataları yeniden keşfediyor. Önerilen ikinci ajan işi doğrudan yürütmüyor: durum, bilgi ve yordam bölümlerinden oluşan yapılandırılmış bir hafıza bankasını güncelliyor, ardından eylem ajanının sonraki çağrısına hatırlatma eklenip eklenmeyeceğine karar veriyor. Terminal-Bench 2.0'da ilk deneme başarısı yüzde 38.den yüzde 46.ya, Tau2-Bench'te görev ağırlıklı ortalama yüzde 55.ten yüzde 62.ye çıkıyor. Kazanç alanlara göre aynı değil; havayolu ve perakende görevlerinde yaklaşık 10 puan, telekomünikasyonda 3 puan bildiriliyor. Denemelerde hafıza rolünde Claude Opus 4.6, eylem rolünde Claude Sonnet 4.5 ve Qwen3.5-27B kullanıldı. Çalışma arXiv'de yayımlandı, kodu açıldı ve henüz hakem değerlendirmesinden geçmedi. Üç haber birlikte okunduğunda ajan güvenilirliğinin tek bir düğmeye bağlanmadığı görülüyor: kurumsal kurulum ve destek, çalıştırılabilir düzenleme mantığı ve görev durumunu koruyan ayrı bellek birbirinden farklı müdahale noktaları. Haberler bu yaklaşımları aynı deneyde karşılaştırmıyor; dolayısıyla aralarında bir üstünlük sırası kurmuyor. Ortak sonuç daha sınırlı: uzun görevlerde neyin güvenilir sayılacağı, modelin yanında hangi katmanın kurulduğuna ve o katman için hangi ölçünün yayımlandığına bağlı.[3], [1], [2]

Kaynakça

  1. Haber kaynağıTHE DECODEROpenAI kurumsal ajan konuşlandırması için Presence'ı tanıttı↩1↩2
  2. Haber kaynağıInfoQJava ajan çerçevesi Embabel 1.0 sürümüne ulaştı↩1↩2
  3. Haber kaynağıTHE DECODERMeta araştırmacıları uzun görevler için ikinci bir hafıza ajanı deniyor↩