Eigen RadarYapay Zekâ
Analiz

Cloudflare ajanları izliyor, araştırmacılar makalelerini reddediyor, AWS belirteçleri sayıyor

Cloudflare ajan hareketlerini izlemeye başladı; AWS örneği belirteç ölçümünü sonradan ekledi, araştırmacılar ise ajanların yazdığı iki makaleyi reddetti. Ajanların hızı, izlenebilirlik ve doğrulama yükünü azaltmıyor.

Yapay Zekâ··Akşam
Aydınlık bir operasyon odasında üç ışıklı veri hattı şeffaf izleme düzeneğine akıyor; bir uzman masada incelerken iki boş sayfa geri dönüyor.

Cloudflare'de eylemci izleri ve zıt gizlilik varsayılanları

InfoQ'nun aktardığına göre Cloudflare, çalışan eylemci oturumlarının izlerini bir araya getiren Cloudflare Agents panosunun ilk parçasını açtı; izler model çağrılarını, araç çalıştırmalarını ve onayları kapsıyor. Bir konuşmanın hangi bölümünün saklandığı ekibin kullandığı kitaplığa göre değişiyor: Think ve wrapAISDK() bayrak açılmadıkça mesaj ve araç içeriğini tutmazken Flue mesajları, sistem yönergelerini, araç tanımlarını, çağrı değişkenlerini ve sonuçları varsayılan olarak saklıyor. İzler üç tanımlayıcı alan taşıyor: eylemci adı, eylemci kimliği ve konuşma kimliği. Oturum tekrarı turlar boyunca mesajları, akıl yürütmeyi, araç çağrılarını ve alt eylemcilerin işlerini gösteriyor, görselleri ise göstermiyor. Özellik deneme sürümü boyunca ücretsiz; 1 Ekim 2026'da Workers Observability fiyatlandırmasına geçiyor. Ücretsiz katmanda günde 200.000 olay ve 3 gün saklama, ücretli katmanda ayda 20 milyon olay ve 7 gün saklama var; sonrasında her bir milyon olay için 0,60 dolar alınıyor. InfoQ, izlerin eksiksiz olmadığını yazıyor: uzun mesajlar ve sonuçlar boyut sınırına takılıp kesilebiliyor, onay kayıtları da bir insanın gerçekte ne kadar beklediğini değil yaşam döngüsü olaylarını tutuyor. Böylece izlenebilirlik ürünleşirken operatör, hangi kütüphanenin neyi sakladığını ve hangi boşluğun kaldığını hâlâ kendisi denetlemek zorunda kalıyor.[1]

NeurIPS sorularında reddedilen iki eylemci makalesi

The Decoder'ın aktardığı Shadow Evaluation çalışmasında Princeton ile UK AI Security Institute'tan araştırmacılar, yapay zekâ eylemcilerine NeurIPS 2026 için henüz yayımlanmamış araştırma sorularını verdi ve sonuçları soruların asıl yazarlarına hakem olarak değerlendirtti. Eylemcilerin yazdığı iki makale de reddedildi; biri kesin ret aldı. Ek yüksek akıl yürütme ayarındaki Claude Opus 4.8 ile GPT-5.6 Sol'a altı gün, 3.000 dolar API kredisi, bir GPU bütçesi ve sanal makine erişimi verildi; krediden yaklaşık 1.130 dolar harcadılar. Eylemciler mühendislik işlerinin üstesinden geldi ama 36 ila 48 saatlik sürenin ilk 10 saatinde iddialı hedeflerden vazgeçti, makale uzunluk sınırını aştı ve yönergelerden saptı. Hakemler zayıf gerekçelendirilmiş veriyi, okunmayan anlatımı ve tuhaf deney seçimlerini eleştirdi. Örneklem iki NeurIPS başvurusu; dolayısıyla sonuç genel olarak araştırma işine değil bu görevlere ilişkin bir şey söylüyor. Çalışmanın metni cruxevals.com adresinde yayımlandı. Otonom araştırmanın yakın olduğu yönündeki iddialara karşı bu deneme, mühendislik kapasitesi ile hakem standardını aynı masaya koyuyor ve hızın kabul edilmeyi garantilemediğini gösteriyor.[2]

AWS örneğinde sonradan eklenen belirteç ölçümü

AWS Machine Learning Blog, Strands Agents ile kurulan çok eylemcili bir sistemi anlatıyor: bir yönlendirici eylemci istekleri bütçe eylemcisine ve finansal çözümleme eylemcisine dağıtıyor, sistemin tamamı da Bedrock AgentCore çalışma ortamına kuruluyor. Modeller iki yerden geliyor: SageMaker AI üzerinde vLLM kabında sunulan Qwen 3.5 9B ile Bedrock üzerinden Claude Haiku 4.5 ve Claude Sonnet 4.6. Yazı, kurulumu yapanın kapatması gereken bir boşluğu adlandırıyor: SageMaker'ın OpenAI uyumlu uç noktaları belirteç ölçümünü kendiliğinden üretmiyor, bu yüzden yazarlar OpenTelemetry gen_ai.chat kayıtlarını elle yayıyor ve vLLM'in belirteç sayılarını bildirmesi için stream_options içindeki include_usage seçeneğini açıyor. Kimlik doğrulama, kendini yenileyen taşıyıcı belirteçlerle çalışan özel bir httpx.Auth alt sınıfı üzerinden yürüyor. İzler CloudWatch Transaction Search ile AWS X-Ray'e düşüyor; model, 0.22.1 sürümlü vLLM derin öğrenme kabıyla ml.g6e.2xlarge örneklerinde çalışıyor ve kod aws-samples/sagemaker-genai-hosting-examples deposunda duruyor. Cloudflare'in panosu, Shadow Evaluation retleri ve AWS'nin elle eklenen ölçümü birlikte okunduğunda tablo netleşiyor: eylemci iş akışı hızlanırken iz, maliyet ve bilimsel doğrulama yükü operatörün omzunda kalıyor. Ürünleşmiş izleme bile kütüphane varsayılanlarına bağlı; örnek kurulumda telemetri sonradan ekleniyor; hakem standardı ise hâlâ insan denetiminde duruyor.[3], [1], [2]

Kaynakça

  1. Haber kaynağıInfoQCloudflare'e eylemci iz kaydı geldi, gizlilik varsayılanları birbirine ters↩1↩2
  2. Haber kaynağıThe DecoderSoruları soran araştırmacılar, eylemcilerin yazdığı iki makaleyi reddetti↩1↩2
  3. Haber kaynağıAWS Machine Learning BlogAWS'nin çok eylemcili örnek kurulumunda belirteç ölçümü elle ekleniyor↩