Eigen RadarYapay Zekâ
Analiz

Fable 5 yavaş başlarken Alibaba eylemcileri gerçek satış görevlerinde yarıştırıyor

Fable 5’in ilk ayındaki kullanım payı sınırlı kalırken Tencent daha büyük Hy4’ü takvimsiz duyurdu; Alibaba eylemcileri sınır ötesi satış görevlerinde puanlayacak bir arena açtı. Yeni modeller, duyurunun ötesinde kullanım ve görev başarısıyla ilgi toplamak zorunda.

Yapay Zekâ··Akşam
Karanlık bir depo arenasında üç farklı otonom robot boş paketleri ayırıyor, biçimleri eşleştiriyor ve farklı zemin şeritlerindeki rotaları sınıyor.

Fable 5 ilk ayda sınırlı payda kaldı

Ramp’ın ağustos endeksi, Fable 5’i ilk ayında şirketlerin Anthropic’ten aldığı belirteçlerin yüzde 6’sında ve oraya yaptıkları harcamanın yüzde 11,4’ünde gösteriyor. OpenAI tarafında GPT-5.6 Sol belirteçlerin yüzde 25’ini, harcamanın yüzde 23’ünü tutuyor. Fable 5’in listedeki fiyatı milyon girdi belirteci için 10 dolar, milyon çıktı belirteci için 50 dolar. Endeks Ramp’ın kendi harcama yönetimi ürününden geçen ödemelere dayanıyor, yani kurumsal kart ve fatura akışını ölçüyor, her kurulumu değil. Aynı veri temmuzda Anthropic’in Amerika Birleşik Devletleri’ndeki şirketlerin yüzde 43,5’ine, OpenAI’nin yüzde 39,7’sine ulaştığını gösteriyor; en çok harcayan yüzde 1’lik kesimde çalışan başına ortanca yapay zekâ gideri 7.400 dolar. Bu tablo, en yeni modelin otomatik olarak en çok kullanılan model olmadığını gösteriyor. Fable 5 harcama payında belirteç payından daha yüksek görünüyor; bu da pahalı çıktıların endekste ağırlık kazandığını düşündürüyor. Yine de hem belirteç hem harcama payı, OpenAI tarafındaki GPT-5.6 Sol’un gerisinde. Ramp süzgeci yalnızca kendi ürününden geçen ödemeleri kapsadığı için rakamlar tüm kurumsal yapay zekâ kurulumunu değil, kart ve fatura yoluyla izlenen dilimi temsil ediyor. İlk ay verisi, frontier modelin ilgisinin fiyata ve alışkanlığa takılabileceğini somut sayılarla ortaya koyuyor.[1]

Hy3 kullanımı büyürken Hy4 takvimsiz

Tencent, Hy3 modelinin önizlemeden çıkmasının ardından haftalık kullanımının bir önceki modele göre 68 katın üzerinde arttığını, yakın dönemde daha çok parametreli bir Hy4 yayımlamayı planladığını açıkladı. Şirket Hy4 için ne çıkış tarihi ne de teknik özellik paylaştı. Hy3 şu anda WorkBuddy, CodeBuddy, Yuanbao ve ima dahil Tencent ürünlerinin içinde çalışıyor. Aynı açıklamada WorkBuddy’nin haziranda 20 milyon bilgisayar ziyaretini aştığı belirtiliyor. TechNode sayıları Çince yayın yapan GeekPark’a dayandırıyor; kullanım iddiasının yanında Tencent’in yayımladığı bir model kartı ya da değerlendirme yok. Duyuru, büyüyen kullanımı bir sonraki, daha büyük modele bağlama niyetini gösteriyor ama okura sınanabilir bir takvim veya başarım tablosu vermiyor. 68 katlık sıçrama önceki önizleme tabanına göre tanımlandığı için mutlak hacmi tek başına anlatmıyor. WorkBuddy için verilen 20 milyon bilgisayar ziyareti, modelin ürün içinde dolaştığını destekleyen ayrı bir ürün ölçüsü. Model kartı olmadan dışarıdan karşılaştırma da yapılamıyor. Fable 5’in ölçülen ilk ay payıyla yan yana bakıldığında, bir yanda sınırlı benimsenme rakamları, diğer yanda takvimsiz büyütme vaadi duruyor; ikisi de duyurunun ötesinde kanıt istiyor.[3]

Arena, eylemcileri gerçek satış görevine sokuyor

Alibaba Cloud, geliştiricilerin gerçek iş senaryolarından çıkarılmış görevlere karşı eylemci yapay zekâ çözümleri gönderdiği bir yarışma ve değerlendirme ortamı olan Qwen AI Arena’yı açtı. Ortam katılımcılara modelleri, çalışma ortamlarını ve puanlama araçlarını da veriyor. İlk yarışma katılımcılardan Amerika Birleşik Devletleri, Güney Kore ve Brezilya pazarları için ürün ilanları üretmelerini istiyor; İngilizce, Korece ve Portekizce metnin yanında ürün görselleri ve videoları da bekleniyor. Otomatik sınamanın ağustos ortasında başlaması, ardından en yüksek puanlı 30 gönderimin uzman değerlendirmesine geçmesi planlanıyor. TechNode ayrıntıları Çince yayın yapan GeekPark’a dayandırıyor. Arena, model duyurusunu tamamlayan üçüncü bir ölçü arıyor: sınır ötesi satış görevinde puan. Fable 5’in Ramp payı kurumsal harcamada benimseme hızını, Tencent’in Hy3 rakamları ürün içi kullanımı, Alibaba’nın yarışması ise eylemci çıktısının çok dilli ilan ve medya üretiminde ne kadar işe yaradığını sınamaya çalışıyor. Yeni modeller bu yüzden yalnızca parametre veya çıkış tarihiyle değil, ölçülen kullanım ve görev başarısıyla ilgi toplamak zorunda kalıyor. Otomatik tur ile 30’luk uzman listesi, reklam dilinden uzak, karşılaştırmalı bir süzgeç vaat ediyor; sonuçlar yayımlanana kadar vaat yine de takvime bağlı. Üç hat birlikte, duyuru metninin yerini alan somut soruları netleştiriyor: kim kullanıyor, hangi üründe dolaşıyor, hangi satış görevinde puan alıyor.[2], [1], [3]

Kaynakça

  1. Haber kaynağıThe DecoderFable 5, ilk ayında Anthropic'ten alınan belirteçlerin yüzde 6'sında kaldı↩1↩2
  2. Haber kaynağıTechNodeAlibaba Cloud, sınır ötesi e-ticaret görevleriyle bir eylemci yarışması açtı↩
  3. Haber kaynağıTechNodeTencent daha büyük Hy4 modelini duyurdu, tarih vermedi↩1↩2