Eigen RadarYapay Zekâ
Analiz

Yeni sınamalar, yapay zekâ modellerini gerçek işte ve görmede sınava çekiyor

Artificial Analysis, kullanıcıların kendi verileri üzerinde model sınayıp iş başına gideri görmesine imkân veren hizmetini açtı; Moonshot’un PerceptionBench’i ise öncü modellerin hiçbirinin görsel görevlerde yüzde 60’ı aşamadığını buldu. Bu gelişmeler, genel sıralamalar yerine somut işlerdeki sınırlara dikkat çekiyor.

Yapay Zekâ··Öğle
Camın önünde arkadan görülen bir gözlemci, kutular, yumuşak paketler ve aletlerle dolu tezgahta çalışan robot kolunu izliyor; bir paket kutunun dışında kalmış.

Optima kurumun kendi işiyle sınama yapıyor

Artificial Analysis, modelleri kullanıcının kendi verileri ve kullanım amacı üzerinde karşılaştırmak için Optima hizmetini açtı. The Decoder'ın haberine göre kullanıcılar üç tür girdi verebiliyor: mevcut değerlendirme kümeleri, Arize veya Langfuse gibi araçlardan alınan eylemci izleri ya da yalnızca kullanım amacının tarifi. Optima bu girdilerle güncel modelleri yanıt kalitesi, iş başına gider ve iş başına süre bakımından karşılaştırıyor. Hizmet iki puanlama yolu sunuyor: yanıtı ölçüt listesine göre değerlendirmek veya iki yanıtı yan yana getirip hangisinin tercih edildiğini sormak. Ücretlendirme, kullanılan modellerin gerçek belirteç giderlerine dayanıyor ve üzerine pay eklenmiyor; her ölçüt için model başına 0,125 dolar, her ikili karşılaştırma için 0,375 dolar alınıyor. Erken kullanıcılar finans ve muhasebe eylemcileri için sınamalar kurdu ve hukuki yazım üslubunun eşleştirilmesini denedi. Araç şu anda erişime açık olduğu için kurumlar genel bir sıralama yerine kendi örnekleri üzerinde sonuç, süre ve gideri birlikte görebiliyor.[1]

PerceptionBench görsel algının sınırını ölçüyor

Moonshot AI, görsel algıyı ölçmek için 3.000 görevden oluşan ve on beceri alanına yayılan PerceptionBench sınamasını yayımladı. The Decoder'ın aktardığı sonuçlarda 16 öncü modelin hiçbiri yüzde 60'ı geçemedi. GPT-5.6 Sol yüzde 59,7 ile en yüksek sonucu aldı; Kimi K3 yüzde 58,5, Claude Fable 5 ise yüzde 57,2 aldı. Alanlar sayma, nesne ilişkileri, öznitelikler, derinlik ve üç boyut, konum belirleme, karşılaştırma, ince ayrımlı tanıma, bağlam bütünleme, yazı okuma ve uydurma eğilimini kapsıyor. Bütün modellerin en zayıf alanı uydurma oldu. Görevler ve puanlama kodu MoonshotAI/PerceptionBench deposunda yer alıyor. Sonuçların önemli bir sınırı da var: sınamayı yayımlayan Moonshot AI, ikinci sıradaki Kimi K3 modelinin de sahibi. Bu nedenle sıralama şirketin kendi ölçümü sayılıyor; bağımsız bir değerlendirme sayılmıyor. Sonuçlar görsel görevlerdeki düşük tavanı gösterirken model sıralamasının kaynağını da açıkça taşımak gerekiyor.[2]

İki sınama farklı pratik sorular soruyor

Optima ile PerceptionBench, model başarımını farklı ölçeklerde somutlaştırıyor. Artificial Analysis tarafından açılan Optima, bir kurumun kendi örneklerini kullanarak hangi modelin istenen yanıtı ürettiğini, bir işin ne kadar sürdüğünü ve iş başına gideri birlikte ölçmeye yarıyor. Moonshot AI tarafından yayımlanan PerceptionBench ise aynı görsel görevleri 16 öncü modele uygulayıp belirli beceri alanlarındaki sonuçları karşılaştırıyor; hiçbir model yüzde 60'ı aşmıyor. İlk yaklaşım kullanıcıya ve işe göre değişen bir değerlendirme kuruyor. İkinci yaklaşım ortak bir görev kümesinde modeller arası karşılaştırma sağlıyor. Kaynakların sınırları da farklı: Optima'nın sonucu yüklenen veri, ölçüt ve tercih yöntemine bağlı; PerceptionBench sıralaması ise Kimi K3 modelinin sahibi Moonshot AI tarafından yayımlandığı için şirket ölçümü niteliğinde. İkisi birlikte, model seçiminin hem kurumun kendi işi üzerindeki sonuç, süre ve gidere hem de belirli bir yetenekte ortak görevlerle ölçülen başarımına bakılarak incelenebileceğini gösteriyor. Optima belirli kullanıcı örnekleriyle çalışırken PerceptionBench bütün katılımcılara aynı görsel görev kümesini uyguluyor. Sonuçların kapsamını bu farklı girdiler belirliyor.[1], [2]

Kaynakça

  1. Haber kaynağıThe DecoderArtificial Analysis, kendi verinizle model karşılaştırmanızı sağlayan Optima'yı açtı↩1↩2
  2. Haber kaynağıThe DecoderGörsel algı sınavında 16 modelin hiçbiri yüzde 60'ı geçemedi↩1↩2