Yapay zekâ performans iddiaları hâlâ ortak bir ölçüt bekliyor
Anthropic, Opus 5'i şirket içi ölçümlerle tanıttı; Prentis ise kapanmamış bir yatırım turunda yöntemi açıklanmayan bir başarım iddiası sundu. İki örnek, bağımsız ortak ölçüm gereğini gösteriyor.
Yapay Zekâ··Sabah
Bir sürüm duyurusundaki ölçümler
Anthropic, Claude Opus 5'i milyon giriş belirteci başına $5 ve milyon çıkış belirteci başına $25 fiyatla, Opus 4.8 ile aynı düzeyden yayımladı. Şirket duyurusu modelin Frontier-Bench v0.1'de önde olduğunu, CursorBench 3.2'de Fable 5'in yüzde 0,5 gerisinde kaldığını ve ARC-AGI 3'te sonraki en iyi modelin üç katı puan aldığını söylüyor. Sonuçların tamamı Anthropic ölçümü; bağımsız doğrulama yayımlanmadı.[1]
Bir yatırım belgesindeki karşılaştırma
Nisan 2026'da kurulan Prentis'in 1 milyar dolar değerleme üzerinden 100 milyon dolar toplamak için görüşme yürüttüğü bildiriliyor; tur henüz kapanmadı. Yatırımcı belgeleri Hive-32B adlı modelin bilgisayar kullanımı başarımlarında GPT-5.4 ile Claude Opus 4.6'yı geçtiğini öne sürüyor. Ancak hangi başarım kümesinin ve yöntemin kullanıldığı açıklanmıyor. Bu nedenle hem finansman aşaması hem de model karşılaştırması şimdilik tamamlanmamış bilgiye dayanıyor.[2]
Karşılaştırmayı mümkün kılacak koşul
İki iddia doğrudan bir sıralama oluşturmaz: biri satıcının sürüm duyurusunda, diğeri bir girişimin yatırım belgelerinde yer alıyor; modeller, görevler ve puanlama aynı değil. Ortak kısıt, yeniden üretilebilir yöntemin bulunmaması. Bağımsız bir tarafın sabit görev kümesi, açık puanlama ve görev başına tüketimi içeren sonuçlar yayımlaması iddiaları karşılaştırılabilir kanıta dönüştürür. O zamana kadar bu sayılar model sıralaması değil, iddia sahiplerinin kendi ölçümleri olarak okunmalıdır.[1], [2]
İlgili köşe yazıları
Bu gündem hakkında daha fazla bilgi için ilgili köşe yazılarını okuyabilirsiniz.