GPT-6 Astra'nın puanı, Intelligence Index yenilenince dört puan yükseldi
Artificial Analysis, GPT-6 Astra'nın puanına ilişkin kuşkuların ardından Intelligence Index'i iki yeni test ve yüzde 40 gizli veri ağırlığıyla yeniledi. Astra selefine göre dört puan kazanarak ikinci sıraya çıktı; Claude Fable 5.1 birinciliğini korudu. Aynı haftaki Arena WebDev tablosunda Astra Max'in üstün puanı iki model için de 1–2 sıra aralığı taşıyor; sonuçlar, değerlendirme seçiminin tabloyu değiştirebildiğini gösteriyor.
Yapay Zekâ··Öğle
Artificial Analysis endeksin yapısını değiştirdi
Artificial Analysis, başka değerlendirmeler GPT-6 Astra için verdiği tabloyla uyuşmayınca Intelligence Index'i yeniledi. Yeni sürüm AA-Briefcase ve GDP.pdf adlı iki başarım testini ekliyor, modellerin çözdüğü GPQA-Diamond'ı çıkarıyor. Gizli tutulan test verisinin toplam puandaki ağırlığı da yüzde 40'a yükseliyor. Böylece endeks, kamuya açık soruların eğitim verisine karışması riskine karşı daha geniş bir gizli bölüm kullanıyor; değişen puan, modeldeki bir güncellemeden değil, değerlendirme düzenindeki revizyondan kaynaklanıyor.[1]
Astra dört puan kazandı, Claude Fable 5.1 ilk sırada kaldı
Yenilenen tabloda Claude Fable 5.1 birinciliğini koruyor. GPT-6 Astra, selefine göre dört puanlık artışla ikinci; Meta ise üçüncü sırada. AA-Briefcase, eylemci yapay zekânın bilgi işlerini; GDP.pdf, uzun PDF belgelerini okumayı sınarken, çıkarılan GPQA-Diamond artık modelleri yeterince ayırmıyordu. Artificial Analysis, Astra'nın görev başına diğer öncü modellerden daha az belirteç kullandığını da öne sürüyor. Bu veriyi, puanlama yaklaşımı sorgulanan aynı değerlendirme sağlayıcısı ürettiği için iddia bağımsız bir ölçüm sayılmıyor.[1]
Arena başka bir yeteneği ve başka bir belirsizliği ölçüyor
Arena'nın aynı haftaki WebDev tablosu, kullanıcıların iki üretilmiş web arayüzü arasındaki tercihlerine dayanıyor. GPT-6 Astra Max burada 1.199 oyla 1.797 puan, Claude Fable 5.1 Max ise 2.275 oyla 1.762 puan aldı. Astra'nın nokta puanı daha yüksek olsa da Arena iki model için de 1–2 sıra aralığı veriyor. Intelligence Index'in görev karışımı ile Arena'nın arayüz tercihleri farklı sorulara yanıt veriyor; ikisi de bütün kodlama ya da zekâ görevlerinde genel üstünlük kurmuyor.[2], [3]