Aynı model, iki düzenek
ARC Prize, GPT-6 Astra için kendi iç düzeneğinde yüzde 62,7 ölçtü ve satıcılar arasında adil karşılaştırmaya yalnızca bu rakamın izin verdiğini söylüyor. OpenAI'nin yüzde 99,9'u farklı koşullarda, akıl yürütme zincirlerini istekler arasında saklayan ve uzun koşuları özetleyen kendi düzeneğinde çıktı. Aynı 167 oyun-akıl yürütme çifti üzerinde OpenAI'nin düzeneği yaklaşık 3,66 kat daha hızlı çalıştı ve yüzde 49 daha az belirteç harcadı. İki rakam arasındaki mesafe, ölçümün nerede bittiğiyle ilgili.[1]
Toplu değerlendirmeler de aynı yönde ayrışıyor. Epoch AI, 50'den fazla başarım testini birleştirip Astra'yı 169 puanla ilk sıraya koydu. Artificial Analysis aynı modele 61 puan verdi; bu, selefi Sol ile aynı düzey ve Claude Fable 5.1'in 66 puanının gerisi. Tek bir model, iki farklı toplama yöntemiyle iki farklı yere yerleşiyor.[1]
Maliyet eğrisi ters yönde ilerliyor
Standart ARC iskelesinde akıl yürütme kapalıyken maliyet 49.791 dolar, azami akıl yürütmede 26.098 dolar. Puan aynı aralıkta yüzde 35,2'den yüzde 62,7'ye çıkıyor. Bunun nedeni işleyişte: model oyunları daha az hamlede çözüyor, bu da daha az model çağrısı ve daha az belirteç demek. Faturayı hamle sayısı belirliyor; belirteç fiyatı ikinci sırada kalıyor.[1]
Aynı tabloda açıklanmayan bir aykırılık duruyor: düşük akıl yürütme ayarı yüzde 17,5 ile akıl yürütmesiz koşunun altında kalıyor ve ARC Prize buna bir açıklama getirmiyor. Birim fiyat tarafında Astra, işlenen metin birimi başına Sol'ün 2,5 katına mal oluyor. Kodlama işlerinde ise görev başına maliyeti, aynı puanları alan Claude Fable 5'in yarısının altında kalıyor. Hangi rakamın gerçek olduğu, sınırın nereye çizildiğine bağlı.[1]
Alıcının ulaşamadığı yapılandırma
Bu hafta iki satıcı da en yüksek rakamlarını, alıcının yeniden üretemeyeceği bir yapılandırmadan verdi. OpenAI'nin yüzde 99,9'u, ARC Prize'ın karşılaştırma için kullanmadığı kendi düzeneğinden geliyor. Meta'nın öne çıkardığı Muse Spark 1.3 puanları ise güvenlik testleri süren, sınırlı iş ortağı önizlemesindeki max yapılandırmasına ait; geliştiricilerin Muse Code ve Meta Model API üzerinden aldığı katman xhigh.[1], [2]
Meta'nın kendi rakamlarında max, GDPval-AA v2'de 1.754 Elo ile xhigh'ın 1.709 puanının, OSWorld 2.0'da 66,9 ile 57,2'nin önünde. Terminal-Bench 2.1 sıralamayı bozuyor: xhigh 89,2 ile max'ın 88,8 puanının önünde. Bağımsız ölçüm yapan Artificial Analysis, geniş biçimde erişilebilen xhigh'ı 61 zekâ endeksi puanıyla ve görev başına 0,55 dolar maliyetle ölçtü. Alıcının bugün satın alabildiği sayı bu sonuncusu.[2]
Temmuzda iki Kore yatırımını karşılaştıran kolon aynı ayrımı kullanmıştı: ölçülebilen tek koşul, yayımlanan koşuldu (İki gigavat, 200 megavat ve bağlayıcı olmayan bir niyet mektubu, 25 Temmuz 2026). Ölçüm sınırı için de aynı ölçüt işliyor. ARC Prize, satıcı düzeneklerinden çıkan sayıları da yayımlamayı planladığını söylüyor ve ARC-AGI-4'ü 2027'nin ilk çeyreğinde çıkarmayı planlıyor. İki sayı tek yerde yayımlanırsa, okur bir modelin iki rakamını yan yana görebilir.[1], [3]