Eigen RadarYapay Zekâ
Analiz

GPT-6 Astra, ARC Prize'ın kendi testinde yüzde 62,7 aldı; OpenAI yüzde 99,9 açıklamıştı

ARC Prize'a göre satıcılar arasında adil bir kıyaslamaya yalnızca kendi Standard düzeneğinde ölçülen yüzde 62,7 izin veriyor; OpenAI'nin öne çıkardığı yüzde 99,9 ise Astra'nın akıl yürütmesini hamleler arasında koruyan bir Provider Adapter düzeneğinden geldi. Bağımsız izleyiciler Artificial Analysis ve Epoch AI, Astra'yı hangi ölçüte bakıldığına göre selefiyle eşit düzeyden açık farkla önde olmaya kadar değişen konumlara yerleştirdi.

Yapay Zekâ··Akşam
Aydınlık bir üniversite değerlendirme odasında iki araştırmacı, masadaki renkli kare bulmaca tahtalarını karşılaştırıp bir uyuşmazlığı inceliyor.

İki düzenek, iki farklı puan

ARC Prize, GPT-6 Astra'yı kendi Standard düzeneğinde yüzde 62,7 ile ölçtü; bu düzenek, farklı şirketlerin puanlarını adil biçimde kıyaslayabilmek için modelin belleğini her hamleden sonra siliyor. OpenAI'nin öne çıkardığı yüzde 99,9 ise bunun yerine Astra'nın akıl yürütme durumunu hamleler arasında koruyan ve uzun konuşmaları özetleyen bir Provider Adapter düzeneğinden geldi; OpenAI'nin lansman günü tablosu bu uyarlanmış puanı, yalnızca düz Standard düzenekte ölçülen rakiplerle eşleştirdi. Aynı 167 oyun-akıl yürütme çifti üzerinde Provider Adapter, Standard sürüme göre yaklaşık 3,66 kat daha hızlı çalıştı ve yüzde 49 daha az belirteç harcadı; bu da düzeneğin kendisinin rakamları ne kadar oynattığını gösteriyor.[1], [2]

Maliyet düşerken puan yükseliyor, ama bir ayar tersine dönüyor

Standard iskelede maliyet, akıl yürütme kapalıyken 49.791 dolardan azami akıl yürütmede 26.098 dolara inerken puan yüzde 35,2'den yüzde 62,7'ye çıktı; yani daha fazla akıl yürütme çabası, hem daha ucuz hem daha güçlü bir koşuyla birlikte geldi. Örüntü, düşük akıl yürütme ayarında bozuluyor: bu ayar yalnızca yüzde 17,5'te kaldı, akıl yürütmesiz koşunun bile altında; ARC Prize bu düşüşe bir açıklama getirmiyor. Kurum, sonuçların hiçbirini genel yapay zekânın kanıtı saymıyor ve ARC-AGI-4'ü 2027'nin ilk çeyreğinde yayımlamayı planlıyor.[1]

Bağımsız izleyiciler farklı yerlere yerleştiriyor

Bağımsız başarım izleyicileri, Astra'yı hangi ölçütü kullandıklarına göre farklı yerlere koyuyor: Epoch AI modeli 169 puanla ilk sıraya koyarken Artificial Analysis 61 puanla selefiyle aynı yere, Claude Fable 5.1'in 66 puanının gerisine yerleştirdi. Artificial Analysis'in kendi ayrık ölçütleri de tek bir izleyici içinde aynı örüntüyü gösteriyor: Astra, geniş Intelligence Index'te GPT-5.6 Sol'un 60,9 puanına karşı 61,2 puanla neredeyse eşit, dar Coding Agent Index'te ise 65,1 puana karşı 67,0 puanla daha açık bir farkla önde. Aradaki fark, modelin ne yaptığından çok hangi düzenek, uyarlayıcı ve ölçütle ölçüldüğünden geliyor.[1], [2]

Kaynakça

  1. Haber kaynağıThe DecoderGPT-6 Astra, ARC Prize'ın kendi düzeneğinde yüzde 62,7 aldı; OpenAI yüzde 99,9 bildirmişti↩1↩2↩3
  2. Haber kaynağıWinBuzzerGPT-6 Astra'nın yüzde 99,9'luk ARC-AGI-3 puanı başka hiçbir modelin kullanmadığı bir düzenekle alındı↩1↩2