Duyurunun taşıdığı sayılar
K-EXAONE 2.0, 750 milyar toplam ve 37 milyar etkin parametreli bir model olarak Hugging Face üzerinden Apache 2.0 lisansıyla yayımlandı, önceki sürümde bu sayı 236 milyar parametreydi. LG AI Research mimariyi, veri eğitimini, dağıtık hesaplamayı ve çıkarım altyapısını kendi başına tamamladığını bildirdi. Şirketin paylaştığı ölçümlerde model, dokuz kategoriye dağılan 24 ölçütte ortalama 70,1 puan alıyor; bu, önceki sürüme göre yüzde 10'luk bir iyileşme olarak sunuluyor. Uzun bağlam ölçütü OpenAI-MRCR'de 94,4 puan, GLM-5.1 için verilen 71,5 puanın karşısında duruyor. Kore'ye özgü toplumsal norm ve etik ölçütlerinde ortalama 94,6 bildirildi.[1]
Bu iki sayı farklı işler yapıyor. Dokuz kategoriye yayılmış 24 ölçütün ortalaması, birbirinden farklı yapıları ölçen testleri tek bir sayıya indiriyor. MRCR karşılaştırması ise ölçütün ve karşılaştırılan modelin adını veriyor. İkincisi daha bilgilendirici, çünkü neyin neyle kıyaslandığı belli; ama tek bir uzun bağlam erişim testi, diğer 23 ölçütte ne olduğu konusunda bir şey söylemiyor.[1]
Ortalamanın taşımadığı bilgi
Bir ortalama dağılımı taşımaz. Aynı 70,1 değeri, bütün ölçütlerde 68 ile 72 arasında toplanmış bir modelden de, bazılarında 95 bazılarında 45 alan bir modelden de çıkabilir. İkisi aynı sistem değil ve bir kullanıcı için sonuçları da aynı değil. Kategori sayısı bu sorunu büyütüyor: dokuz farklı kategori, dokuz farklı yapıyı ölçmek üzere kurulmuşsa, aralarındaki aritmetik ortalamanın karşılık geldiği bir nicelik yok.[1]
Yüzde 10'luk iyileşme de kendi ailesi içinde bir karşılaştırma. Bir modelin önceki sürümüne göre ilerlemesi, geliştirme sürecinin işlediğini gösterir; dışarıdaki bir taban çizgisine göre nerede durduğunu göstermez. Bu ortalamanın yurt içindeki bir program özetini aktarmak için seçilmiş olması da mümkün; devlet destekli bir çalışmanın çıktısını tek bir sayıyla bildirmek olağan bir iletişim tercihi ve o hâlde ortalama kanıt iddiası olarak değil, özet olarak okunmalı.[1]
Apache 2.0'ın yöntemsel karşılığı
Duyurudaki en sağlam yöntemsel unsur lisans. Ağırlıklar Apache 2.0 ile indirilebildiği ve ticari kullanıma açık olduğu için, aynı 24 ölçüt bağımsız bir tarafça yeniden koşulabilir ve ölçüt başına sonuçlar ayrı ayrı bildirilebilir. Kapalı bir modelde bu mümkün olmaz; orada okuyucunun elinde yalnızca üreticinin özeti kalır. Burada özet ile ölçüm arasındaki fark kapatılabilir durumda.[1]
Bu yüzden beklenecek olan yeni bir duyuru değil, bir dağılım. 30 kasım 2026'ya kadar bağımsız bir değerlendirme aynı ölçüt kümesini ölçüt başına yayımlarsa, sonuçların yayılımı ortalamanın ne kadar temsil ettiğini gösterir: dar bir yayılım ortalamayı adil bir özet yapar, geniş bir yayılım ise duyuruyu ortalamanın taşıdığı anlamına gelir. Kore'ye özgü norm ölçütlerindeki 94,6 için de aynı şey geçerli; bir davranış iddiasını ölçen testin neyi ölçtüğü, ancak testin kendisi ve puanlama yöntemi açıkken değerlendirilebilir.[1]