Sayılar duyuruda, sınav ortada yok

Çin Bilimler Akademisi'ne bağlı Dalian Kimyasal Fizik Enstitüsü, iFlytek ve Alibaba Cloud ile birlikte geliştirdiği kimya sanayisine özel büyük dil modelinin 3.0 Pro sürümünü duyurdu. Enstitünün bildirdiği ölçümlerde metin tabanlı soru-yanıt doğruluğu yüzde 81,96, çok kipli soru-yanıt doğruluğu yüzde 80,75; bu sonuçlar 3.0 sürümüne göre yüzde 20,2 ve yüzde 31,4 iyileşme olarak sunuluyor. Ölçümlerin dayandığı kimya alanı değerlendirme sistemi ise yalnızca genel adıyla anılıyor.[1]

Bir doğruluk oranının anlamı, soru kümesinin ne olduğuna bağlıdır. Soruların hangi alt alanlardan geldiği, kaç tane olduğu, kimin hazırladığı ve neyin doğru sayıldığı bilinmeden, iki oran arasındaki küçük fark da 3.0 sürümüne göre bildirilen sıçrama da sınanamaz. İyileşme yüzdeleri ayrıca genel puan üzerinden veriliyor; genel puanın iki doğruluk oranıyla aynı ölçek olduğu duyuruda gösterilmiyor.[1]

Yürütme bir sonuç mu, bir tasarım mı?

Duyurunun asıl iddiası, modelin bilgi sorularını yanıtlamaktan görevleri yürütmeye geçmesi. Anlatılan yapı dört katmanlı: büyük model uzmanlık bilgisini anlıyor, çok kipli bilgiyi çözümlüyor ve görev planlıyor; eylemciler süreci parçalara ayırıyor, araçları çağırıyor, sonucu doğruluyor ve görev hedefi çevresinde ayar yapıyor; altta uzmanlık becerileri, araçlar ve uygulama alanları duruyor. Bu, bir mimarinin betimlenmesidir ve kendi başına bir ölçüm sonucu taşımaz.[1]

Bu geçişin ölçüsü soru-yanıt doğruluğu olamaz. Yürütmenin ölçüsü, kaç görevin baştan sona tamamlandığı, aracın hangi sıklıkla yanlış çağrıldığı, hatanın hangi adımda yakalandığı ve doğrulama adımının hangi hataları kaçırdığıdır. Duyuru bu ölçülerin yerine kayıtlı 300'den fazla kuruluşu ve 14 milyon sınırını aşan API çağrısını anıyor; bunlar kullanım büyüklükleridir ve bir görevin doğru yürütülüp yürütülmediğini göstermez. Daha zayıf bir okuma da mümkün: enstitü yürütme ölçümlerini yapmış olabilir ve bir kurum duyurusuna sığmadığı için yazmamış olabilir.[1]

Bu sayıyı ne sınardı?

Enstitü, daha güçlü akıl yürütme ve çok araçlı işbirliği yetenekleriyle ChemELLM 4.0'ı geliştireceğini söylüyor. O duyuru, değerlendirme kümesinin adını, soru sayısını ve puanlama kuralını birlikte taşırsa bildirilen doğruluk oranları bağımsız olarak sınanabilir hale gelecek; bu bilgiler yine verilmezse sayılar geliştiricinin bildirdiği sonuçlar olarak kalacak.[1]

Adın verilmemesi şaşırtıcı sayılmaz. Bu metin bir kurum duyurusu ve bu tür metinler ölçüm ayrıntısını çoğu zaman ayrı teknik belgelere bırakır. O belge ortaya çıkana kadar yüzde 81,96 ile yüzde 80,75, kimya alanında bir yeteneğin ölçüsü olarak değil, geliştiricinin bildirdiği sonuçlar olarak durur; bağımsız bir sınamayla karşılaştırılamaz.[1]