AllSpark, Iris-mini ile Iris-pro'nun açık ağırlıklarını ve başarım kümelerini yürüten düzeneği yayımladı
Yapay zekâ laboratuvarı AllSpark, ağda kendi başına araştırma yürüten iki arama eylemcisinin, Iris-mini ile Iris-pro'nun ağırlıklarını herkese açtı. Küçük modelde 35 milyar, büyüğünde 397 milyar parametre var; her ikisinin tabanı Qwen dizisinden alınmış ve bağlam penceresi 256.000 belirteç. Ekip, açık ağırlıklı arama eylemcileri içinde kendi boyunun en iyisi olduğunu söylüyor ve bu puanların arkasındaki eylemci döngüsünü, araçları ve değerlendirme kodunu Iris Harness adlı düzenekle birlikte paylaşıyor; düzenek, OpenAI'nin arayüz biçimini konuşan her uç noktaya bağlanabiliyor.
Yapay Zekâ··Gece
Ağırlıklar Hugging Face'te, kod ve düzenek GitHub'da
Yapay zekâ laboratuvarı AllSpark, Iris-mini ile Iris-pro'nun ağırlıklarını model paylaşım platformu Hugging Face'teki bir derlemeye, kodu ise GitHub'daki bir depoya koydu. Yayın modellerin ötesine geçiyor: Iris Harness adlı düzenek, modelleri çalıştıran eylemci döngüsünü, kullandıkları araçları, bağlam yönetimi yöntemlerini ve ölçümde kullanılan dört başarım kümesini değerlendirme koduyla birlikte içeriyor. Düzenek, OpenAI'nin arayüz biçimini konuşan her model sunucusuna bağlanabiliyor.[1]
Bağlam yönetimi tek başına BrowseComp'ta 21,2 puana kadar fark yarattı
Ekip her başarım kümesini iki kez koştu: çalışma anındaki bağlam yönetimi bir koşuda açık, diğerinde kapalıydı. Araçlar, bağlam sınırları ve yargıç model iki koşuda değiştirilmedi. Fark büyük: ağda zor bulunan yanıtları arama becerisini ölçen BrowseComp başarım kümesinde Iris-mini, bağlam yönetimi açıkken 21,2 puana kadar daha yüksek puan aldı. Bu fark, dizgeler arasında genellikle bildirilen aralıkları aşıyor.[1]
İki boy, ortak Qwen tabanı ve ekibin sınıf birinciliği bildirimi
Iris-mini 35 milyar parametreli; Iris-pro ise 397 milyar parametreye çıkıyor. Her iki modelin tabanı Qwen dizisinden alınmış açık modeller ve bağlam penceresi 256.000 belirteç; belirteç, modelin metni işlerken kullandığı parça birimi. Ekip, iki modelin de kendi boy sınıfındaki açık ağırlıklı arama eylemcilerini geride bıraktığını söylüyor: BrowseComp puanı Iris-mini için 82,2, Iris-pro için 88,6. Bu puanlar ekibin kendi ölçümü; bağımsız bir ölçüm henüz yok.[1]