Çok dilli ses, transformer seçenekleri ve daha az bellek isteyen damıtma yöntemi, açık model geliştirmede mimari, arayüz ve eğitim giderinin birlikte çeşitlendiğini gösteriyor.
Yapay Zekâ··Gece
Açık ağırlıklar sese uzanıyor
NVIDIA, çok dilli seslendirme modeli Magpie TTS'i Hugging Face üzerinde kendi açık model lisansıyla yayımladı. Model İngilizce, İspanyolca, Fransızca, Almanca, İtalyanca, Vietnamca, Mandarin, Hintçe, Japonca, Modern Standart Arapça, Korece ve Brezilya Portekizcesi olmak üzere 12 dili kapsıyor. Açık ağırlıklar, ekiplerin modeli kendi donanımında çalıştırmasına, kendi yazılım yığınındaki gecikmeyi ayarlamasına ve belirli kullanım alanları için özelleştirmesine olanak veriyor. Bu dağıtım biçimi kaynak kodun tümünün açık olduğu anlamına gelmiyor; kullanım NVIDIA'nın kendi açık model lisansına bağlı. Duyuru özellikle ilk sesin çıkış süresine odaklanıyor. NVIDIA, B200 grafik işlemcisinde ilk sese kadar 32 ms ve 64 eşzamanlı akışta gerçek zamana göre 320 kat hız bildirdi. Şirket, bu aralığın sesli bir eylemcinin akıcı ya da gecikmeli hissedilmesini belirlediğini söylüyor. Gecikme ve verim sayıları NVIDIA'nın kendi ölçümleri ve bağımsız olarak yinelenmiş değil. Yine de yayın, açık model çalışmasının yalnızca yazılı istem ve yanıt arayüzüyle sınırlı kalmadığını gösteriyor: ses üretimi, dil kapsamı ve canlı etkileşim gecikmesi, ekiplerin indirip kendi ortamında çalıştırabildiği modelin temel özellikleri arasına giriyor.[1]
Transformer dışındaki yollar çoğalıyor
MIT Technology Review'ün derlemesi, metin uzadıkça işlem giderinin hızla büyümesine karşı farklı mimari yollar deneyen girişimleri bir araya getiriyor. Miami merkezli Subquadratic, her kelimeyi diğer bütün kelimelerle karşılaştırmak yerine seyrek dikkat kullanan SubQ üzerinde çalışıyor. Manifest AI, tüm bağlamı taşımak yerine konuşma ilerledikçe yenilenen özetler tutan bir yaklaşımı sınıyor. Liquid AI, transformer yapısını kendi sıvı sinir ağlarıyla birleştiriyor ve modellerinin 34 milyon kez indirildiğini bildiriyor. Inception metni sırayla üretmek yerine bloklar halinde oluşturan yayılım tabanlı bir yol izliyor; şirket Mercury 2'nin OpenAI'nin bazı GPT-4 modelleriyle benzer sonuçları 10 kat daha hızlı verdiğini savunuyor. Pathway ise dikkat düzeneğinin yerine durum uzayı matematiğini koyuyor. Bu girişimlerin ortak bir yeni mimaride birleştiği söylenemez; derlemenin gösterdiği tablo, aynı işlem gideri sorununa seyrek dikkat, yuvarlanan özet, sıvı ağ, yayılım ve durum uzayı gibi ayrı yanıtların verilmesi. Başarım savları da şirketlerin kendi açıklamalarına dayanıyor ve bağımsız bir değerlendirmeyle desteklenmiyor. Model geliştirmedeki genişleme böylece tek bir halef arayışından çok, uzun bağlamı taşımak ve metin üretmek için birden fazla hesaplama yönteminin aynı anda sınanması biçimini alıyor.[2]
Damıtma daha küçük bir eğitim düzenine sığıyor
Multiverse Computing'in yayımladığı yöntem, var olan bir model ailesini daha düşük kaynakla küçültme tarafında iki darboğazı hedefliyor. İlk değişiklikte öğretmen modelin ilk 100 çıktı puanı bir kez hesaplanıp önbellekte tutuluyor; böylece öğretmen model eğitim boyunca bellekte kalmıyor. İkinci değişiklik, sözlük boyutu ile dizi uzunluğunun çarpımı kadar büyük kayıp matrisini bir kerede oluşturmak yerine veriyi parçalar halinde işliyor. Ekibin ölçümüne göre 32K belirteçte tepe bellek kullanımı 85,2 gibibayttan 5,45 gibibayta, GPT-OSS 20B için adım süresi 57,0 saniyeden 12,23 saniyeye iniyor; eğitim düzeni de 4 GPU düğümü yerine 1 düğüme sığıyor. Uygulama açık kaynaklı olarak yayımlandı ve yöntem arXiv:2608.03796 numaralı, henüz hakem değerlendirmesinden geçmemiş ön baskıda anlatılıyor. 8 milyar parametreli öğretmenden damıtılan 3,2 milyar parametreli öğrenci modelin BoolQ ve HellaSwag üzerinde doğruluğun büyük bölümünü koruduğu ileri sürülüyor, ancak sayfada iki veri kümesi için sayısal sonuç yok. Magpie TTS indirilebilir bir ses arayüzü sunuyor, transformer seçenekleri mimariyi çeşitlendiriyor, bu çalışma ise daha küçük bir eğitim düzenini tarif ediyor. Açıklık burada üç ayrı düzeyde görülüyor: ağırlıkların dağıtılması, mimarinin yeniden kurulması ve eğitim yönteminin kodla paylaşılması.[1], [2], [3]