DeepSeek, yapay zekâ modellerinin kullandığı matris hesaplama kitaplığı DeepGEMM’in Huawei Ascend sürümünü açık kaynak olarak yayımladı. Kod deposu Ascend 950 desteği ile önceki DeepGEMM arayüzüyle uyumu belgeliyor. Bu adım, geliştiricilere model işlemleri için yeni bir donanım yolu açıyor; depodaki hız rakamları ise DeepSeek’in kendi ölçümleri ve bütün uygulamanın hızlanacağını göstermiyor.
Yapay Zekâ··Öğle
Kod açık kaynakta
DeepSeek, DeepGEMM matris hesaplama kitaplığının Huawei Ascend işlemcilerine uyarlanmış sürümünü 30 Eylül’de açık kaynak olarak yayımladı. DeepGEMM, büyük dil modellerinin eğitimi ve yanıt üretimi sırasında yinelenen matris çarpımı gibi işlemleri yürütüyor. Bu sürüm bir sohbet modeli değil, o modellerin kullandığı hesaplama katmanındaki yazılım. DeepSeek’in deposu Ascend 950 desteğini ve önceki DeepGEMM arayüzüyle uyumu belgeliyor. Böylece geliştiriciler, desteklenen donanım yolları arasında aynı yazılım çağrılarını koruyabiliyor. Bağımsız haber de DeepSeek’in Huawei Ascend için araç paketini yayımladığını doğruluyor; pakette DeepGEMM’in yanı sıra başka bileşenler de var.[1], [2]
DeepGEMM, üç veri türünde matris işlemlerini kapsıyor
Depoda BF16, FP8 ve FP4 veri türleriyle matris işlemleri, çoklu sorgu dikkat mekanizmasının puan hesaplaması ve çoklu uzman modeller için çekirdekler listeleniyor. Ascend uygulaması, matris düzeni, hizalama ve bellek adresi gibi düşük düzey ayrıntıları bir yazılım katmanında topluyor. Proje, seyrek veri yükleme ile işlem hattı düzenlemesi gibi donanıma özgü yöntemler kullandığını söylüyor. Kurulum için Huawei Ascend NPU, CANN 9.20 araç takımı, Torch NPU ve C++20 desteği gerekiyor. Bu gereksinimler, kodun yalnızca indirilmesiyle herhangi bir sistemde çalışmayacağını gösteriyor; hedefi belli bir hızlandırıcı ailesi.[1]
Hız ölçümleri çekirdek işlemlerle sınırlı
DeepSeek, geliştirme ve doğrulamayı Ascend 950 serisinde yaptığını belirtiyor. Deponun tabloları farklı veri türleri ve matris boyutları için gecikme ile işlem gücü sonuçları veriyor; bazı yoğun işlemlerde donanım sınırına yakın kullanım bildiriliyor. Bunlar geliştiricinin ölçümleri. Depoda ölçümleri yeniden üretmeye dönük sınamalar bulunsa da bağımsız, uçtan uca model başarımı karşılaştırması yayımlanmış değil. Bir matris çekirdeğinin hızlanması, bütün uygulamanın aynı oranda hızlanması demek değil: modelin diğer adımları, bellek aktarımı ve sistemin kurulumu toplam sonucu etkiler. Sürümün somut yeniliği, mevcut model işlemlerine Huawei donanımında açık bir uygulama yolu sunması. Önceki DeepGEMM arayüzüyle uyum iddiası, mevcut çağrıları bütünüyle yeniden yazmadan donanım yolunu değiştirme olanağına işaret ediyor. Yine de CANN araç takımı ve Torch NPU bağımlılıkları, uygulamanın Ascend ortamına hazırlanmasını gerektiriyor. Depoda genel model hızına ilişkin bağımsız sonuç bulunmadığından, farklı matris şekilleri ve veri türleri için yayımlanan çekirdek sonuçlarını sistem düzeyinde tek bir hız sayısına çevirmek mümkün değil. Geliştiriciler hangi işlemlerin kitaplık kapsamına girdiğini ve kendi kurulumlarının koşullarını ayrı ayrı değerlendirmek durumunda.[1]