Liquid AI, Modular ve PyTorch çıkarımı tek donanım yolundan çıkarıyor
Liquid AI’nin taslak modelleri, açık kaynaklı Mojo derleyicisi ve IBM Spyre uyarlayıcıları; çıkarım giderini çözümleme hızı, hızlandırıcı taşınabilirliği ve model uyumluluğu üzerinden azaltmaya çalışıyor.
Yapay Zekâ··Öğle
Taslak modeller aynı aileyi daha hızlı çalıştırıyor
Liquid AI, LFM2.5 ailesi için üç DSpark taslak modeli yayımladı. Şirketin ölçümlerine göre tahmine dayalı çözümleme, GPU’da çıktı hızını 3,18 kata, aygıt üzerinde ise 2,87 kata kadar çıkarıyor. H100 üzerinde 2,6 milyar parametreli modelin ortalaması saniyede 323 jetondan 864 jetona yükselerek 2,67 kat hızlandı; aynı modelde işlev çağırma gecikmesi ortalama yüzde 57 azaldı. Küçük taslak başlıkları Safetensors ve GGUF biçimlerinde sunuluyor; llama.cpp ile SGLang desteği de ilk günden geliyor. Bütün başarım rakamları Liquid AI’nin kendi ölçümlerine dayanıyor.[1]
Mojo açılırken hızlandırıcı listesi genişledi
Modular, ModCon 2026’da Mojo programlama dilini ve derleyicisini Apache 2.0 lisansıyla bütünüyle açık kaynaklı hale getirdi; Modular Cloud çıkarım hizmetini de genel kullanıma açtı. Mojo’nun üstündeki MAX katmanı kaynak kodu görülebilir bir lisans altında kalırken platform artık Nvidia, AMD, AWS Trainium, Google TPU, Apple Silicon ve Qualcomm veri merkezi çiplerini destekliyor. Şirket, farklı hızlandırıcılara tek bir yazılım yolu açmayı amaçlıyor. Forbes’un aktardığı AMD MI355X ile Nvidia B200 karşılaştırması da Modular’ın kendi ölçümlerine dayanıyor; bu nedenle haberin doğrulanmış olgusu taşınabilirlik kapsamı, başarım üstünlüğü ise şirket iddiası olarak kalıyor.[2]
On üç uyarlayıcı binlerce modeli Spyre’a taşıdı
PyTorch bloguna göre yapay zekâ eylemcileriyle yazılan 13 uyarlayıcı, HuggingFace’te en çok indirilen 10.000 gömme modelinin 7.960’ını IBM Spyre hızlandırıcısında çalışabilir hale getirdi. Nisan ortası ile haziran sonu arasındaki ölçümlerde uyarlayıcısı bulunan bu modellerin 6.804’ü uçtan uca sınamayı geçti. Uyarlayıcılar, modelin yaptığı hesabı değiştirmeden Spyre derleyicisinin işleyebileceği eşdeğer işlemler kuruyor. Ancak blog, derleyicinin komşu işlemleri birleştirmesi yüzünden hatanın başladığı yeri bulmanın zorlaştığını ve eylemcilerin tek bir deneyden aşırı kesin sonuç çıkarabildiğini de söylüyor; geniş uyumluluk, insan gözetimli hata ayıklama yükünü ortadan kaldırmıyor.[3]