Ağırlık dosyasından çalıştırılabilir çizgeye
vLLM 0.26.0, Inkling için tek bir model sınıfı eklemekle yetinmiyor. Sürüm; temel modellemeyi, parçalara ayrılmış CUDA çizgelerini, Hopper donanımındaki FA4 göreli dikkati, bir adımlık spekülatif kod çözmeyi, LoRA uyarlamasını ve NVFP4 nicemlemeyi birlikte getiriyor. 411 değişikliklik bu paket, “model destekleniyor” cümlesinin ağırlıkları okuyabilmekten daha geniş olduğunu ilk bakışta gösteriyor: aynı mimarinin eğitim sonrası uyarlama, nicemleme ve üretim yollarında da tutarlı kalması gerekiyor.[1]
llama.cpp'nin b10142 derlemesi MiniMax-M3 için benzer bir zinciri başka bir çalışma ortamında kuruyor. Metin yolu; gruplanmış sorgu dikkati, sorgu ve anahtar başına normalleştirme, kısmi döndürmeli konumlama ve yönlendirilmiş uzmanları bir araya getiriyor. Ardından görüntü kulesi, çoklu ortam izdüşümü, seyrek dikkat, istem önbelleği ve 32 bit kayan noktalı önbellek hesabı ekleniyor. Model dosyası aynı kalsa bile çalıştırılabilir çizge, görüntü önişleme ve durum yönetimi ayrı ayrı uyumlandırılıyor.[2]
Dikkat ve önbellek donanıma kadar uzanan bir arayüz
İki sürümün ortak mekanizması dikkat hesabının çalışma zamanı durumuna dönüşmesinde yatıyor. vLLM artık her KV önbellek grubu için ayrı dikkat arka ucu seçebiliyor, kayan pencere desteğini arka ucun açık bir yeteneği olarak tanımlıyor ve önbelleği CPU'ya ya da nesne deposuna aktarabiliyor. llama.cpp ise MiniMax-M3'ün seyrek dikkat seçimini öndoldurma ve kod çözme arasında tutarlı kılmak, çizgeyi yeniden kullanmak ve dizin maskesinin GPU'ya taşınan bölümünü küçültmek için özel yollar ekliyor. Buradaki çıkarım, mimari desteğin durum biçimiyle de sözleşme yaptığıdır. Daha dar bir açıklama da mümkün: Bu iki model alışılmadık dikkat düzenlerine sahip olabilir ve sıradan yoğun modeller daha küçük bir bütünleştirme yüzeyi gerektirebilir.[1], [2]
Bu durum sözleşmesi donanım matrisini büyütüyor. vLLM sürümü AMD ROCm, Intel XPU, CPU ve çeşitli NVIDIA yollarında ayrı çekirdekler ile düzeltmeler taşıyor. llama.cpp aynı MiniMax-M3 değişikliğini CUDA, ROCm, Vulkan, OpenVINO ve SYCL paketlerinin yanı sıra macOS, Linux, Android ve Windows yapılarına yayıyor. Bir arka uçta derlenmesi, diğerinde doğru sonuç ya da kabul edilebilir bellek davranışı üreteceğini göstermiyor. Öte yandan paket sayısı tek başına bakım kalitesini kanıtlamaz; geniş matris, sınamaların derinliği yetersizse yalnızca daha çok dağıtım hedefi anlamına gelebilir.[1], [2]
Destek beyanı artık bir sınama matrisi
Çalıştırma katmanının son sözleşmesi operasyonla kuruluyor. vLLM, OpenAI uyumlu uç noktalarda yeni parametreler eklerken dilbilgisi derleme hatasının motoru çökertmesini önlüyor; sunucu dosya yollarını hata yanıtlarından temizliyor ve sınırsız istek yayılımını engelliyor. llama.cpp tarafında istem önbelleği, çoklu akış, önbellek yeniden kullanımı ve kuyruk budamasından sonra eski kalan dizin verisi aynı MiniMax-M3 yolunda ele alınıyor. Bunlar modelin “zeka”sını değiştirmiyor; modeli bir hizmet olarak güvenilir biçimde çalıştırmanın parçası oluyor.[1], [2]
Her iki proje kendi düzeneklerinde hız ve bellek sonuçları veriyor; görevler, donanımlar ve ölçüm birimleri farklı. Bu rakamların ortak bir yarış tablosu için dayanağı yok. Geliştirici açısından daha kullanışlı çıktı bir destek bildirimidir: model mimarisi ve çoklu ortam yolu, dikkat ve önbellek anlamı, doğrulanmış donanım arka uçları, nicemleme biçimleri ve sunucu API'si tek sürüm altında eşleştirilmeli. Yeni model ailesi seçenek kazandırıyor; karşılığında sürüm bağlarının, arka uç sapmalarının ve önbellek hatalarının izleneceği daha büyük bir gerileme matrisi doğuyor. Destek rozeti bakım dönemini başlatıyor.[1], [2]