Eigen RadarYapay Zekâ
Analiz

Etkileşimli yapay zekânın darboğazı yanıt süresine indi

Dikkat katmanı tasarımı, hızlı ses üretimi ve düşük maliyetli aracı modeller; etkileşimli yapay zekâda gecikmenin modelden hizmet zincirinin tamamına yayıldığını gösteriyor.

Yapay Zekâ··Sabah
Uzun bağlam akışını seçip kısa bir ses dalgasına dönüştüren dikkat geçidi

Uzun bağlam dikkat katmanında daralıyor

NVIDIA, uzun bağlamın gecikmesini yalnızca daha hızlı donanım sorunu olarak ele almadı. Yayımlanan çözümleme, sorgu başlığı sayısının anahtar-değer başlığı sayısına oranı, başlık boyutu ve dizi uzunluğunun GPU üzerinde çıkarım süresini nasıl belirlediğini ölçüyor. Nidhi Bhatia, Samkit Jain, Sai Kishan Pampana, Ritika Borkar ve Bita Darvish Rouhani imzalı yazıya göre çözme aşamasındaki başarım grup boyutuyla doğrusal ölçekleniyor ve grup boyutu iki katına çıktığında yaklaşık iki kat hızlanma elde ediliyor; ön dolum aşaması ise bu parametreye duyarsız kalıyor. Başlık boyutu için GPU döşeme boyutlarına oturması amacıyla 128 veya 256 öneriliyor. Ön dolum giriş uzunluğuyla karesel, çözme ise anahtar-değer önbelleği uzunluğuyla doğrusal büyüyor. Ölçümler hem dikkat hesabı hem de anahtar-değer önbelleği için FP8 duyarlıkla yapılmış; iki anahtar-değer başlıklı gruplanmış sorgu dikkati kullanan NVIDIA Nemotron 3 örnek olarak veriliyor. Yazı TensorRT-LLM içindeki tensör paralelliği, geniş uzman paralelliği ve Helix paralelliği yaklaşımlarını dört tasarım önerisinde topluyor. Yeni bir model ağırlığı ya da kod paketi yayımlanmadı.[1]

Ses ürünü milisaniyelerle kuruluyor

Ses tarafında Smallest.ai gecikmeyi doğrudan ürünün merkezine yerleştirdi. Seligman Ventures'ın yönettiği yatırım turuna Sierra Ventures ve 3one4 Capital katıldı; değerleme açıklanmadı. Şirket, insanların aynı anda dinleyip düşünüp konuşmasına benzeyen özelleşmiş bir ses modeli geliştiriyor. Soru modelin bilgi alanını aştığında müşteri daha büyük bir dil modeline aktarılıyor. Ürün kurumsal müşteri desteğinde gerçek zamanlı konuşmaya, aksanlara, çok dilliliğe ve gürültülü ortamlara odaklanıyor. Böylece hız yalnızca ses üretim süresi değil, küçük model ile daha büyük model arasındaki aktarımın da özelliği hâline geliyor.[2]

Fiyat ve görev süresi aynı denklemde

DeepSeek'in yeni sürümü aracı ölçütleri ve düşük belirteç fiyatını aynı duyuruda birleştirdi. Şirket mimariyi ve parametre sayısını değiştirmediğini, ilerlemenin eğitim ve eğitim sonrası iyileştirmeden geldiğini belirtti. Kendi ölçümlerinde çeşitli yazılım görevlerinde daha yüksek sonuçlar bildirdi, ancak bağımsız değerlendirme henüz bulunmuyor. Responses biçiminin doğrudan desteklenmesi modelin aracı iş akışlarına bağlanmasını kolaylaştırıyor. Üç gelişmenin birleştiği nokta, etkileşimli yapay zekânın tek bir model puanıyla açıklanamaması. Dikkat katmanının uzun bağlamdan neyi tuttuğu, ses zincirinin yanıtı ne kadar hızlı ürettiği ve modelin görev başına kaç deneme gerektirdiği birlikte hissedilen gecikmeyi belirliyor. Ucuz belirteç, yavaş ya da çok tekrarlı bir iş akışını tek başına etkileşimli hâle getirmiyor. Bu zincirde her katman farklı bir bekleme türü yaratıyor. Dikkat tasarımı uzun bağlamı işlerken hesap yükünü, ses modeli konuşmanın başlamasına kadar geçen süreyi, aracı model ise görevin tamamlanması için gereken adım sayısını belirliyor. Bir katmandaki kazanım diğerindeki gecikmeyi ortadan kaldırmıyor. Bu nedenle ürün ölçümü ilk ses paketini, bütün yanıtı ve tamamlanan görevin toplam maliyetini ayrı ayrı izlemek zorunda. Kullanıcının hızlı hissettiği sistem, bu üç ölçünün aynı anda kabul edilebilir kaldığı sistemdir.[3], [1], [2]

Kaynakça

  1. Haber kaynağıNVIDIANVIDIA, uzun bağlamlı çıkarımda dikkat katmanı için tasarım kılavuzu yayımladı↩1↩2
  2. Haber kaynağıTechCrunchSesli yapay zekâ girişimi Smallest.ai 13 milyon dolarlık A serisi turu topladı↩1↩2
  3. Haber kaynağıOfficeChaiDeepSeek, V4-Flash-0731 sürümünü genel denemeye açtı↩