Eigen RadarYapay Zekâ
Analiz

ElevenLabs, 90’dan fazla dili destekleyen v4 konuşma modellerini yayımladı

ElevenLabs, v4 ve v4 Turbo konuşma modellerini yayımladı. Şirket yeni kuşağın 90’dan fazla dili desteklediğini, seslendirme biçimi üzerinde daha ayrıntılı denetim sunduğunu ve Turbo sürümünün sesli eylemcilerde gecikmeyi azaltmayı hedeflediğini söylüyor. Ses üretimi, dil modeli yanıtını bitirmeden başlayabiliyor. Açıklanan nitelik artışı ve hız, bağımsız karşılaştırma sonucu olarak değil şirket beyanı olarak değerlendirilmeli.

Yapay Zekâ··Gece
Kayıt stüdyosunda mikrofon, kulaklık ve ses masası.

İki yeni konuşma modeli yayımlandı

ElevenLabs, v4 ve v4 Turbo adlı konuşma modellerini yayımladı. Şirket, yeni kuşağın 90’dan fazla dili desteklediğini ve sesin duygu ile söyleyiş biçimini daha ayrıntılı yönetebildiğini söylüyor. Önceki kuşak 70 dili destekliyordu. Temel v4 modeli hazırlanmış ses içeriğine, Turbo sürümü ise düşük gecikmenin önemli olduğu sesli eylemci konuşmalarına yöneliyor. Desteklenen dil sayısı şirketin duyurduğu kapsam; dil niteliğinde bağımsız karşılaştırma değil.[1], [2]

Seslendirme komutları sıralanabiliyor

v3 ile gelen metin içi ifade etiketleri, v4’te birden fazla komutun sırasını belirlemeye olanak tanıyor. ElevenLabs, modelin konuşmacı ve önceki cümlelerin bağlamını dikkate alarak uzun parçalarda ses kimliğini daha tutarlı koruduğunu ileri sürüyor. TechCrunch’ün aktardığı şirket örneğinde, 10 saniyelik kayıttan ses kopyalama da anlatılıyor. Bu örnek ve tutarlılık nitelemesi bağımsız bir sınama sonucu olarak yayımlanmadı.[1]

Turbo yanıt bitmeden ses üretmeye başlıyor

v4 Turbo, arkasındaki dil modeli yanıtın tamamını bitirmeden ses üretimine başlayabiliyor. Bu akış, konuşmacılar arasında kısa yanıtların beklendiği sesli eylemci uygulamalarını hedefliyor. ElevenLabs, gecikmenin azaltılmasını ve daha akıcı konuşmayı modelin kullanım amacı olarak sunuyor. Açıklama, farklı sağlayıcılarla aynı koşullarda yapılmış bağımsız bir hız ölçümü vermiyor. İki modelin ayrımı, hazırlanmış seslendirme ile gerçek zamanlı konuşmanın farklı gereksinimlerine dayanıyor.[1]

Kaynakça

  1. Haber kaynağıTechCrunchElevenLabs, daha çok dil ve ses denetimi sunan v4 modellerini yayımladı↩1↩2↩3
  2. Haber kaynağıTestingCatalogElevenLabs, Eleven v4 ve v4 Turbo konuşma modellerini yayımladı↩