Microsoft, MAI-Transcribe-2-Streaming modelini MAI-Voice-2.1 ve Flash sürümüyle birlikte kullanıma açtı. Canlı döküm modeli, konuşma sürerken geçici metin üretiyor ve yeni sözcükler geldikçe metni düzeltiyor. Şirket otomatik dil tanıma ile diller arasında aynı konuşmacı sesini koruyan ses üretimini bir arada sunuyor. Üç modele Microsoft Foundry üzerinden erişiliyor. Chatter adlı gösterim, bileşenlerin bir konuşma eylemcisinde birlikte çalışmasını örnekliyor.
Yapay Zekâ··Sabah
Microsoft ses modellerine canlı dökümü ekledi
Microsoft, 1 Ekim’de MAI-Transcribe-2-Streaming modelini konuşma üreten MAI-Voice-2.1 ve MAI-Voice-2.1-Flash ile birlikte kullanıma açtı. Üç modele şirketin yapay zekâ uygulamaları geliştirme platformu Microsoft Foundry üzerinden erişiliyor. Canlı döküm modeli, gelen konuşmayı metne çeviriyor; diğer modeller sözlü yanıt üretiyor. Yeni ürünler, dinleme ve konuşma işlerini ayrı bileşenler halinde sunuyor. Bu bileşenler, bir konuşma eylemcisinin oluşturulmasında birlikte kullanılabiliyor.[1], [2]
Yeni sözcükler geldikçe geçici metin düzeltiliyor
Döküm modeli, konuşmacının sözünü bitirmesini beklemeden ilk metin tahminlerini üretiyor. Sonraki sözcükler bağlamı genişlettikçe tahminler değiştiriliyor ve sonunda kararlı döküm oluşturuluyor. Microsoft, konuşulan dilin kesintisiz olarak otomatik saptandığını belirtiyor. Şirket canlı dikteyi, altyazıyı ve arayan kişi isteğini tamamlamadan işlem hazırlığına başlayabilen eylemcileri kullanım örnekleri arasında sayıyor. Geçici metinler, konuşma devam ederken uygulamanın işleyeceği sözcükleri sağlıyor.[1]
Ses modelleri diller arasında konuşmacıyı koruyor
Microsoft, ses modellerinin desteklenen diller arasında aynı konuşmacının sesini koruduğunu belirtiyor. Dil değiştiren bir öğretim uygulaması ve kendisine yöneltilen dilde yanıt veren yardımcı, bu kullanımın örnekleri. İki model de kısa bir ses örneğinden ses kopyalamayı destekliyor. Şirket, kötüye kullanımı önlemek üzere rıza denetimleri bulunduğunu söylüyor. MAI Playground içindeki Chatter gösterimi, dinleme, akıl yürütme ve konuşma bileşenlerini canlı görüşmede bir araya getiriyor.[1]