Gemini 3.8 Flash TTS, yazılı istemle ses tasarımını açıyor
Google, 23 Eylül'de Gemini 3.8 Flash TTS ile Flash-Lite TTS'i Gemini API ve Google AI Studio'da açtı. Flash TTS sesi yazılı bir istemden tasarlıyor ve sözlü onay kontrolünden sonra 30 saniyelik örnekten kopyalıyor. Kurumsal API erişimi henüz başlamadı. Hazır ses kitaplığı 2.000 sesin üzerinde duruyor.
Yapay Zekâ··Gece
İki konuşma modeli kamuya açık araçlarda
Google, 23 Eylül'de Gemini 3.8 Flash TTS ile Flash-Lite TTS'i duyurdu ve ikisi de Gemini API ile Google AI Studio'da açılıyor. Flash TTS, satır satır oyunculuk yönergesi için kurulan model. Flash-Lite TTS, yüksek hacimli seslendirme için kurulan model. Flash TTS ayrıca Gemini Notebook'ta, Flash-Lite TTS ise Google Vids'te açılıyor. The Next Web'in aktardığı aynı çarşamba yayımlaması, iki modeli de Gemini API ve Google AI Studio'ya koyuyor; Flash TTS'i oyun, sesli kitap ve podcast için yaratıcı araç, Flash-Lite TTS'i ise daha yüksek hacimli iş için ayırıyor. Açılan, kamuya açık geliştirici yolu. Yalnızca bir ürün adı gören okur, ayrımı kaçırır: bir model yazılı bir yönergeyle oyunculuk alıyor, diğeri hacimli dublaj için kuruluyor ve ikisi de duyurunun gününde aynı kamuya açık araçlarda duruyor.[1], [2]
İstem sesi tasarlıyor, örnek de kopyalayabiliyor
Flash TTS, onay kontrolünden sonra 30 saniyelik bir örnekten ses kopyalamayı sunuyor. Örneğin, kullanıcının hak sahibi olduğu bir kayıt olması ve yanında sözlü bir onay kaydı bulunması gerekiyor. Google, bu kopyaya SynthID filigranı ve C2PA kimliği eklediğini söylüyor. Kapsamı 100'den fazla dil olarak belirtiyor. AI Studio üzerinden kopyalama Illinois, Teksas, Avrupa Ekonomik Alanı, Birleşik Krallık, İsviçre ve Hindistan'da yok. The Next Web aynı 30 saniyelik yolu yazıyor ve onay kaydının, ses kurulmadan önce referans konuşmacıyla karşılaştırıldığını söylüyor. Hazır ses kitaplığını da 2.000 sesin üzerine koyuyor. Metin isteminden ses tasarımı, iki anlatıda da diğer yol: kullanıcı sesi tarif ediyor, model onu kuruyor; iş yalnızca kitaplıktan seçmek değil.[1], [2]
Kurumsal kapı kapalı kalıyor
Şirket, Gemini Enterprise API erişimini henüz başlatmadığını yazıyor. Ses karıştırma henüz açılmamış olarak geçiyor; tını, perde, hız ve aksan, bir geliştiricinin çarşamba günü açabileceği denetimler değil. The Next Web'in yayımlama anlatısı da bu kurumsal kapıyı açmıyor: kamuya açık modelleri, istemi, 30 saniyelik kopyayı ve 2.000 sesin üzerindeki kitaplığı yazıyor. Bir geliştiricinin 23 Eylül'de kullanabildiği, bu yüzden kamuya açık çift: yönlendirilmiş oyunculuk için Flash TTS ve yüksek hacimli seslendirme için Flash-Lite TTS; Gemini API, Google AI Studio, Gemini Notebook ve Google Vids içinde. AI Studio üzerinden kopyalamanın Illinois, Teksas, Avrupa Ekonomik Alanı, Birleşik Krallık, İsviçre ve Hindistan'daki engeli duruyor. Açılan kopyanın koşulları, hak sahibi olunan 30 saniyelik örnek, sözlü onay kaydı, SynthID filigranı ve C2PA kimliği.[1], [2]