SteerSpeech, ana modeli değiştirmeden yapay sesin duygusunu ayarlıyor
SteerSpeech, her duygu için küçük bir dönüşüm eğitip bunu ana ses modelinin ara katmanına ekliyor. Tek ön baskıdaki deneylerde duygu yoğunluğu, konuşmacı kimliği ve söylenen metnin korunması birlikte sınandı. İngilizce konuşmalar ve öfkeye odaklanan dinleme çalışmalarında farklı dengeler ortaya çıktı: Daha güçlü duygu ifadesi her karşılaştırmada özgün sesin daha iyi korunmasını sağlamadı.
Yapay Zekâ··Akşam
Küçük dönüşümler sabit ses modelini yönlendiriyor
SteerSpeech, ses üreticisinin tamamını yeniden eğitmek yerine iç etkinlikleri değiştirerek duygu ifadesini ayarlıyor. Afsara Benazir ve çalışma arkadaşlarının tek ön baskıda sunduğu yöntem, nötr ve duygulu konuşma arasındaki farkla başlıyor. Küçük bir öğrenilmiş dönüşüm, bu yönü ara katmana eklenmek üzere düzeltiyor. Eğitimde konuşmacı kimliği, söylenen metin ve ses niteliğinin korunması da hedefleniyor.[1]
Eğitim üretilen konuşma belirteçlerini yeniden işliyor
Deneylerde metni konuşmaya dönüştüren Qwen3-TTS-0.6B kullanılıyor; her duygu için dönüşüm yaklaşık otuz üç bin parametre içeriyor. İşlem önce konuşma belirteçlerini üretiyor, sonra diziyi yeniden işleyerek eğitim sinyalini yalnız küçük dönüşüme aktarıyor. Ana ağ, ses çözücü ve uzman modeller sabit kalıyor. Kullanım sırasında uzmanların eğitim katkısı ve yeniden işleme yolu kaldırılıyor.[1]
Daha güçlü öfke, ses kimliğini korumayla çatışabiliyor
İngilizce konuşma deneyleri eğitimdeki konuşmacıları, yeni konuşmacıları ve ana dili Mandarin olup İngilizce konuşan kişileri içeriyor. Öfke için elli beş kişinin katıldığı, yöntemin adının dinleyicilerden saklandığı iki çalışma yapıldı. Bir karşılaştırmada dinleyiciler yoğunluk için SteerSpeech'i, konuşmacı kimliğini korumak için daha basit yönlendirmeyi seçti. Daha güçlü ayarlardaki başka karşılaştırmalar SteerSpeech lehine sonuçlandı. Mutluluk ve üzüntüde sonuçlar farklı; diğer diller ve ana ses modelleri henüz sınanmadı.[1]