Örnek kısalıyor

ElevenLabs, v4 ve v4 Turbo ile konuşma üretimini hızlandırdığını, 90'dan fazla dili desteklediğini ve bir sesi 10 saniyelik örnekten kopyalayabildiğini söylüyor. Son iddia, şirketin duyurusuna dayanıyor; haberde bağımsız bir sınama yok. Yine de tasarımın yönü açık: ses kopyalama için gereken giriş daha kısa ve konuşma eylemcisi, arkasındaki dil modeli yanıtı bitirmeden konuşmaya başlayabiliyor.[1]

Kısa bir örnek, konuşmacının ürünü kullanma izni verdiğini kendi başına anlatmaz. Aynı 10 saniye, kişinin bilerek sunduğu bir kayıttan da, başka amaçla paylaşılan bir videodan da alınabilir. İkinci yolun burada kullanıldığını ileri sürmüyorum; duyurunun ölçmediği fark bu. Bir sesin teknik olarak taklit edilebilmesi ile o sesin belirli bir kullanım için izinli olması ayrı denetimler gerektirir.[1]

Konuşmada görünmeyen kişi

v4, metnin bağlamına göre söyleyişi değiştirmeyi ve ifade etiketlerini üst üste kullanmayı da hedefliyor. Bu, dinleyenin karşısındaki sesin tonunu tek bir sabit örnekle eşleştirmesini güçleştirebilir; daha iyi ifade denetimi tek başına aldatma kanıtı değildir. Telefonun öbür ucundaki kişinin rızası, sesin kime ait olduğundan da farklıdır. Konuşma eylemcisi bir insan sesini taklit ediyorsa, arayanın bunu bilmesi ve ses sahibinin kullanıma izin vermesi iki ayrı sorudur.[1]

ElevenLabs’in haberde anlatılan yeni sürümü dil sayısı, gecikme ve ifade denetimi hakkında ayrıntı veriyor. Aynı haber, ses sahibinin iznini sınayan bir yöntem, kullanım kapsamını gösteren bir belge ya da itiraz yolu tarif etmiyor. Bu eksiklik, şirketin böyle önlemleri hiç olmadığı sonucuna götürmez. Değerlendirme için gerekli somut belge, 10 saniyelik örnekle oluşturulan sesin kimin onayıyla hangi işte kullanılabileceğini ve iznin nasıl geri alınacağını açıkça anlatan kuraldır.[1]