Yüz ve ses stüdyoda alındı
TechCrunch muhabiri Dominic-Madori Davis, Synthesia’nın New York ofisinde dijital suretinin yapılmasına onay verdi. Ekip çok sayıda fotoğraf çekti ve 2 dakikalık sesini kaydetti. Bir sürüm Davis’in verdiği metni okuyor; etkileşimli sürüm ise onun girişim dolandırıcılığına ilişkin haberi hakkındaki soruları yanıtlıyor. Annesiyle babasının yalnızca aile içinde bilinebilecek sorularına yanıt vermeyip konuşmayı o habere döndürmesi, sınırın okur karşısındaki somut örneği.[1]
Etkileşimli surette ses önce metne çevriliyor; dil modeli soruyu işliyor, başka bir model yanıtı seslendiriyor, Synthesia’nın video modeli de yüzü oynatıyor. Davis’in anlattığı bu dört aşama, benzer görünen yüz ile konuşmanın kapsamını belirleyen parça arasındaki ayrımı açığa çıkarıyor. Görüntünün Davis’e benzemesi, sistemin Davis’in bildiği her şeye eriştiği anlamına gelmiyor.[1]
Sınırın ötesindeki veri yolu
Davis’in örneğinde onay açık: kendisi stüdyoya girdi ve sureti denedi. Şirketin müşterileri ses ve dil parçalarını Cartesia, ElevenLabs, Google veya OpenAI hizmetlerinden seçebiliyor; barındırma da müşterinin bulutunda ya da Synthesia’da olabiliyor. Bu seçenekler her kurulumun veri yolunu değiştiriyor. Suretin tek habere bağlı kalması konuşmanın kapsamını anlatıyor; fotoğrafların, ses örneğinin ve gelen soruların nerede saklandığını ise bu deney tek başına göstermiyor.[1]
Benim için belirleyici ayrım burada. Konu sınırı, muhabirin ağzından beklenmedik bir yanıt çıkmasını önleyebilir; ancak veri saklama ve erişim koşullarını kendiliğinden belirlemez. Başka bir kurulum, parçaları tek sağlayıcıda tutarak aktarımı azaltabilir. Davis’in deneyi, konuşma sınırının çalıştığını gösteriyor. Aynı netliğin veri yolu için sağlanması, sureti kullanan kurumun seçtiği modelleri, barındırmayı ve saklama koşullarını açıklamasına bağlı.[1]