GPT-Live-1, API uygulamalarının aynı anda dinleyip konuşmasını sağlıyor
OpenAI, GPT-Live-1'i API üzerinden yayımlayarak geliştiricilere konuşurken dinleyebilen çift yönlü bir ses modeli sundu. TestingCatalog; yayımı, eşzamanlı konuşmayı, söz kesme yönetimini ve on iki sesi bağımsız olarak doğruluyor. OpenAI ayrıca özel sesler ile telefon şebekesi desteği ekliyor, kullanımı dakikada 5 sent olarak fiyatlandırıyor; yayımladığı başarım rakamları bağımsız sınama değil, şirket ölçümleri.
Yapay Zekâ··Gece
Dinleme ile konuşma aynı akışta birleşiyor
OpenAI, GPT-Live-1'i API üzerinden geliştiricilere açtı. Çift yönlü tasarım, bir tarafın bitmesini bekleyip öbür tarafın başlaması yerine uygulamanın konuşurken dinlemesine izin veriyor. TestingCatalog; yayımı, eşzamanlı dinleme ile konuşmayı ve söz kesme yönetimini bağımsız olarak bildiriyor. Model, OpenAI'nin ChatGPT içinde zaten kullanıldığını söylediği GPT-Realtime-2.1'in yerini alıyor.[1], [2]
Sesler ve telefon desteği kullanım yollarını genişletiyor
Sürüm, farklı aksan, ağız ve dillerde on iki yeni ses içeriyor; TestingCatalog da haberinde on iki sesi belirtiyor. OpenAI, özel ses ve telefon şebekesi desteği ekleyerek geliştiricilerin modeli uygulamaların yanı sıra telefon hizmetlerinin arkasına yerleştirmesini sağlıyor. OpenAI, telefonla yapılan rezervasyonları karşılayan Yelp'i erken kullanıcı olarak adlandırıyor. Kullanım dakikası 5 sent olarak fiyatlandırılıyor.[1], [2]
Yayımlanan artışlar OpenAI'nin ölçümleri
OpenAI, önceki modele göre çift yönlü etkileşim ile araç çağırma isabetinin yükseldiğini, sıra alma gecikmesinin düştüğünü ve bankacılık desteği sınamasındaki başarı oranının arttığını bildiriyor. Bu karşılaştırmalar şirketin kendi ölçümleri; eldeki haberler bağımsız bir başarım sonucu sunmuyor. Dolayısıyla yayım erişimi, yetenekleri ve fiyatı ortaya koyuyor; gerçek kullanımdaki gecikme, isabet ve arama niteliği OpenAI sınamalarının dışındaki kullanımlarda görülecek.[1]