Cloudflare’ın Clef-omni modeli ses ve videodan yapılandırılmış karar veriyor
Cloudflare, ses ve videoyu karar modeli girdilerine ekleyen Clef-omni’yi Workers AI’da kullanıma açtı. Model, izin verilen yanıtları tek işlem geçişinde puanlıyor ve videonun sesini görüntü kareleriyle eşleştiriyor. Yayımlanan ağırlıkları inceleyen bağımsız çalışma, doğrudan medya işleme yolunu doğruluyor. Uygulamalar, önce sesi yazıya çevirmeden sesleri ve görüntüleri birlikte gönderebiliyor. Çıktı, serbest bir açıklama yerine verilen seçeneklerin olasılıklarını içeriyor.
Yapay Zekâ··Akşam
Ses ve video doğrudan karar modeline giriyor
Bulut altyapısı şirketi Cloudflare, Clef-omni’yi 9 Ekim’de model barındırma hizmeti Workers AI’da kullanıma açtı. Yeni model, metin ve görüntünün yanında ses ve video da alıyor. Uygulamanın açıkça izin verdiği yanıtlara olasılık atıyor; serbest metin üretmiyor. Florian Zimmermeister’in yayımlanan ağırlıklar ve başvuru kodu üzerindeki incelemesi, medyanın doğrudan karar yoluna girdiğini doğruluyor.[1], [2]
Videonun sesi görüntü kareleriyle eşleştiriliyor. Uygulamalar, konuşmayı önce yazıya çevirip ayrı bir modele karar verdirmek yerine ses ve görüntü bilgisini aynı istekte sunabiliyor. Desteklenen medya arasında WAV ve MP3 sesleri ile MP4 ve WebM videoları var. Uygulama, aynı istek içinde yazılı içerik ve görüntü de sunabiliyor.[1]
Model izin verilen yanıtları tek geçişte puanlıyor
Clef-omni, farklı veri türlerini işleyen uzman karışımı modeli Qwen3-Omni-30B-A3B-Instruct üzerine kurulu. Cloudflare, anlama görevini yürüten gövdeyi korurken konuşma üretme bileşenlerini karar yolunun dışında bırakıyor. Model, tanımlı soruların izin verilen tüm yanıtlarını tek işlem geçişinde puanlıyor. Model, seçeneklerin olasılığını hesaplarken yazılı içerikten, sesten ve görüntüden yararlanıyor; sesli yanıt veya yazılı açıklama üretmiyor.[1]
Donanım denetimi fotoğrafı, sesi ve videoyu birleştiriyor
Cloudflare, arayüzü kurulu bir birimin fotoğrafı, çalışırken alınmış ses kaydı ve pervanesinin videosuyla örneklendiriyor. Sorular etiketin görünürlüğünü, sesin olağandışı olup olmadığını ve pervanenin çalışmasını ele alıyor. Model, mevcut System One uygulama arayüzünü kullanıyor ve Cloudflare’ın yapay zekâ isteklerini yöneten AI Gateway hizmetiyle çalışıyor. Workers AI isteğinde yeni model kimliği ve model seçicisi belirtiliyor.[1]