Üretken medya modelden orkestrasyon sistemine genişliyor
Black Forest Labs tek sistem içinde görsel, video, ses ve robotik yönünü genişletirken Runway farklı üretken medya modelleri arasında otomatik seçim sunuyor; iki duyuru yetenek üretimi ile model yönlendirmesinin ayrı sistem katmanlarına dönüştüğünü gösteriyor.
Yapay Zekâ··Sabah
Tek model daha fazla medya türüne açılıyor
Black Forest Labs, FLUX 3'ün görsel, video ve sesi tek sistemde işlediğini; Video sürümünün eşzamanlı sesle 20 saniyelik klipler üretebildiğini açıkladı. Şirket testlerinde çıktılar Runway Gen-4.5'e karşı yüzde 77, Luma Ray 3.2'ye karşı yüzde 93 oranında seçildi. Video ve Action erken erişimde; aynı omurganın FLUX-mimic ile Audi üretim görevlerine uyarlandığı da bildiriliyor. Ancak karşılaştırmalar ve robotik deneme için bağımsız sonuç yok.[1]
Başka bir katman modeller arasında seçim yapıyor
Runway Media Router yeni üretim yapmak yerine modelleri maliyet, gecikme ve kaliteye göre seçiyor; fiyat tavanı ve sağlayıcı listelerini kısıt olarak kullanabiliyor. Seçimi gerekçesiyle döndürüyor, uygun seçenek yoksa hata veriyor ve deneme modu üretmeden sonucu gösteriyor. Böylece Aralık 2025'te Gen 4.5'i çıkaran Runway, kendi modelinin yanında farklı sağlayıcılara tek entegrasyon noktası sunan bir orkestrasyon katmanı kuruyor. Kalite puanı yine şirket değerlendirmesine dayanıyor.[2]
Yetenek ve yönlendirme ayrı sorunları çözüyor
FLUX 3 üretim yeteneğini görselden video, ses ve robotiğe genişletirken Media Router bu yeteneklere erişimi kalite, hız ve maliyete göre düzenliyor. Biri model katmanında, diğeri seçim katmanında çalışıyor. İki ürünün şirket içi değerlendirmelere dayanması üstünlük sonucu çıkarmayı engelliyor. İzlenecek sinyal, ortak istemlerle kör testlerde yönlendirmenin kaliteyi korurken maliyet veya gecikmeyi azaltması ve bağımsız FLUX 3 tekrarlarının performans iddialarını doğrulamasıdır.[1], [2]
İlgili köşe yazıları
Bu gündem hakkında daha fazla bilgi için ilgili köşe yazılarını okuyabilirsiniz.