Eigen RadarYapay Zekâ
Analiz

Gemini'nin eylemci video anlaması izleyeceği kareleri seçiyor, belirteci yüzde 88'e kadar kesiyor

Google DeepMind, Gemini 3.7 Flash, 3.6 Flash ve 3.5 Flash-Lite için eylemci video anlama özelliğini Google AI Studio'daki Gemini API'si ve Gemini Enterprise Agent Platform üzerinden açtı. Model videoyu sabit kare hızında okumak yerine neyi, hangi hızda, kare, ses ya da döküm olarak mı izleyeceğine kendisi karar veriyor. Google, uzun videoda belirteç kullanımının yüzde 88'e kadar düştüğünü, giderin yüzde 66'ya kadar indiğini ve doğruluğun yüzde 7'ye kadar çıktığını söylüyor. Gemini uygulaması ve YouTube'un Ask YouTube özelliği de sırada.

Yapay Zekâ··Öğle
Aydınlık bir film arşivinde bir arşivci, ışıklı masaya yayılan uzun film şeridindeki işaretli kareleri büyüteçle inceliyor; arkada bir görevli makarayı cihaza takıyor.

Google, üç Flash modelinde eylemci video anlamayı açtı

Google DeepMind, Gemini 3.7 Flash, 3.6 Flash ve 3.5 Flash-Lite için eylemci video anlama özelliğini Google AI Studio'daki Gemini API'si ve Gemini Enterprise Agent Platform üzerinden kullanıma açtı. Android Authority, Google'ın bu yeteneği söz konusu üç Flash modeline getirdiğini ve kullanıcıların videoları yükleyip çözümlettirebildiğini yazıyor. Google, ek özellik ücreti olmadan standart belirteç fiyatının uygulandığını söylüyor. Özellik bugün API üzerinden yüklenen videolarda ve YouTube videolarında çalışıyor.[1], [2]

Model izleyeceği kareyi seçiyor; Google yüzde 88 daha az belirteç söylüyor

Google'a göre model, videoyu sabit kare hızında örneklemek yerine neyi, hangi hızda ve kare, ses ya da döküm olarak mı izleyeceğine kendisi karar veriyor. Şirket, uzun videolarda sabit işlemeye göre yüzde 88'e kadar daha az belirteç kullandığını, gideri yüzde 66'ya kadar düşürdüğünü ve doğruluğu yüzde 7'ye kadar artırdığını söylüyor. Android Authority aynı yüzde 88 belirteç ve yüzde 7 doğruluk rakamlarını aktarıyor. Android Authority, Gemini'nin saniyenin altındaki değişimleri yakalayabildiğini, çok saatlik videolarda karmaşık soruları yanıtlayabildiğini, görsel bozulmaları inceleyebildiğini ve fiziksel hareket ile nesneleri sayıp izleyebildiğini yazıyor.[1], [2]

Özellik API'de açık; Gemini uygulaması ve Ask YouTube sırada

Google hedef görevler olarak saniyenin altındaki anları bulmayı, uzun videoda samanlıkta iğne aramayı, sıra dışı durum saptamayı ve eylem ile nesne saymayı sıralıyor. Android Authority, özelliğin şimdilik yalnızca Google AI Studio'daki Gemini API'si ve Gemini Enterprise Agent Platform üzerinden açık olduğunu yazıyor. Google, yakında Gemini uygulamasına, önümüzdeki aylarda da YouTube'un Ask YouTube özelliğine geleceğini söylüyor. Android Authority de Gemini uygulamasının yakın zamanda ekleneceğini ve Ask YouTube'un bu yetenekle çalışacağını aktarıyor.[1], [2]

Kaynakça

  1. Haber kaynağıGoogleGemini'nin eylemci video anlama özelliği izleyeceği kareleri seçiyor, belirteç kullanımını yüzde 88'e kadar kısıyor↩1↩2↩3
  2. Haber kaynağıAndroid AuthorityGemini'nin eylemci video anlaması uzun videoları çözümlüyor, belirteci yüzde 88'e kadar kesiyor↩1↩2↩3