EmbeddingGemma 2, cihaz içi aramaya görüntü ve sesi ekliyor
Google DeepMind, metin, kod, görüntü, ses ve videoyu ortak bir arama alanında buluşturan EmbeddingGemma 2’yi yayımladı. Uygulamalar yalnızca ihtiyaç duydukları bileşenleri yükleyip yerel içerikte anlam benzerliğine göre arama yapabiliyor. İndirilebilir ağırlıklar ve geliştirme örnekleri cihaz içi kullanımı destekliyor. Model, bulunan dosyalardan yanıt üreten uygulamalar için Gemma 4 ile de bileşen paylaşıyor.
Yapay Zekâ··Öğle
EmbeddingGemma, metin ve medyada anlam benzerliğini buluyor
Google’ın yapay zekâ araştırma birimi Google DeepMind, EmbeddingGemma 2’yi 6 Ekim’de yayımladı. Gemma 4 yapısına dayanan model, metin, kaynak kodu, görüntü, ses ve videoyu ortak sayısal gösterime dönüştürüyor. Uygulamalar bu gösterimlerle sözcükler bire bir eşleşmese de anlamca benzer içeriği bulabiliyor. Modelin ağırlıkları Apache 2.0 lisansıyla sunuluyor. Geliştiriciler böylece arama bileşenini kendi sistemlerinde çalıştırmak için indirebiliyor.[1], [2]
Cihaz üzerinde çalıştırma, dosyaların içeriğini dış sunucuya göndermeden arama yapılmasını amaçlıyor. Google, medya arşivlerinde arama yapmak ve videoda belirli anları bulmak için geliştirme örnekleri sunuyor. Ortak gösterim, farklı girdi türlerinin bir arada kullanılmasına da izin veriyor. Bu nedenle bir arama uygulaması metin ve medyayı aynı bağlam içinde değerlendirebiliyor. Örnekler, modelin yerel dosyaları bulmak için kullanılacağı yazılımlara yönelik hazırlanmış.[1]
Uygulamalar yalnızca gereken kodlayıcıları yükleyebiliyor
Tam model 740 milyon parametre içeriyor. Modelin metin ve kaynak kodu için kullanılan bölümü 270 milyon parametreli. Gerektiğinde görüntü için 170 milyon, ses için 300 milyon parametreli kodlayıcılar eklenebiliyor. Yalnızca metinle çalışan uygulama, medya kodlayıcılarını yüklemeden ilgili bölümü kullanabiliyor. Görüntü ya da ses işleyen uygulamalar ise ihtiyaç duydukları bölümü ekleyebiliyor. Bu parçalı yapı, hangi içerik türlerinin işleneceğine göre kurulum yapılmasını sağlıyor.[1]
EmbeddingGemma 2, 768 boyutlu vektörler üretiyor. Bilgiyi daha kısa gösterimlerde korumayı amaçlayan Matryoshka Representation Learning yöntemiyle 512, 256 veya 128 boyut da seçilebiliyor. Google, bu seçimin yerel vektör veri tabanının depolama ihtiyacını altıda bire kadar düşürebildiğini belirtiyor. Arama sistemi bu sayısal gösterimleri saklayıp karşılaştırıyor. Vektör uzunluğunu seçmek, geliştiricinin dosyalar için tutulacak gösterimlerin boyutunu da belirlemesine olanak veriyor.[1]
Genişleyen bağlam, aramayı Gemma 4 ile buluşturuyor
Girdi kapasitesi 8.192 belirteç; önceki EmbeddingGemma’nın dört katı. Belirteçler, modelin girdiyi işlerken kullandığı birimler. Google’ın örneklerinde aynı alan 29 görüntüye, 58 video karesine veya yaklaşık beş buçuk dakikalık sese karşılık geliyor. Farklı içerik türleri bu alanı birlikte de kullanabiliyor. Böylece geliştiriciler aramada işlenecek dosya parçalarını modelin kabul ettiği bağlama göre hazırlayabiliyor; örneklerdeki medya miktarları şirketin verdiği açıklamalara dayanıyor.[1]
Model, Gemma 4 ile metin belirteçleştiricisini ve ses kodlayıcısını paylaşıyor. Geliştiriciler yerel dosyaları bulma işini, bulunan bilgiden yanıt üretme işine bağlayabiliyor. Ağırlıklar Hugging Face ve Kaggle üzerinden indirilebiliyor. Google, desteklenen 100’den fazla dilde başarımın aynı olmayabileceğini belirtiyor. Modele güvenlik eğitimi veya çıktı denetimi uygulanmadığı, önlemlerin eğitim verisine yönelik olduğu açıklanıyor. Bu bilgiler, modelin dil kapsamı ve yayımlanan sürümün güvenlik yaklaşımını birlikte tanımlıyor.[1], [2]