Apple, metin ve görsel üretimini tek üretim akışında birleştiriyor
Apple'ın STARFlow2 açıklaması, anlama, akıl yürütme ve iç içe metin-görsel üretimini tek üretim düzeninde ele alıyor. Mimari, dil modelinin soldan sağa sırasını, nedensel maskesini ve KV önbelleğini paylaşan akışlara dayanıyor. Apple, görsel üretim ve çok kipli anlama için güçlü sonuçlar bildirdi, ancak puanları vermedi; kod ve ağırlık yayımlama planı da açıklanmadı.
Yapay Zekâ··Gece
Tek düzen üç işi kapsıyor
Apple'ın makine öğrenmesi grubu, anlama, akıl yürütme ve iç içe geçmiş metin-görsel dizilerinin üretimini tek bir nedensel düzende ele alan STARFlow2'yi tanıttı. Açıklama, bu işlevleri birbirinden kopuk araçlar olarak değil, ortak bir üretim akışında konumlandırıyor.[1]
Dil modelinin sırası ve önbelleği paylaşılıyor
Model, dil modelindeki soldan sağa sırayı, nedensel maskeyi ve KV önbelleğini paylaşan özbağlanımlı normalleştirici akışlara dayanıyor. Yayımlanan teknik açıklama, dondurulmuş bir görsel-dil modeli akışıyla TARFlow akışını Pretzel mimarisi üzerinde birleştiriyor.[1]
Sonuçların kapsamı açık bırakıldı
Apple, görsel üretim ve çok kipli anlama ölçütlerinde güçlü sonuçlar bildirdi, ancak puanları vermedi. Açıklama, kodun ya da ağırlıkların yayımlanacağını da söylemiyor. Bu nedenle duyuru, mimarinin tarifini sağlıyor fakat dışarıdan yeniden çalıştırılabilir bir karşılaştırma paketi sunmuyor. Yayımlanan malzeme, ortak nedensel akışın nasıl kurulduğunu tarif ediyor; ancak başarı iddialarının büyüklüğünü ölçmeye yarayan puanları vermiyor. Kod ve ağırlıklar için açık bir duyuru bulunmadığından, dışarıdan aynı düzeni çalıştırma yolu da belirtilmemiş durumda. Bu tek akış tasarımı, metin ve görsel dizileri aynı soldan sağa sıra, nedensel maske ve KV önbelleğiyle işlediği için bu işlevlerin birlikte yürütülmesine katkı sağlayabilir. Ancak Apple puan vermediğinden, bildirilen güçlü sonuçların bu tasarımdan mı yoksa açıklanmayan değerlendirme koşullarından mı kaynaklandığı belirlenemiyor.[1]