Eigen RadarYapay Zekâ
Analiz

LinkedIn, iş arama sıralama modelini çoklu öğretmenli damıtma yoluyla sekiz kat daha hızlı eğitiyor

LinkedIn, birkaç büyük öğretmen modelden aldığı sinyalleri 0,6 milyar parametreli iş arama sıralayıcısına aktardı. Önceden hazırlanan öğretmen yanıtlarını eğitim sırasında üretilenlerle birleştirerek toplam eğitim süresini sekizde bire indirdi. Şirket, kendi dizgesinde sıralama hızı ile NDCG@10 ölçümünde de belirgin artış bildirdi.

Yapay Zekâ··Akşam
Birden fazla büyük öğretmen modelin küçük bir sıralama çekirdeğine sinyal aktarmasını simgeleyen hesaplama düzeni.

Birden fazla öğretmenden daha küçük sıralayıcı

LinkedIn, birkaç büyük öğretmen modelden aktarılan sinyallerle 0,6 milyar parametreli bir iş arama sıralayıcısı eğitti. Yöntem, eğitimden önce hazırlanmış öğretmen yanıtlarını eğitim sürerken üretilen ek yanıtlarla birleştiriyor. Böylece büyük modellerin her eğitim adımında birlikte çalışması gerekmiyor. LinkedIn, bu karma yaklaşımın toplam eğitim süresini sekizde bire indirdiğini bildiriyor.[1]

Hızlanmayı birkaç değişiklik sağladı

Kazanç tek bir bileşenden gelmedi. LiGer çekirdeği her yığının iki kat iş taşımasını sağladı. Birden çok makineye yayılan eğitim 3,5 katlık artış getirdi; FSDP2 hıza yüzde 20, H200 kümelerine geçiş de yüzde 30 daha ekledi. Katkılar aynı eğitim düzeninin farklı katmanlarında ölçüldü. Bu rakamlar LinkedIn’ın kendi eğitim altyapısını anlatıyor.[1]

Sıralama hızı ve ölçülen nitelik yükseldi

Dizgenin sıralama hızı, her grafik işlemci için saniyede 290 öğeden 2.000’in üzerine çıktı. Sıralama niteliğini ölçen NDCG@10 puanı 0,7583’ten 0,9432’ye yükseldi. Bu iki ölçüm, daha hızlı eğitimin sıralama niteliğinde düşüşle birlikte gelmediğini gösteren şirket içi sonuçlar. Haber bunları LinkedIn’ın iş arama dizgesine ait veriler olarak sunuyor; başka bir hizmette ya da veri kümesinde bağımsız yeniden üretim vermiyor.[1]

Kaynakça

  1. Haber kaynağıInfoQLinkedIn, iş arama sıralayıcısını çoklu öğretmenli damıtmayla sekiz kat daha hızlı eğitiyor↩1↩2↩3