Yeni çalışmalar model yükseltmesi ve bilgi erişiminde tekrar eden işi ölçüyor
İki ön baskı, model sürümü değiştiğinde ince ayarı korumayı ve erişim sistemlerinde metni her sorguda yeniden okuma maliyetini inceliyor. Çalışmalar önceki işin yeniden kullanımına odaklanıyor.
Yapay Zekâ··Öğle
Adaptör her sürüm değişiminde taşınmıyor
Dört ardışık Qwen sürümü ve altı görev üzerindeki ön baskı, ince ayarlı uzmanı yeni temel modele taşımanın geçişe bağlı olduğunu bildiriyor. arXiv'deki çalışmaya göre adaptörü doğrudan kopyalamak, 46 milyar belirteç ile sürdürülmüş eğitimde kazanımın 0,88 ile 0,99'unu koruyor. Bağımsız eğitilmiş iki sürüm arasında Banking77 görevinde yaklaşık 50 puanlık düşüş görülüyor. Yazarlar 33 yükseltme vakasını da değerlendiriyor. Çalışma hakem değerlendirmesinden geçmedi.[1]
Etiketleme ile işlem gücü ayrışıyor
Aynı çalışma, görev başına karar veren politikanın 33 yükseltme vakasında eğitim işlem gücünün yüzde 33'ünü kullandığını ve her seferinde yeniden eğitmeye karşı ortalama 0,37 puanlık kalite kaybı verdiğini bildiriyor. Eski uzmanın çıktısıyla yeniden etiketleme 0,96 ile 1,05 arasında koruma sağlıyor. Yazarlar bunun işlem gücünden çok etiketleme işinden tasarruf ettiğini söylüyor. Aynı tazeleme Banking77'de 39,1, Spider'da 255,0 GPU-dakikası harcıyor.[1]
Derleme sorguda yeniden okumayı azaltıyor
Başka bir arXiv ön baskısı, erişim destekli soru-cevap sistemlerinin ham metnin anlamını her sorguda yeniden çıkarmasını hedef alıyor. Yazarlar yazma anında sorgulanabilir bir katman oluşturmayı öneriyor. 500 yayın söyleşisi dökümünden oluşan ayrılmış örneklemde derlenmiş iddialar yaklaşık 2.200 okuma belirteciyle yüzde 85,2 doğruluğa ulaştı. En iyi parçalama düzeni 16.300 belirteçle yüzde 72,5'te kaldı. Çalışma, katmanın bakımının baştan kurmaktan 33,7 kat ucuz olduğunu bildiriyor ve hakem değerlendirmesinden geçmedi.[2]
İlgili köşe yazıları
Bu gündem hakkında daha fazla bilgi için ilgili köşe yazılarını okuyabilirsiniz.