BOTTLED sınamasında eylemcilerin çoğu doğrudan model başarımının gerisinde kaldı
BOTTLED ön baskısı, dil modeli eylemcilerinin milyonlarca örneği işlemek için yeniden kullanılabilir çözümler oluşturmasını sınadı. Üç görevdeki 60 denemenin 48’i, ilgili modelin doğrudan yanıtlarından hesaplanan güven aralığının alt sınırında kaldı. Eylemciler program yazmak, küçük model eğitmek veya karma çözüm kurmakta serbestti. Tek çalışma, tanımlı süre ve belirteç bütçeleri içinde bu yöntemleri karşılaştırıyor.
Yapay Zekâ··Akşam
Yeniden kullanılabilir çözümler 60 denemede karşılaştırıldı
BOTTLED, dil modeli eylemcilerinin büyük iş yükleri için yeniden kullanılabilir çözümler geliştirmesini sınayan bir değerlendirme. Agent in a Bottle adlı tek ön baskıda, on model üç görevde ikişer kez denendi. Yazarlar 60 sonucun 48’inin, ilgili modelin doğrudan yanıtlarından hesaplanan yüzde 95 güven aralığının alt sınırında kaldığını bildiriyor. Aynı belirteç bütçesiyle eğitilen iki küçük modelden daha güçlüsü de 31 eylemci denemesini geçti.[1]
Eylemciler milyonlarca örneği başlangıçta görüyor
Etiketlenmemiş örneklerin tümü, denemenin başında eylemciye bir dosya olarak veriliyor. Çözüm seçimi serbest: eylemci küçük bir model eğitebiliyor, kurallara dayanan program yazabiliyor ya da arama dizini hazırlayabiliyor. Zor örneklerde büyük model çağıran karma yöntemler de kabul ediliyor. Ürün metinlerinden özellik çıkarma, alışveriş sorgularıyla ürünlerin ilgisini sınıflandırma ve insan ile model üretimi metinleri ayırma görevleri kullanılıyor. Özellik çıkarma iş yükünde yaklaşık 4,77 milyon örnek bulunuyor. Alışveriş ilgisi için sayı yaklaşık 2,62 milyon; metin ayrımı için yaklaşık 5,62 milyon. Değerlendirme için eylemcilerin her örneğe ilişkin tahminlerini bir dosyada teslim etmesi gerekiyor.[1]
Süre ve belirteç sınırları bazı çıktıları yarım bıraktı
Her denemeye 10 saat ve 5 milyon ağırlıklı belirteç veriliyor. Belirteçler modelin işlediği metin birimleri; hesapta çıktı, önbelleksiz girdi ve önbellekli girdi farklı ağırlık taşıyor. Eylemci yalnızca kendi modelinin uygulama arayüzünü kullanabiliyor. Bütçe sınırında durdurulan 21 denemenin sekizinde zorunlu çıktı tamamlanmadı. Ek deneyde bu durdurma kaldırıldığında da genel başarım farkı sürdü. Bazı görevlerde başarılı, daha düşük giderli çözümler elde edildi. Kod MIT lisansıyla yayımlandı.[1]