Eigen RadarYapay Zekâ
Analiz

Transect, araştırma eylemcisinin çalışmalarını izlenebilir bir çizelgede topluyor

Transect adlı açık kaynak araç, uzun yapay zekâ araştırma denemelerindeki araç kullanımını, görev evrelerini ve belirteç harcamasını aynı çizelgede gösteriyor. Tek denemeye dayanan ön baskı, 580 ana eylemci çıktısını inceliyor. Yeni iş için hesaplanan toplam yaklaşık 14,5 milyon belirteç oldu; bunun 7,8 milyonu öz değerlendirmede, 2,9 milyonu makale hazırlığında kullanıldı. Etiketler özgün konuşma bölümlerine bağlanarak ayrıntılı incelemeye açılıyor.

Yapay Zekâ··Akşam
Ahşap masa üzerinde açık bir halkalı dosya, kıvrılmış beyaz sayfa, iki kâğıt yığını ve arkası görünen dizüstü bilgisayar.

Etiketler özgün konuşma bölümlerine bağlanıyor

Transect, uzun yapay zekâ eylemcisi denemelerini incelemek için geliştirilen açık kaynak bir araç. Cozmin Ududec, Alexandra Abbas, Konstantinos Voudouris ve Toby D. Pilditch’in hazırladığı tek ön baskı, araç kullanımını, belirteç harcamasını ve davranış etiketlerini aynı çizelgede topluyor. Inspect Scout üzerine kurulan paket, her etiketi özgün konuşma bölümüne bağlıyor. Kullanıcı görev bağlamını ve davranış sınıflarını tanımlayabiliyor; aynı yapılandırmayı farklı denemelerde kullanabiliyor.[1]

580 çıktı beş kez sınıflandırıldı

Örnek inceleme, CRUX adlı araştırma girişiminin tek bir denemesini kapsıyor. Eylemcinin görevi, tablo verisiyle çalışan modelleri etkileyen zararlı dağılım değişimlerini etiket olmadan saptayan bir yöntem geliştirmek. Bu deneylerin yeniden yürütülmesini sağlayan bir paket de hazırlaması isteniyor. Teknik sorunlara insan operatör müdahale ediyor. Claude Opus 4.7, ana eylemciden gelen 580 çıktıyı sınıflandırmak için beş ayrı değerlendirmede kullanıldı. Bu değerlendirmelerin 474 çıktı üzerindeki araştırma etkinliği etiketleri tamamen uyuştu. İki çıktı hipotez oluşturma etiketi aldı. Yazarların açıklamasına göre her çıktıya bir ana etiket verilmesi, ikincil etkinliklerin ve farklı bölümlere dağılmış çalışmaların görünmesini zorlaştırabiliyor.[1]

Öz değerlendirme ve yazım belirteç kullanımında öne çıktı

Yeni iş hesabı yaklaşık 14,5 milyon belirteç tutuyor. Öz değerlendirmeye ayrılan pay 7,8 milyon; makale hazırlığına ayrılan pay ise 2,9 milyon belirteç. Belirteçler modelin işlediği metin birimleri. Bu hesap girdi ve çıktılarla, bağlam artışına göre sınırlandırılan önbellek yazımlarını birleştiriyor. Yapısal tarayıcılar araç etkinliğini ve operatör iletilerini model çağırmadan okuyor; model tabanlı tarayıcılar görev evresi etiketleri veriyor. Çizelgenin ekseni geçen süre yerine ana eylemcinin çıktı sırasını izliyor. Her etikete ait istem, girdi ve değerlendirici yanıtı saklanıyor; veri tabloları ayrıca dışarı aktarılabiliyor.[1]

Kaynakça

  1. Haber kaynağıarXivTransect, araştırma eylemcisinin uzun çalışmasını kaynaklı bir zaman çizelgesine dönüştürüyor↩1↩2↩3