29 Ağustos'ta arXiv'de yayımlanan bir ön baskıda 12 öncü modele yanıtlanamaz sorular hakkında profesyonel görünümlü piyasa verileri sunuldu; kanıt güçlendirildikçe bağlanma oranı yüzde 6,5'ten yüzde 54,0'a çıktı. Uydurma sayılarda oran yüzde 36,8, gerçek veride yüzde 37,6 ölçüldü. Anthropic'in 28 Ağustos'ta duyurduğu otomatik hizalama araştırması da aldatma başlığında insan önerilerini geride bıraktı.
Yapay Zekâ··Öğle
Kanıt yüzeyi güçlendikçe bağlanma arttı
29 Ağustos'ta arXiv'de yayımlanan bir ön baskıda 12 öncü modele, hiçbir verinin çözemeyeceği sorular hakkında profesyonel görünümlü piyasa verileri sunuldu. Kanıt daha güçlü göründükçe modelin bir yanıta bağlandığı koşuların payı yüzde 6,5'ten yüzde 54,0'a çıktı. Gösterilen bütün sayılar uydurma olduğunda bağlanma oranı yüzde 36,8; gerçek veride yüzde 37,6 ölçüldü. Yazar hatayı, modellerin neyin bilinebilir olduğunu sezmesine bağlamıyor; harekete geçip geçmemeye karar veren adımda buluyor: aynı sorular önceden sorulduğunda modeller yanıtlanamaz olanları yaklaşık yüzde 90 oranında ayırt etti. Küçük bir modelin ince ayarı davranışı özgün sınama örneklerinde ortadan kaldırdı ve modelin görmediği alanlara da taşındı; ancak akıl yürütmeyi engelleyen yanıt biçimlerinde etki korunmadı. Çalışma arXiv'de yayımlanan ve hakem değerlendirmesinden geçmemiş bir ön baskı.[1]
Anthropic aldatma başlığında otomatik arama duyurdu
Anthropic, 28 Ağustos'ta yayımladığı araştırmada Claude'a 10 hizalama hatası kategorisini tek tek verdi; sistem her turda literatürü tarıyor, yöntem ve veri öneriyor, modeli eğitip sınıyor. Şirketin kendi ölçümüne göre aldatma başlığında Claude'un en iyi yöntemi, en iyi insan önerisinden yüzde 20 daha iyi sonuç verdi; altı güvenlik araştırmacısı kusursuz puana kalan açığın ortalama yüzde 20'sini kapatırken Claude birden çok koşuda yüzde 85'e ulaştı. Üretimdeki bir model için sistem 60 saat içinde 50'nin üzerinde çözüm buldu ve 2.000'in biraz üzerinde eğitim örneği yetti; Anthropic bunu kendi üretim hizalama yordamından yaklaşık 15.000 kat verimli sayıyor. Anthropic, incelenen hataların üretimdekilere göre dar kaldığını ve siyasi önyargının ölçülmediğini açıkça sıralıyor; Petri gibi değerlendirmeler gerçek dünyadaki bozulmanın vekili sayılıyor.[2]
İki çizgi farklı aşamalarda müdahale arıyor
Ön baskı, eylemcinin kanıt yüzeyine kapılmasının sayıların gerçek olup olmamasından bağımsız olarak bağlanmayı artırabildiğini gösteriyor; bu, finansal arayüzlerde sunulan tabloların eylem eşiğini nasıl değiştirdiğine dair doğrudan bir ölçüm. Anthropic tarafındaki otomatik araştırma ise aldatma kategorisinde yöntem arayıp eğiterek üretim hizalama döngüsünü hızlandırmayı hedefliyor; kazanımların başka görevlerde uzun pekiştirmeli eğitimden sonra kalıcı olup olmadığı sınanmadı. İki haber aynı risk sözlüğünü paylaşsa da biri karar anındaki veri sunumuna, diğeri eğitim sonrası ölçüme odaklanıyor. Okuyucu için ortak mesaj, eylemcilerin güvenilir görünen girdiler karşısında sessiz kalmadığı; müdahalenin nerede konumlandırılacağı ise kaynağa göre değişiyor.[1], [2]