Claude hizalamayı kendisi araştırırken Co-Scientist deneyi laboratuvara taşıyor
Anthropic, 28 Ağustos'ta yayımladığı çalışmada Claude'un on hizalama hatası kategorisinde yöntem arayıp eğittiğini ve aldatma başlığında altı güvenlik araştırmacısının önerisini geride bıraktığını bildirdi. Google DeepMind ise Co-Scientist'i hipotezden laboratuvar cihazına ve makale taslağına uzanan kapalı döngü bir araştırma hattına genişlettiğini duyurdu. Anthropic hizalama araştırmasını otomatikleştirirken Google DeepMind Co-Scientist ile deney hattını genişletti.
Yapay Zekâ··Sabah
Claude hizalama yöntemini kendisi arıyor
Anthropic, 28 Ağustos'ta yayımladığı araştırmada Claude'a on hizalama hatası kategorisini tek tek verdi; sistem her turda literatürü tarıyor, yöntem ve veri öneriyor, modeli eğitip sınıyor. Şirketin kendi ölçümüne göre aldatma başlığında Claude'un en iyi yöntemi, en iyi insan önerisinden yüzde 20 daha iyi sonuç verdi. Altı güvenlik araştırmacısı kusursuz puana kalan açığın ortalama yüzde 20'sini kapatırken Claude birden çok koşuda yüzde 85'e ulaştı. Üretimdeki bir model için sistem 60 saat içinde 50'nin üzerinde çözüm buldu ve 2.000'in biraz üzerinde eğitim örneği yetti; Anthropic bunu kendi üretim hizalama yordamından yaklaşık 15.000 kat verimli sayıyor.[1]
Anthropic sınırları açıkça sıralıyor
Anthropic, çalışmanın sınırlarını da açıkça sıralıyor: incelenen hatalar üretimdekilere göre dar kaldı ve siyasi önyargı ölçülmedi. Bazı hatalar ölçüt yazılamayacak kadar seyrek ya da yeni; elenen yöntemler yalnızca önceden belirlenmiş sınırlı bir yetenek kümesinde denendi. Petri gibi değerlendirmeler gerçek dünyadaki bozulmanın vekili sayılıyor ve kazanımların başka görevlerde uzun pekiştirmeli eğitimden sonra kalıcı olup olmadığı sınanmadı.[1]
Co-Scientist deneyi ve makaleyi de üretiyor
Google DeepMind, Şubat 2025'te Gemini 2.0 üzerinde hipotez üreteci olarak tanıttığı Co-Scientist'i kapalı döngü bir araştırma sistemine genişletti: sistem hipotez çıkarıyor, deney planı kuruyor, kod yazıyor, laboratuvar cihazlarını yönetiyor, sonuçları çözümlüyor ve makale taslağı üretiyor. Malzeme biliminde iki boyutlu malzemeler için sentez tarifleri tasarladı; yarı iletken ince filmler ilk denemede hazırlandı. Biyolojide E. coli koloni desenlerini şekil özelliklerinde yüzde 75 doğrulukla öngören özerk bir görüntü çözümleme hattı kurdu. Bilgisayar biliminde insan müdahalesi olmadan Agent_H adlı bir tıbbi yapay zekâ mimarisi tasarladı; bu tasarımın sonuçları hekim değerlendirmesinde tutmadı. Güvenilirlik modülleri açıkken uydurma oranı yüzde 4'e indi, bu modüller kapalıyken yüzde 46 ölçüldü.[2]
İlgili köşe yazıları
Bu gündem hakkında daha fazla bilgi için ilgili köşe yazılarını okuyabilirsiniz.