Eigen RadarYapay Zekâ
Analiz

Yirmi altı yazar sürekli eğitilen açık modele öncü düzey iddia koyarken Claude kendi hizalamasını arıyor

29 Ağustos'ta arXiv'de yayımlanan Thomson ön baskısı, açık ağırlıklı modellere uygulanan sürekli öğrenme yığınının eylemci görevlerde bugünün öncü sistemlerine yaklaştığını bildiriyor. Anthropic'in 28 Ağustos araştırması Claude'un 10 hizalama hatası kategorisini kendi başına aradığını söylüyor; aldatmada en iyi insan önerisinden yüzde 20 daha iyi sonuç aktarılıyor. THE DECODER, Co-Scientist'in laboratuvar cihazını yöneten kapalı döngüye genişlediğini yazıyor.

Yapay Zekâ··Akşam
Gün ışıklı bir araştırma avlusunda robotik gantri, eski ve koyu çekirdeği korunan büyük saydam kafesin parlak dış kenarına yeni bir parça ekliyor.

Thomson açık modelde sürekli öğrenme iddiası koyuyor

29 Ağustos'ta arXiv'de yayımlanan bir ön baskı, açık ağırlıklı modellere uygulanan sürekli öğrenme yığını Thomson'ı anlatıyor. Yazarlar, eylemci görevlerde, güvenlikte, hukuk ile vergi sorularında, çok dilli çalışmada ve büyük ölçekli araştırmada bugünün öncü sistemlerinin yanına koydukları sonuçları bildiriyor; kazanımların genelde varsayılanın epeyce altında işlem gücü ve personel bütçesiyle elde edildiğini söylüyorlar. Yığın, orta eğitim ve sonrası eğitim adımlarını, modelin bildiklerini yitirmeden öğrenmeyi sürdürmesini sağladıklarını söyledikleri koruma önlemleriyle birleştiriyor. Sonucu, yeteneğin geniş bir alanda yükselirken unutmanın neredeyse tümüyle ortadan kalktığı bir örüntü olarak tarif ediyorlar. İddialar yazarların kendisine ait; bağımsız yineleme bildirilmiyor. Çalışma hakem değerlendirmesinden geçmemiş bir ön baskı.[1]

Claude hizalama düzeltmesini kendi başına aradı

Anthropic, 28 Ağustos'ta yayımladığı araştırmada Claude'a 10 hizalama hatası kategorisini tek tek verdi; sistem her turda literatürü tarıyor, yöntem ve veri öneriyor, modeli eğitip sınıyor. Şirketin kendi ölçümüne göre aldatma başlığında Claude'un en iyi yöntemi, en iyi insan önerisinden yüzde 20 daha iyi sonuç verdi; 6 güvenlik araştırmacısı kusursuz puana kalan açığın ortalama yüzde 20'sini kapatırken Claude birden çok koşuda yüzde 85'e ulaştı. Üretimdeki bir model için sistem 60 saat içinde 50'nin üzerinde çözüm buldu ve 2.000'in biraz üzerinde eğitim örneği yetti; Anthropic bunu kendi üretim hizalama yordamından yaklaşık 15.000 kat verimli sayıyor. Şirket sınırları da açıkça sıralıyor: incelenen hatalar üretimdekilere göre dar kaldı, siyasi önyargı ölçülmedi ve kazanımların başka görevlerde uzun pekiştirmeli eğitimden sonra kalıcı olup olmadığı sınanmadı.[2]

Co-Scientist deneyden laboratuvar cihazına kapalı döngüye geçti

THE DECODER'a göre Google DeepMind, Co-Scientist'i otonom araştırma hattı olarak genişletti: malzeme biliminde sentez tarifleri tasarlayıp yarı iletken ince filmleri ilk denemede elde etti. Biyolojide E. coli koloni desenlerini yüzde 75 doğrulukla öngören bir görüntü hattı kurdu. Bilgisayar biliminde insan müdahalesi olmadan Agent_H adlı bir tıbbi yapay zekâ mimarisi tasarladı; bu tasarımın sonuçları hekim değerlendirmesinde tutmadı. Güvenilirlik modülleri açıkken uydurma oranı yüzde 4'e indi, modüller kapalıyken yüzde 46 ölçüldü. THE DECODER, Şubat 2025'te Gemini 2.0 üzerinde hipotez üreteci olarak tanıtılan sistemin artık kod yazıp cihaz sürdüğünü aktarıyor; sayıların tamamı ekibin kendi ölçümü, bağımsız yineleme bildirilmiyor, hakem değerlendirmesi yok, dış denetim yok ve üçüncü taraf doğrulaması yok.[3]

Kaynakça

  1. Haber kaynağıarXivYirmi altı yazar, sürekli eğitilen açık bir modele öncü düzey iddiası koyuyor↩
  2. Haber kaynağıAnthropicHizalama düzeltmesini Claude aradı, altı güvenlik araştırmacısının önerisini geride bıraktı↩
  3. Haber kaynağıTHE DECODERCo-Scientist artık deneyi planlıyor, laboratuvar cihazını çalıştırıyor ve makaleyi yazıyor↩