Döngü kapandı, ölçüt listesi kapanmadı
Anthropic'in 28 Ağustos'ta yayımladığı çalışmada Claude, hizalama araştırmasının adımlarını kendi yürütüyor: literatürü tarıyor, yöntem ve veri öneriyor, modeli eğitiyor, sonra sınıyor. Şirket 10 hizalama hatası kategorisi tanımlamış ve her biri için genellikle 3 ila 5 ölçüt kullanmış. Aldatma başlığında Claude'un en iyi yöntemi, en iyi insan önerisinden yüzde 20 daha iyi sonuç vermiş; 6 güvenlik araştırmacısı kusursuz puana kalan açığın ortalama yüzde 20'sini kapatırken Claude birden çok koşuda yüzde 85'e ulaşmış. Üretimdeki bir model için 60 saatte 50'nin üzerinde çözüm çıkmış ve 2.000'in biraz üzerinde eğitim örneği yetmiş.[1]
Bu sonucu üreten katman, modelin etrafına kurulan arama döngüsü. Aynı Claude, insan araştırmacının önerdiği yönde çalıştırıldığında daha güçlü bir sonuca ulaşmıyor; kazanç, çok sayıda yöntemi hızla eğitip eleyebilmekten geliyor. Başka bir okuma da mümkün: ölçütler birbirine yeterince benziyorsa, döngünün bulduğu şey genel bir hizalama yöntemi yerine o ölçüt ailesine uyan bir düzeltme olabilir. Anthropic'in kendi sınır listesi bu ikinci okumayı besliyor, çünkü elenen yöntemler yalnızca önceden belirlenmiş sınırlı bir yetenek kümesinde denenmiş.[1]
Dışarıdan gelen sınav
Google DeepMind'ın Co-Scientist'i aynı döngüyü laboratuvara taşıyor: hipotez çıkarıyor, deney planı kuruyor, kod yazıyor, cihazları yönetiyor ve makale taslağı üretiyor. Malzeme biliminde iki boyutlu malzemelerin sentez tarifini tasarlamış, yarı iletken ince filmleri ilk denemede üretmiş. Bilgisayar biliminde ise insan müdahalesi olmadan Agent_H adlı bir tıbbi mimari tasarlamış ve bu tasarımın sonuçları hekim değerlendirmesinde tutmamış. Güvenilirlik modülleri açıkken uydurma oranı yüzde 4, kapalıyken yüzde 46 ölçülmüş.[2]
İki sistemin ortak kısıtı, ürettikleri sonucun ancak dışarıdaki bir sınav kadar sağlam olması. Anthropic, incelenen hataların üretimdekilere göre dar kaldığını, siyasi önyargının ölçülmediğini ve bazı hataların ölçüt yazılamayacak kadar seyrek ya da yeni olduğunu kendisi yazıyor; Petri gibi değerlendirmeleri de gerçek bozulmanın vekili sayıyor. Co-Scientist tarafında sınav somut biçimde işledi: hekim değerlendirmesi, sistemin insan müdahalesi olmadan tasarladığı mimarinin sonuçlarını doğrulamadı. Her iki durumda da hükmü, arama döngüsünün dışında duran ölçüm veriyor.[1], [2]
Geliştirici için ne değişti
27 Ağustos'ta yazdığım yazıda, eylemcileri değerlendirmenin SDK'lardan çıkıp izleme katmanına geçtiğini savunmuştum; otomatik hizalama araştırmacısı aynı hareketi bir kat yukarıda gösteriyor. Yöntem arayışı ucuzladıkça bakımı sürdürülecek varlık yöntem olmaktan çıkıp ölçüt kümesine geçiyor. Anthropic'in 10 kategorisi ve kategori başına 3 ila 5 ölçütü, bir kuruluşun sürdürmesi gereken envanterin adı; onu kimin yazdığı, kimin güncellediği ve kapsamının nasıl ölçüldüğü soruları da bu envanterle birlikte geliyor.[1], [3]
Ölçülebilir sinyal şu: aynı döngüyü, Anthropic'in listesinde bulunmayan bir hata ölçütü üzerinde çalıştıran bağımsız bir ekip benzer bir kazanım bildirirse, sonucun kaynağı ölçüt ailesine uyum olmaktan çıkar. Böyle bir koşu 30 Kasım 2026'ya kadar yayımlanmazsa, elde kalan şey şirketin kendi ölçümü olarak durur. Şirket zaten kazanımların başka görevlerde uzun pekiştirmeli eğitimden sonra kalıcı olup olmadığını sınamadığını yazıyor; o sınamayı yapacak taraf da ölçüt kümesini elinde tutan taraf.[1]