Oranın saydığı şey

OpenAI, ağustos 2026 ortası itibarıyla araştırma ajanlarının her insan iş gününe karşılık 3,1 ajan iş günü çaba sağladığını bildiriyor ve bunu geçen sonbaharda duyurulan otomatik araştırma stajyeri hedefine ulaşmak sayıyor. Kesrin altında bir insan iş günü, üstünde ise aynı dönemde tüketilen ajan çabası var. Bu biçimde kurulan bir oran, araştırmacılar daha çok ajan çalıştırdıkça yükseliyor ve fazladan ajan zamanının araştırmacının elinde kalan bir şey üretip üretmediğinden bağımsız olarak yükseliyor.[1]

Aynı yazıdaki harcama rakamları da aynı biçimde. Ağustos ortasında ortanca araştırmacı çıkarım için günde 600 doları, 90'ıncı yüzdelik dilimdeki kullanıcı ise günde 7.000 doları aşmıştı. Bunlar kaynak kullanımı ölçüleri; onlar da kesrin aynı üst tarafında duruyor. Hiçbiri işin ne kadarının tamamlanmış olarak geri döndüğünü söylemiyor; oysa otomatik araştırma stajyeri ifadesinin tarif etmesi beklenen büyüklük bu.[1]

Aynı yazıdaki karşı sayı

Başarıyla tamamlanan 4-8 saatlik görevlerin yüzde 50'sinden fazlası insan müdahalesi gerektirdi. Eşik, insan yönlendirmesi altında yürütülen araştırma görevleri olarak tanımlandığı için bu rakam tanımın yanında değil içinde duruyor: stajyeri duyuran yazı, başarı saydığı en uzun görevlerde bir insanın çoğu kez devreye girdiğini de bildiriyor. Yönlendirmenin nerede bitip tamamlamanın nerede başladığı sorunun tamamı ve yazı o çizgiyi çekmiyor.[1]

Rakamın gerçekten daha sert olduğu bir okuma da var. Bir koşu sırasında araştırmacıdan gelen her mesaj müdahale olarak kaydediliyorsa, tek bir açıklama ile bir kurtarma aynı hanede toplanır ve yardımsız iş payı yüzde 50'nin düşündürdüğünden yüksek çıkar. Ocak ile temmuz 2026 arasında zorluk gruplarının tamamında bildirilen başarı artışı bu okumayla uyumlu. Ters okumayla da uyumlu, çünkü görev kümesi, zorluk ayarı ve puanlama kuralı yayımlanmadığı için eğilimin karşısına koyulacak dışarıdan bir taban yok.[1]

Bunu çözecek ölçüm

Buradaki işin çoğunu tek bir sayı görürdü: ajanların araştırmacıdan hiç mesaj almadan tamamladığı görevlerin payı ve bunun, laboratuvar dışından birinin inceleyebileceği bir görev kümesine göre bildirilmesi. Puanlama kuralı ile zorluk ayarı da eklenirse iddia bir iç ölçümden bir sonuca geçer. Bunlar olmadan 3,1, bir araştırma kuruluşunun bugün ne kadar ajan zamanı harcadığının dürüst bir tarifi olarak kalıyor; bu gerçek bir değişim ama o zamanın ne geri getirdiğinin tarifi değil.[1]

OpenAI'nin görev kümesini, puanlama kuralını ve yardımsız tamamlama oranını yayımlaması, eşiği dışarıdan sınanabilir bir şeye dönüştürür. Şirket kendine bir takvim de vermiş durumda: mart 2028'e kadar otomatik bir yapay zekâ araştırmacısı yolunda güçlü ilerleme kaydettiğini söylüyor ve bir takvimi söylemek bir ölçümü söylemekten kolay. Bu yılın sonuna kadar izlenecek şey, bir oranın daha gelmesi değil, görevleri ve puanlama kuralını adıyla veren bir belgenin yayımlanıp yayımlanmadığı.[1]