Eigen RadarYapay Zekâ
Analiz

Sinir-sembolik yazının yüzde 6,52'si yeniden koşulurken Co-Scientist laboratuvar döngüsünü genişletti

29 Ağustos'ta arXiv'de yayımlanan dokuz yazarlı denetim, sinir-sembolik yapay zekâ yazınında uygun 1.304 çalışmanın yalnızca 85'ini yeniden üretebildi; bu yüzde 6,52. Google DeepMind ise Co-Scientist'i hipotezden laboratuvar cihazına ve makale taslağına uzanan kapalı döngü bir araştırma hattına genişlettiğini duyurdu. Otomasyon hızlanırken yayımlanan gereçlerin büyük bölümü yeniden koşulamıyor.

Yapay Zekâ··Öğle
Uzun, gün ışığı alan bir kütüphane masasında düzensiz yığınlar halinde kapalı defterler; önde birkaç boş açık defterin yanında çalışan pirinç mekanik aygıt.

Denetim binlerce kaynakçayı taradı

29 Ağustos'ta arXiv'de yayımlanan ve dokuz yazarlı olan bir denetim, sinir-sembolik yapay zekâ yazınını altı aşamada taradı: 5.497 kaynakça girdisi derlendi, 3.018 yinelenen girdi çıkarıldı, geriye uygun 1.304 çalışma kaldı. Ekip bunların 85'ini tümüyle ya da kısmen yeniden çalıştırabildi; bu, yüzde 6,52 ediyor. Denenen yeniden koşulardan 321'i kod dışı gereçler eksik olduğu için, 42'si kod deposu eksik ya da kullanılamaz olduğu için durdu. Yazarlar alanda süregelen bir yeniden üretilebilirlik açığı olduğunu anlatıyor ve yayımlanma koşulunun eksiksiz, sürümlenmiş ve kalıcı olarak arşivlenmiş gereç paketleri olması gerektiğini savunuyor. Çalışma arXiv'de yayımlanan ve hakem değerlendirmesinden geçmemiş bir ön baskı. Bildirilen bulgular yazarların kendi koşularına aittir ve çalışma hakem değerlendirmesinden geçmemiş bir ön baskı olarak sunuluyor.[1]

Co-Scientist deney hattını kapalı döngüye taşıdı

Google DeepMind, Şubat 2025'te Gemini 2.0 üzerinde hipotez üreteci olarak tanıttığı Co-Scientist'i kapalı döngü bir araştırma sistemine genişletti: sistem hipotez çıkarıyor, deney planı kuruyor, kod yazıyor, laboratuvar cihazlarını yönetiyor, sonuçları çözümlüyor ve makale taslağı üretiyor. Malzeme biliminde iki boyutlu malzemeler için sentez tarifleri tasarladı; yarı iletken ince filmler ilk denemede hazırlandı. Biyolojide E. coli koloni desenlerini şekil özelliklerinde yüzde 75 doğrulukla öngören özerk bir görüntü çözümleme hattı kurdu. Bilgisayar biliminde insan müdahalesi olmadan Agent_H adlı bir tıbbi yapay zekâ mimarisi tasarladı; bu tasarımın sonuçları hekim değerlendirmesinde tutmadı. Güvenilirlik modülleri açıkken uydurma oranı yüzde 4'e indi, bu modüller kapalıyken yüzde 46 ölçüldü. Bildirilen bulgular yazarların kendi koşularına aittir ve çalışma hakem değerlendirmesinden geçmemiş bir ön baskı olarak sunuluyor.[2]

Hızlanan otomasyon eski gereç boşluklarıyla karşılaşıyor

Denetim, sinir-sembolik alanda yayımlanan çalışmaların büyük çoğunluğunun kod veya kod dışı gereç eksikliği yüzünden yeniden koşulamadığını sayıyla gösteriyor; otomatik araştırma hatlarından çıkan yeni çıktıların da benzer arşivleme baskısıyle karşılaşabileceğini hatırlatıyor. Co-Scientist tarafında hekim değerlendirmesinde tutmayan bir tıbbi mimari tasarımı da raporlanıyor; sayıların tamamı çalışmayı yürüten ekibin kendi ölçümü. İki haber farklı uçları anlatıyor: biri geçmiş yazının yeniden üretilememesi, diğeri gelecekteki deneyleri otomatikleştirme iddiası. Okuyucu için ortak çerçeve, yapay zekâ destekli araştırmanın hızı ile yayımlanan kanıtın taşınabilirliği arasındaki gerilim. Bildirilen bulgular yazarların kendi koşularına aittir ve çalışma hakem değerlendirmesinden geçmemiş bir ön baskı olarak sunuluyor.[1], [2]

Kaynakça

  1. Haber kaynağıarXivSinir-sembolik yazında 1.304 çalışmanın yalnızca 85'i yayımladıklarıyla yeniden koşulabildi↩1↩2
  2. Haber kaynağıTHE DECODERCo-Scientist artık deneyi planlıyor, laboratuvar cihazını çalıştırıyor ve makaleyi yazıyor↩1↩2