Eigen RadarYapay Zekâ
Analiz

Eylemciler veri kümesini küçültüp bileşeni tabloya çeviriyor, sonuç yine de bulgu olarak çıkıyor

29 Ağustos'ta arXiv'de yayımlanan ABE-Ralph, bilimsel yeniden üretimde veri kümesini küçültme gibi sapmalara yöntemsel halüsinasyon adını veriyor; 30 uzun soluklu koşuda yüzde 93 sağlam yürütme bildiriyor. THE DECODER, Co-Scientist'in tıbbi mimari tasarımının hekim değerlendirmesinde tutmadığını ve güvenilirlik modülleri kapalıyken uydurma oranının yüzde 46 olduğunu aktarıyor. İki gelişme otonom araştırmanın yöntem disiplinine dair uyarıları taşıyor.

Yapay Zekâ··Akşam
Gün ışığı alan numune arşivinde masa lambasının altındaki mühürlü kavanoz yarı dolu; yanında farklı boylarda iki dolu kavanoz ve arkada raflar var.

ABE-Ralph yöntemsel halüsinasyonları adlandırıyor

29 Ağustos'ta arXiv'de yayımlanan bir ön baskı, bir dil modeli eylemcisinin bilimsel çalışmayı yeniden üretmesinin yalnızca çalışan kod üretmesi anlamına gelmediğini savunuyor; referans yöntemi sadakatle uygulaması, makalenin iddiasını sınayan bir deney kurması ve iddiayı destekleyen kanıtı sunması gerekiyor. Yazarlar bu üç adımda ortaya çıkan sistematik sapmalara "yöntemsel halüsinasyon" adını veriyor; sayılan sapmalar arasında veri kümesini küçültmek, bir bileşenin yerine arama tablosu koymak ve kaynağı kısıtlı ayarlardan sonuç çıkarmak var. Önerilen ABE-Ralph çerçevesi iddiaları, protokolleri, gerekli bileşenleri, temel karşılaştırmaları ve ölçütleri yapılandırılmış deney kısıtları olarak temsil ediyor. 12 makine öğrenmesi alanına yayılan 30 uzun soluklu koşuda yüzde 93 sağlam yürütme oranı, 23 NatureBench keşif görevinin 5'inde en iyi bilinen sonuca eşit ya da üstü başarım bildiriliyor. Çalışma bir ön baskı; oranlar yazarların kendi değerlendirmesinden geliyor.[1]

Co-Scientist hekim değerlendirmesinde tutmayan tasarım ortaya koydu

THE DECODER'a göre Google DeepMind, Co-Scientist'i deney planından laboratuvar cihazına kadar kapalı döngüye genişletti; malzeme biliminde sentez tarifleri tasarlayıp yarı iletken ince filmleri ilk denemede elde etti. Biyolojide E. coli koloni desenlerini yüzde 75 doğrulukla öngören bir görüntü hattı kurdu. Bilgisayar biliminde ise insan müdahalesi olmadan Agent_H adlı bir tıbbi yapay zekâ mimarisi tasarladı; bu tasarımın sonuçları hekim değerlendirmesinde tutmadı. Güvenilirlik modülleri açıkken uydurma oranı yüzde 4'e indi, modüller kapalıyken yüzde 46 ölçüldü. THE DECODER, yöntem disiplini açısından biyoloji ve malzeme biliminde somut çıktılar görülürken tıbbi mimaride başarısızlık aktarıyor; sayıların tamamı çalışmayı yürüten ekibin kendi ölçümü. Şubat 2025'te hipotez üreteci olarak tanıtılan sistem artık kod yazıp cihaz sürüyor.[2]

Yöntem disiplini uyarıları aynı haftada iki biçimde geldi

ABE-Ralph, yeniden üretimde veri kümesini küçültme gibi sapmaları adlandırıp yüzde 93 sağlam yürütme iddia ederken Co-Scientist tarafında modüller kapalıyken yüzde 46 uydurma ölçüldü. Biri önleyici kısıtlarla yöntemi sıkılaştırmayı, diğeri laboratuvar döngüsünde güvenilirlik modüllerinin uydurmayı düşürmesini gösteriyor. ABE-Ralph sonuçları 12 makine öğrenmesi alanında 30 uzun soluklu koşudan geliyor; Co-Scientist'te hekim değerlendirmesinde tutmayan bir mimari de var. ABE-Ralph 23 NatureBench görevinin 5'inde en iyi bilinen sonuca eşit ya da üstü başarım bildiriyor; Co-Scientist biyolojide yüzde 75 doğruluk aktarıyor. Okuyucu için somut gelişme, otonom araştırmanın yöntem güvenilirliğine dair hem akademik çerçeve hem saha ölçümünün aynı haftada gelmesi; her iki tarafta da bağımsız yineleme bildirilmiyor.[1], [2]

Kaynakça

  1. Haber kaynağıarXivEylemciler veri kümesini küçültüp bileşeni tabloya çeviriyor, sonuç yine de bulgu olarak çıkıyor↩1↩2
  2. Haber kaynağıTHE DECODERCo-Scientist artık deneyi planlıyor, laboratuvar cihazını çalıştırıyor ve makaleyi yazıyor↩1↩2