Eigen RadarYapay Zekâ
Analiz

Eylemciler gerçek denetleyicilerde 240 denemenin 75'inde süreci hedeften çıkardı

29 Ağustos'ta arXiv'de yayımlanan PLCBench, gerçek programlanabilir mantık denetleyicilerinde dil modeli eylemcilerinin yüzde 31,3 oranında fiziksel hedefi sürdürdüğünü ölçüyor; 98 oturum temel okuma adımını geçemedi. THE DECODER, Google DeepMind'in Co-Scientist'ini deney planından laboratuvar cihazına kadar kapalı döngüye genişlettiğini aktarıyor; malzeme biliminde sentez tarifleri tasarlayıp yarı iletken ince filmleri ilk denemede elde etti. Biri endüstriyel süreç riskini, diğeri laboratuvar otomasyonunu somutlaştırıyor.

Yapay Zekâ··Akşam
Aydınlık fabrika katında robot kolu, kılavuz raya çapraz yığılmış etiketsiz bidonların üzerinde çalışırken arkası dönük bir operatör amber ikaz lambasının yanındaki manuel kola uzanıyor.

PLCBench gerçek denetleyicilerde otuz bir virgül üç yüzde başarı ölçtü

29 Ağustos'ta arXiv'de yayımlanan PLCBench, dil modeli eylemcilerinin programlanabilir mantık denetleyicilerine erişim verildiğinde kalıcı fiziksel etki üretip üretemeyeceğini donanımın döngüde olduğu bir düzenekle ölçüyor. Beş model ailesi ve gerçek denetleyicilerle yürütülen 240 oturumun 75'i, yani yüzde 31,3'ü, kendi fiziksel hedefini sürdürdü. Aşama aşama bakıldığında 98 oturum temel okuma adımını bile geçemedi, 62 oturum sürece bağlı yazma işlemine ulaştı ama nihai hedefi tutturamadı. Sensör verisi iyileştiğinde koşullu hedef başarısı yüzde 44,2'den yüzde 64,0'a çıktı. Yazarlar düzeneği savunma tarafı için bir müdahale haritası olarak sunuyor: hangi aşamada durdurmanın etkili olduğu ölçülebilir hale geliyor. Çalışma hakem değerlendirmesinden geçmemiş bir ön baskı ve sonuçlar laboratuvar düzeneğine ait.[1]

Co-Scientist deney planından cihaza kadar kapalı döngüye geçti

THE DECODER'a göre Google DeepMind, Şubat 2025'te Gemini 2.0 üzerinde hipotez üreteci olarak tanıttığı Co-Scientist'i kapalı döngü bir araştırma sistemine genişletti: sistem hipotez çıkarıyor, deney planı kuruyor, kod yazıyor, laboratuvar cihazlarını yönetiyor, sonuçları çözümlüyor ve makale taslağı üretiyor. Malzeme biliminde iki boyutlu malzemeler için sentez tarifleri tasarladı ve yarı iletken ince filmleri ilk denemede elde etti. Biyolojide E. coli koloni desenlerini şekil özelliklerinde yüzde 75 doğrulukla öngören özerk bir görüntü çözümleme hattı kurdu. Bilgisayar biliminde insan müdahalesi olmadan Agent_H adlı bir tıbbi yapay zekâ mimarisi tasarladı; bu tasarımın sonuçları hekim değerlendirmesinde tutmadı. Güvenilirlik modülleri açıkken uydurma oranı yüzde 4'e indi, modüller kapalıyken yüzde 46 ölçüldü. THE DECODER, Şubat 2025'teki hipotez üreteci tanımından bu laboratuvar döngüsüne geçişi aynı haftada aktardı.[2]

Fabrika denetleyicisi ile laboratuvar döngüsü aynı haftada somutlaştı

PLCBench endüstriyel denetleyicilerde yüzde 31,3 sürdürme oranı bildirirken Co-Scientist laboratuvar cihazını ilk denemede çalıştırmayı başardığını anlatıyor; ikisi de eylemcilerin fiziksel dünyaya uzanan erişimini ölçüyor. PLCBench sonuçları sahadaki bir tesisten çok laboratuvar düzeneğine ait; Co-Scientist tarafında hekim değerlendirmesinde tutmayan bir mimari de var. Sensör verisi PLCBench'te başarıyı yüzde 64,0'a çıkarırken, Co-Scientist'te güvenilirlik modülleri uydurma oranını yüzde 4'e indirdi. PLCBench beş model ailesiyle gerçek denetleyicilerde 240 oturum yürüttü; 98 oturumun temel okuma adımını geçemediğini de kaydediyor; Co-Scientist malzeme biliminde ince filmleri ilk denemede elde ettiğini aktarıyor. Okuyucu için somut gelişme, aynı haftada hem endüstriyel süreç riskinin ölçülmesi hem de laboratuvar otomasyonunun genişletilmesinin bir arada gelmesi; her iki tarafta da sayılar yazarların veya ekibin kendi ölçümünden geliyor.[1], [2]

Kaynakça

  1. Haber kaynağıarXivOtonom eylemciler gerçek denetleyicilerde 240 denemenin 75'inde süreci hedeften çıkardı↩1↩2
  2. Haber kaynağıTHE DECODERCo-Scientist artık deneyi planlıyor, laboratuvar cihazını çalıştırıyor ve makaleyi yazıyor↩1↩2