WorldSolver, kodlama eylemcilerini fizik kurallarıyla sınıyor
WorldSolver ön baskısı, kodlama eylemcilerinden 168 fiziksel olay için sayısal çözücü hazırlamalarını istiyor. Değerlendirme, çalışan kodun yanı sıra görüntülerin hedef davranışa uyumunu ve zaman boyunca fizik kurallarının korunmasını ölçüyor. Tek çalışmada yedi model karşılaştırıldı. Kimi K2.7 Code için çözücü teslim oranı yüzde 99; geçerli simülasyon çıktısına ulaşma oranı yüzde 38 oldu; sahneler ve sınır koşulları sabit tutuldu.
Yapay Zekâ··Akşam
Dosya teslimi ile geçerli simülasyon arasında fark oluştu
WorldSolver, kodlama eylemcilerinin fiziksel olaylar için sayısal çözücü üretmesini değerlendiren tek bir ön baskı çalışması. Yedi modelin karşılaştırıldığı deneyde çözücü teslim oranı Kimi K2.7 Code için yüzde 99’a ulaştı. Aynı modelde geçerli simülasyon çıktısına ulaşan görevlerin oranı yüzde 38 oldu. Çözücü, fiziksel bir sistemin zaman içindeki davranışını hesaplayan kod. Görevler hazır fizik motoru kullanmak yerine bu hesaplama yönteminin eylemci tarafından seçilip yazılmasını gerektiriyor.[1]
168 görevde sahneler ve sınır koşulları sabit tutuldu
Değerlendirme, 61 klasik bilgisayar grafiği çalışmasından alınan olaylarla 168 görev kuruyor. Görevler akışkanları ve katı cisimleri kapsıyor. Esnek yapılar ve karmaşık malzemeler de var; ayrıca çubuk, iplik, kumaş ve kabuk davranışları sınanıyor. Farklı fizik süreçlerinin birbirini etkilediği durumlar da kapsamda. Sahne geometrisi, fizik parametreleri, dış etkiler ve görüntüleme ayarları sabit. Eylemci yalnızca çözücü kodunu değiştirebiliyor. Kod üretimine 1.800 saniye, üretilen programın çalışmasına 600 saniye ayrılıyor.[1]
Fizik denetimi bütün zaman adımlarını inceliyor
Görsel değerlendirme videolardan seçilen 20 kareyi inceliyor; fizik denetimi ise bütün zaman adımlarındaki durum değişkenlerini kullanıyor. Görevlerde kütlenin korunup korunmadığı denetleniyor. Momentum ile itkinin uyumuna veya iki cismin birbirinin içine girip girmediğine yönelik ölçütler de kullanılıyor. Ölçütler eylemcilerden gizleniyor. Birleşik puanların ortalaması GPT-5.6-Sol modelinde yüzde 48,7. Claude Opus 5 modelinin ortalaması ise yüzde 46,7 düzeyinde. Sınırlı kare seçimi sürekli zaman hatalarını kaçırabiliyor; sonlu fizik kontrolleri de her hatayı kapsamıyor.[1]