Eigen RadarYapay Zekâ
Analiz

Android Bench 2, eylemcilerin uzun yazılım işlerini ne ölçüde tamamladığını puanlıyor

Google, Android Bench’i bir mühendisin günlerini alabilecek geliştirme işlerinde yapay zekâ eylemcilerini değerlendirecek biçimde genişletti. Yeni sistem, görevin bütünüyle tamamlanmasının yanında kısmi tamamlamayı, işlevselliği, görsel uygunluğu ve gerilemeleri puanlıyor. Bağımlılık yükseltme, uygulama oluşturma ve başka platformdan taşıma görevleri de kapsama alındı. Google’ın sonuçları, yeni kod yazımının yeniden düzenleme ve çalışma sırasında doğrulama isteyen işlerden daha başarılı olduğunu gösteriyor.

Yapay Zekâ··Öğle
Test düzeneğindeki telefon ve bağlantılı geliştirme bilgisayarı.

Uzun görevler uygulama oluşturmayı ve taşımayı kapsıyor

Google’ın yayımladığı Android Bench 2.0, yapay zekâ modelleriyle yazılım eylemcilerinin Android geliştirmedeki başarımını değerlendiriyor. Yeni görevlerde uygulama baştan kuruluyor veya başka platformdan Android’e taşınıyor; bağımlılıklar yükseltiliyor ve özellikler ekleniyor. Google, bunların bir mühendisin birkaç gününü veya bir haftasını alabileceğini belirtiyor. Model sağlayıcılarının sunduğu eylemcilerle değerlendirme de sisteme eklendi.[1]

Tek bir uç durum hatası bütün ilerlemeyi silmiyor

Puanlama sistemi, işlevselliği, görsel uygunluğu ve gerilemelerin önlenmesini dikkate alarak tamamlanma oranı hesaplıyor. Yönergelerden veya yapısal koşullardan sapmalar puanı düşürüyor. Önceki düzende tek bir uç durum hatası, birçok koşul karşılanmış olsa bile bütün görevi başarısız sayabiliyordu. İlk sürüm, mevcut kod depolarındaki küçük değişikliklere ve Android’in izin, gezinme ve bağlantı uygulamalarına odaklanıyordu.[1]

Mevcut kodu düzenlemek ve çalışırken doğrulamak daha zor

Google’ın bulguları, mevcut yazılımı yeniden düzenlerken başarımın yeni kod üretimine göre daha düşük kaldığını gösteriyor. Java kodunu Kotlin’e çevirmek gibi kuralları belirli dönüşümler daha iyi ilerliyor. Çalışan uygulamada doğrulama gerektiren işler, yazılım çatısındaki büyük değişiklikler ve alışılmadık kitaplıklar eylemcileri zorluyor. InfoQ’nun aktardığı uzun görev tablosunda Claude Opus 5.5 yüzde 32 geçme oranına sahip; GPT 6 Astra’nın oranı yüzde 28. Android’e taşıma işlerinde en güçlü sonuç yüzde 80 tamamlanma oldu. Bu puan, uzun bir görevin bütün koşullarını karşılayarak geçilmesinden ayrı bir ölçü.[1]

Kaynakça

  1. Haber kaynağıInfoQAndroid Bench 2, uzun yazılım görevlerini ve kısmi tamamlamayı ölçüyor↩1↩2↩3