Uzmanlık işlerinde yapay zekâ: Riemann ilerlemesi ile AMIE denemesi doğrulamayı öne çıkarıyor
Anthropic'in yayımlanmamış modeli Riemann hipotezinin bilinen sınırını ilerletirken Google'ın AMIE sistemi benzetilmiş görüntülü görüşmelerde hekimlerle karşılaştırıldı; iki çalışma da sonuç kadar insan ve biçimsel doğrulamanın rolünü gösteriyor.
Yapay Zekâ··Gece
Bir model, 650 yol ve tamamlanmamış bir kanıt
TechCrunch'ın aktardığı Anthropic duyurusu, henüz yayımlanmamış bir modelin Riemann hipotezinde bilinen alt sınırı belirgin biçimde yükselttiğini söylüyor. Sonuç, 150 yılı aşkın süredir çözülemeyen hipotezin genel kanıtı değil; konulan 1 milyon dolar ödül de hâlâ sahipsiz. Çalışmanın yolu en az sonuç kadar somut: önemli bir matematik eğitimi bulunmayan bir Anthropic çalışanı, modelden sorunu ciddi biçimde denemesini istedi ve sistemi bir buçuk gün çalışmaya bıraktı. Model bu sürede 650 farklı fikri sınadı, işi 60 alt eylemciye dağıttı ve 31 milyon çıktı belirteci üretti. Anthropic'in iki kurum içi matematikçisi elde edilen ilerlemeyi doğruladı. Ardından kanıt, açık kaynaklı Lean kanıt yardımcısıyla biçimselleştirildi. Bu zincir, modelin çok sayıda yol üretmesini, uzmanların sonucu incelemesini ve biçimsel aracın mantıksal adımları denetlemesini aynı çalışmada birleştiriyor. Duyurunun taşıdığı ilerleme bu doğrulama basamaklarıyla sınırlı; model Riemann hipotezini çözmüş sayılmıyor.[1]
AMIE görüntülü görüşmede nasıl sınandı?
Google Research ile Google DeepMind, araştırma amaçlı tıbbi yapay zekâ sistemi AMIE'yi gerçek zamanlı görüntülü görüşmeye taşıdı. Gemini ve Project Astra üzerine çok eylemcili bir yapıyla kurulan sistem, görsel ve işitsel ipuçlarını yorumlamak, sanal fizik muayeneye yön vermek ve tanıya yönelik akıl yürütmeyi görüşme sırasında yürütmek üzere tasarlandı. Değerlendirme gerçek klinik kullanımda yapılmadı: rastgele atamalı çalışma, hasta rolündeki oyuncularla benzetilmiş görüşmeler kullandı ve karşılaştırma grubunda birinci basamak hekimleri yer aldı. Klinik değerlendiriciler AMIE'yi öykü almanın kapsamı, tanı doğruluğu, tedavi yönetiminin uygunluğu ve iletişim kalitesi bakımından olumlu değerlendirdi. Hasta rolündeki oyuncular da görüntülü deneyimi yazışmaya tercih etti. Google'ın kendi açıklaması bu bulguları dağıtıma hazır bir ürün ilanına çevirmiyor. Şirket, AMIE'nin araştırma sistemi olarak kaldığını ve sorumlu gerçek yaşam kullanımından önce daha fazla çalışmaya ihtiyaç bulunduğunu vurguluyor. Böylece görüntülü arayüzdeki olumlu değerlendirme, benzetilmiş ortam ve seçilmiş karşılaştırma düzeni içinde anlam kazanıyor.[2]
Sonuçtan doğrulama zincirine
İki çalışma farklı uzmanlık alanlarında ilerliyor ve aynı başarım ölçüsünü paylaşmıyor. Riemann çalışmasında hedef, açık bir matematik sorusundaki sınırı ilerletmekti; doğrulama Anthropic'in matematikçileri ile Lean üzerinden yürüdü. AMIE değerlendirmesinde hedef, benzetilmiş görüntülü klinik görüşmedeki davranışı birinci basamak hekimleriyle karşılaştırmaktı; değerlendirmeyi klinik uzmanlar ve hasta rolündeki oyuncular yaptı. Ortak nokta, model çıktısının son söz olarak bırakılmaması. İnsan incelemesi her iki örnekte de belirleyici, fakat üstlendiği iş değişiyor: birinde matematiksel sonucun doğruluğunu denetliyor, diğerinde görüşmenin klinik ve iletişim boyutlarını değerlendiriyor. Biçimsel kanıt yardımcısı da yalnızca matematik örneğinde devreye giriyor. Bu ayrım, uzmanlık işlerinde yapay zekâ haberlerini okurken yalnızca modelin ne yaptığına bakmanın eksik kalacağını gösteriyor. Sonucun hangi ortamda üretildiği, kim tarafından karşılaştırıldığı ve hangi denetimden geçtiği, duyurulan ilerlemenin kapsamını belirliyor. Her iki sistem de dikkat çekici bir araştırma aşamasında; gerçek yaşamda yaygın ve bağımsız olarak sınanmış bir kullanım düzeyine ulaştıkları açıklanmış değil.[1], [2]