Beş soru gerçekte neyi sordu
Asıl ağırlığı taşıyan bölüm elle yapılan değerlendirme. Son beş yıldan derlenmiş 127 kuantum hesaplama makalesi beş soruyla puanlandı — kodun erişilebilirliği, ortam tanımı, belgelendirme, donanım tarifi, çalıştırılabilirlik — ve bunların sonuncusu, birinin gerçekten çalıştırma düğmesine basmasını gerektiren tek soru. Bu 127 makalenin yüzde 24,4'ü ekibin denemeye kalkışabileceği kod sundu; o kodun yüzde 64,5'i temiz bir ortamda çalışmadı. İkisi çarpıldığında, örneklemdeki her on makaleden kabaca dokuzu, dışarıdan bir okurun çalıştırabileceği hiçbir şey bırakmıyor.[1]
İkinci kol çok daha geniş ve çok daha ince. Bir program yaklaşık 5.000 makaleyi aynı göstergeler bakımından taradı ve yüzde 26,8'lik bir kod erişilebilirliği oranı verdi; bu, elle bulunan yüzde 24,4'e yazarların destekleyici saymasına yetecek kadar yakın. Tarama ayrıca, erişilebilir kodu olan makalelerin yaklaşık üçte birinin makine tarafından okunabilir bir ortam tanımı taşımadığını buldu. Yapmadığı şey, bunların hiçbirinde çalıştırmayı denemekti.[1]
Farklı şeyleri ölçen iki oran
Yani makale bir yanda kodun var olup olmadığına, öbür yanda kodun hem var olup hem çalışıp çalışmadığına dair birer sayı taşıyor; yüzde 26,8 ile yüzde 24,4 arasındaki uyum bize yalnızca otomatik taramanın ürünleri elle bulunan orana yakın bir sıklıkta saptadığını söylüyor. Yüzde 64,5'lik çalıştırma başarısızlığı hakkında hiçbir şey söylemiyor, çünkü otomatik tarama hiçbir şeyi çalıştırmayı denemedi. Dürüst okuma şu: geniş örneklem erişilebilirliği destekliyor, çalıştırılabilirlik ise bütünüyle 127 makalenin üzerinde duruyor. Daha yumuşak bir açıklama da var ve söylenmeli: iki kol farklı soruları yanıtlamak üzere tasarlandı, yazarlar bunu belirtiyor, dolayısıyla aradaki boşluk yöntemin içine gizlenmiş bir kusurdan çok bir kapsam kararı.[1]
Payda da aynı özeni hak ediyor. Bu 127 makale, alandan rastgele çekilmiş bir örneklem yerine derlenmiş bir örneklem ve bu tür bir denetim için seçilmiş makaleler, nasıl bir araya getirildiğine göre alan ortalamasının üstünde de altında da kalabilir. Bu, o 127 makale için bulguyu zayıflatmıyor — kod ya çalıştı ya çalışmadı — ama yüzdenin nereye taşınabileceğini sınırlıyor. Kanıtın desteklediği sav şu: bu büyüklükteki bir örneklemde, çalıştırılabilirlik sınandığı zamanların çoğunda başarısız oldu.[1]
Sinyalin yeniden vurduğunu ne gösterir?
Mauerer'in kendi anlatımı, kolay suçluyu zayıflatıyor. Ekibi bunun küçük ölçekli bir sürümünü dört ya da beş yıl önce yürütmüş, aynı kötü tabloyu bulmuş ve şimdiye kadar sayıların düzelmesini beklemişti; açığın büyük bölümünü yazarların savsaklamasına değil, günden güne değişen donanıma bağlıyor. University of Chicago'dan Fred Chong daha ileri gidiyor ve bu kadar genç bir alanın çabasını yeniliğe harcaması gerektiğini, sıradan bilgisayar biliminde araştırmacıların birbirinden yineleme ölçütleri istemeye başlaması için onlarca yıl geçtiğini söylüyor. İki konum da ölçümle bağdaşıyor; ikisi de kod çalıştırıldığında ne olduğunu değiştirmiyor.[1]
Bu, bir hüküm yerine sınanabilir bir beklenti veriyor. Bu ön baskıdan sonra yayımlanmış makalelerden benzer büyüklükte elle bir örneklem aynı beş soruyla, çalıştırma adımı dahil, puanlanırsa ve bu arada büyük bir kuantum hesaplama dergisi ya da konferansı kod ürünlerinin değerlendirilmesini şart koşmaya başlamazsa, çalıştırılabilir kod sunan makalelerin payı, biri bunu 2027 Ağustos'unun sonuna kadar bildirdiğinde yine dörtte birin altında çıkmalı. İzlenecek sinyal, bu çerçevenin hem erişilebilirlik oranını hem çalıştırma başarısızlığı oranını veren yayımlanmış bir tekrarı. Böyle bir ölçüm yeniden vurana kadar alanın elinde bir eğilim yerine tek bir denetim var.[1]