Kazanç nerede ölçülüyor?

Blueberry, Instacart'ın nöbetçi mühendisler için kurduğu yapay zekâ destekli olay müdahale sistemi. Bir uyarı tetiklendiğinde yaklaşık 10 alt eylemciyi aynı anda çalıştırıyor ve mühendislerin çalıştığı Slack başlığına yaklaşık üç dakika içinde gerekçelendirilmiş bir kök neden önerisi bırakıyor. Şirketin bildirdiği sayılar şöyle: nisan ayında 270'ten fazla Slack kanalında yaklaşık 25.000 tanı turu, yüzde 99,9 iş akışı başarısı, 58.000'in üzerinde MCP araç çağrısı ve yaklaşık 60 ekip profili. Ölçülen iş, olayın ilk dakikalarında yapılan bağlam toplamadır.[1]

Tanı doğruluğunun yüzde 60 bandının ortasından yüzde 90 bandının üstüne çıkması, sistemin 14 yılı aşkın olay geçmişine dayandırılmasına bağlanıyor. Buradaki sınır açık: sayıların tamamı şirket beyanı, bağımsız bir ölçüm yayımlanmadı ve doğruluğun hangi etiketli kümeye göre hesaplandığı anlatılmıyor. Üretim ortamında doğruluk, hangi olayların örneklendiğine ve bir yanıtı kimin doğru saydığına göre değişir.[1]

Çağrı cihazı hâlâ kimde?

Bu yapay zekâ sistemi üretim ortamında kendiliğinden değişiklik yapmıyor; bilgi topluyor, hipotez üretiyor ve hata ayıklamaya destek oluyor. Tanı, hafifletme kararları ve düzeltme mühendislerin sorumluluğunda. Şirketten Alan Wong, aracın nöbetçi mühendisin başlangıç noktasını değiştirdiğini, boş bir araştırma yolundan başlamak yerine günlükler ve dağıtımlar gibi toplanmış bağlamla başlandığını anlatıyor. Ortadan kalkan görev bağlam toplamak; hesap verilebilir karar ise yerinde duruyor.[1]

Buradan sonrası bir dağılım sorusu ve yanıtı henüz yayımlanmadı. Hızlanan ilk teşhis daha az çağrıya mı, daha küçük bir nöbet listesine mi, daha kısa kesintilere mi dönüşüyor, yoksa mühendis başına düşen olay sayısını mı artırıyor? Dört sonuç da aynı verimlilik kazancından çıkabilir ve birbirinden çok farklı çalışma koşulları üretir. Okurun bekleyebileceği somut ölçü, nöbet listesinin büyüklüğü ile mühendis başına düşen çağrı sayısının açıklanmasıdır; şirketin bildirdiği başarı oranları bu soruyu yanıtlamıyor.[1]