Eigen RadarYapay Zekâ
Analiz

Kimlik beslemeleri, OCR sayfaları, perakende vektörleri: sonraki kararları biçimlendiren girdiler

ICE'nin Palantir'e giden LexisNexis beslemesi, FineBooks OCR puanları, Malachyte perakende vektörleri ve WPP'nin pazarlama hattı, farklı girdi yığınlarının ardından gelen otomatik kararları nasıl biçimlendirdiğini gösteriyor.

Yapay Zekâ··Sabah
Renkli parçacık tepsilerinin şeffaf kanallardan bir karar haznesine aktığı koyu bir düzenek.

Kimlik beslemeleri ve tarihsel sayfalar

Satın alma belgelerine göre ABD göçmenlik idaresi ICE, LexID ve Accurint Virtual Crime Center erişiminin sürmesi için LexisNexis'e 6,7 milyon dolar ödeyecek. Bu araçlar, 10.000'den fazla kaynaktan derlenen 82 milyar kamuya açık ve özel kaydı bir araya getiriyor. Sözleşme, verinin Palantir platformu dahil ICE uygulamalarına bağlanmasını şart koşuyor. Joseph Cox imzalı haberde, LexisNexis araçlarının veriden kimlik çıkaran yapay zekâ tabanlı bir tanımlama düzeni ile belgelerde çeşitli kaynaklarda yüksek doğrulukla yüz eşleştirmesi yapmak üzere büyük ölçekli görüntü veri tabanlarından yararlandığı anlatılan bir yüz tanıma düzeni içerdiği belirtiliyor. Belgeler, hizmetin Palantir platformu, PenLink ve ICE Data Analytics gibi ICE uygulamalarıyla arayüz üzerinden çalışması gerektiğini söylüyor; tarama ve inceleme, ipucu geliştirme, adli çözümleme ile sınır dışı işlemlerini yürüten Enforcement and Removal Operations biriminin işleri de kapsam içinde. Düzeneğin ICE'nin ELITE adlı sistemiyle bağı belgelerden anlaşılmıyor. Ayrı bir hat üzerinde Hugging Face ile EleutherAI, optik karakter tanımayı Biodiversity Heritage Library'den alınan 2.165 tarihsel kitap sayfası üzerinde puanlayan FineBooks değerlendirmesini yayımladı. En iyi model, 1.000 sayfa başına 2 dolar altı giderle yüzde 97,6 karakter doğruluğuna ulaştı.[1], [2]

Perakende vektörleri ve pazarlama kitleleri

İki ticari girdi hattı da otomatik sonraki adımlar için yeniden kuruluyor. Malachyte'ın genel müdürü Sidd Motwani ile makine öğrenimi mühendisi Vicki Boykis, dikkat tabanlı sinir ağlarını soğuk başlangıç sorununa uygulayan bir e-ticaret öneri düzenini anlatıyor: sistem, bir dil modelinin sonraki kelimeyi tahmin etmesi gibi alışverişçinin sonraki isteğini tahmin ediyor. Yazıya göre öneri döngüsü 100 milisaniye altında bitiyor. Yazı üç katman tanımlıyor: Managed Service for Apache Kafka davranış olaylarını topluyor; Cloud Bigtable kullanıcı vektörlerini 10 milisaniye hızında saklayıp güncellerken Cloud Pub/Sub katalog ve stok güncellemelerini taşıyor; Google Kubernetes Engine ile Compute Engine de eylemcileri ve çıkarımı çalıştırıyor. Model bütün perakendecilerde sürekli eğitiliyor; yazarlar bunu bir veri kooperatifi diye anıyor. Perakendecilerin satışlarını iki, kimi zaman üç katına çıkardığı savı Malachyte'ın kendi vaka çalışmalarına dayanıyor; bağımsız bir ölçüm gösterilmiyor. Utkarsh Bhardwaj ve Prabha Arya imzalı ikinci yazı, WPP'nin pazarlama verisini yüzlerce küresel ajansa dağılmış bulmasının ardından kurduğu eylemci pazarlama düzeni WPP Open'ı anlatıyor. Şirket, üretim veriminde yüzde 70 kazanç, içerik hacminde 33 kat artış, kampanya yatırım getirisinde 2,8 kat artış ve yaratıcı iş ile strateji süresinin dört haftadan üç saate inmesini bildiriyor.[3], [4]

Besleme sonraki adımı nasıl biçimlendiriyor

Bu dört hattı birleştiren şey, her girdi yığınının ardından gelen kararları nasıl biçimlendirdiği. ICE örneğinde ücretli bir kimlik ve kayıt beslemesi, Palantir'i de içeren uygulamalara sözleşmeyle bağlanmak zorunda; tarama, ipucu çalışması ve sınır dışı işlemleri, belgelerde anlatıldığı gibi yapay zekâ tanımlama ile yüz eşleştirmesini de barındıran bir LexisNexis paketinin ardından geliyor. FineBooks daha erken bir noktada duruyor: Matthias Bastian, karşılaştırma ölçütünün IMPACT projesi ile BHL-Europe'tan geldiğini; uzmanların 2011 ile 2012 arasında İngilizce, Fransızca, Almanca ve Latince altı cildi 2.000 karakterde yaklaşık bir hatayla yazıya döktüğünü yazıyor. Sıralama karakter hata oranına göre yapılıyor; listenin başındaki dots.mocr 3 milyar parametreyle çalışıyor ve Talkie projesinin daha önceki bulgusuna göre OCR metniyle eğitilen bir dil modeli, insan eliyle yazıya dökülmüş metinlerle eğitilene göre yalnızca yüzde 30 verimlilikle öğreniyor. Bastian'a göre bu doğruluk eğitim derlemleri için yeterli, akademik çalışma için henüz erken. WPP mimarisi Cloud Storage ve BigQuery üzerindeki ortak veri projelerini ayrı işleme projelerinden ayırıyor; Managed Service for Apache Spark girdileri yaş, cinsiyet, coğrafya, ürün ve ilgi alanına göre anahtarlanmış standart kitle tanımlarına dönüştürüyor; hatları Kubeflow yönetiyor. Yazı, bildirdiği iş sonuçları için ne bir başlangıç noktası ne de bir ölçüm yöntemi veriyor. Kimlik beslemeleri, OCR niteliği, perakende vektörleri ve pazarlama kitleleri boyunca otomatik adım, kendisinden önce gelen beslemenin biçimini devralıyor.[1], [2], [3], [4]

Kaynakça

  1. Haber kaynağı404 MediaICE, Palantir'e aktardığı veri için LexisNexis'e 6,7 milyon dolar ödeyecek↩1↩2
  2. Haber kaynağıThe DecoderFineBooks, 14 açık ağırlıklı OCR modelini insan eliyle yazıya dökülmüş tarihsel sayfalarla sınıyor↩1↩2
  3. Haber kaynağıGoogle CloudMalachyte, perakende önerilerini 10 milisaniyede güncellenen bir kullanıcı vektörü üzerine kuruyor↩1↩2
  4. Haber kaynağıGoogle CloudWPP, pazarlama veri hattını Google Cloud üzerinde tekleştirdi ve içerik hacminde 33 kat artış bildiriyor↩1↩2