Eigen RadarYapay Zekâ
Analiz

Goodfire, yapay zekâ eylemcilerinin iç sinyallerini izleyerek kuşkulu adımları seçiyor

Goodfire, yapay zekâ eylemcisinin görev sırasındaki iç etkinliğini izleyen hizmetini Baseten üzerinden açtı. Küçük algılayıcılar, her adımı başka bir modele göndermek yerine kuşkulu adımları ayrıntılı incelemeye ayırıyor. Müşteriler izlenecek riskleri ve uyarının ardından uygulanacak işlemi seçebiliyor. İlk desteklenen model Kimi K3; hizmet, tehlike işaretini saptamayla eyleme izin verme kararını ayrı aşamalarda yürütüyor.

Yapay Zekâ··Gece
Aydınlık bir çalışma alanında iki kişi işaretsiz ekranın önünde duruyor; geride başka bir çalışan oturuyor.

İç sinyaller ayrıntılı incelemeye gidecek adımları seçiyor

Yapay zekâ modellerinin işleyişini yorumlamaya yönelik araçlar geliştiren Goodfire, eylemci izleme hizmetini 8 Ekim’de model barındırma platformu Baseten üzerinden açtı. İlk desteklenen model Kimi K3. Küçük algılayıcılar, model görevini yürütürken iç etkinliğini inceliyor. Kuşkulu bulunan adımlar, daha ayrıntılı değerlendirme için başka bir modele gönderiliyor. Böylece denetim, yalnızca son yanıtı beklemek yerine görevin ara adımlarında çalışıyor.[1], [2]

Müşteriler risk türünü ve uyarıya verilecek yanıtı seçiyor

Müşteriler, saldırı amaçlı bilgisayar sızmalarını, kimyasal ya da biyolojik silahlarla ilgili davranışları ve ödül düzenini kötüye kullanma girişimlerini izleyebiliyor. Son kategori, verilen işi yapmak yerine puanlama mekanizmasını kandırmaya çalışmayı anlatıyor. Uyarıya verilecek yanıt da uygulamaya göre ayarlanıyor. Bir olayın günlüğe yazılması, insan incelemesine gönderilmesi veya eylemin reddedilmesi seçilebiliyor. İç sinyalin sınıflandırılması ile uygulamanın neye izin vereceği ayrı işlemler olarak yürütülüyor.[1]

Erişim tek model ve tek barındırma platformuyla başlıyor

Daha ağır dış inceleme, bütün çıktılara sürekli uygulanmak yerine seçilen adımlara ayrılıyor. Goodfire yöneticileri Eric Ho ve Dan Balsam, bu seçimi modelin iç etkinliğine dayandırıyor. Başarım deneyleri ve gider karşılaştırmaları şirketin kendi ölçümleri; bağımsız bir hizmet değerlendirmesi olarak sunulmuyor. Erişim, belirli bir model ve barındırma kanalıyla başlıyor. Hizmetin kullanıma açılması, her model veya her eylemci kurulumu için aynı korumanın sağlandığı sonucunu vermiyor.[1]

Kaynakça

  1. Haber kaynağıTechCrunchGoodfire, eylemcilerin iç etkinliğini izleyen denetimleri açtı↩1↩2↩3
  2. Haber kaynağıCrypto BriefingGoodfire, iç etkinliği izleyen yapay zekâ denetimini Baseten üzerinden açtı↩