Goodfire, kötü niyetli yapay zeka ajanlarını iç sinyallerle izleyen daha ucuz monitörler sundu
Goodfire’ın yeni yaklaşımı, model çıktısını yeniden okutmadan çalışan güvenlik monitörleriyle maliyeti düşürüyor ve Baseten müşterileri bunu kullanabiliyor.
Goodfire, bir modelin çıktısını ikinci bir modelin baştan sona yeniden okuması yerine, doğrudan iç aktivasyonlarını inceleyen daha ucuz yapay zeka ajanı güvenlik monitörleri tanıttı. Baseten müşterileri bu monitörleri artık kullanabiliyor.
Şirket, bu yaklaşımın uzun süre çalışan iş yüklerinde çok daha düşük maliyetli olduğunu söylüyor. Kimi K3 testlerinde yaklaşık 1,500 izlenen oturum için maliyetin yaklaşık 51 dolar olduğunu, daha ucuz bir checker-model kurulumunda bunun yaklaşık 233 dolar, üst seviye bir kurulumda ise yaklaşık 10,000 dolar tuttuğunu aktarıyor. Goodfire ayrıca probelerin kötü niyetli hacking çalışmalarının yüzde 94’ünü yakaladığını, masum vakaların yüzde 8.7’sini ek incelemeye gönderdiğini ve dört probe birlikte çalıştığında yanıtın başlamasına eklediği sürenin yüzde 2’nin altında kaldığını belirtiyor.
Neden önemli
Baseten müşterileri artık hacking, kimyasal ve biyolojik silah kötüye kullanımı ile reward hacking için ayrı ayrı izleme yapabiliyor ve hangi tepkinin verileceğini seçebiliyor. Bu, güvenlik kontrolünü çıktıyı sonradan denetleyen pahalı bir katmandan, modelin iç davranışına bakan daha ucuz ve daha hızlı bir katmana taşıyor. Goodfire’ın hedefi de model davranışını eğitime kadar geri izlenebilir hale getirmek.
Kalsın mı, çizilsin mi?
Bu haber önemli mi, yoksa abartı mı? Başkalarının ne dediğini görmeden önce sen işaretle.
Kaynaklar
- TechCrunch