Trusence Her iddianın bir kaynağı var
Son güncelleme: 8 Ekim 2026 Ara English
← Tüm haberler
Modeller

Goodfire, kötü niyetli yapay zeka ajanlarını iç sinyallerle izleyen daha ucuz monitörler sundu

Goodfire’ın yeni yaklaşımı, model çıktısını yeniden okutmadan çalışan güvenlik monitörleriyle maliyeti düşürüyor ve Baseten müşterileri bunu kullanabiliyor.

Goodfire, bir modelin çıktısını ikinci bir modelin baştan sona yeniden okuması yerine, doğrudan iç aktivasyonlarını inceleyen daha ucuz yapay zeka ajanı güvenlik monitörleri tanıttı. Baseten müşterileri bu monitörleri artık kullanabiliyor.

Şirket, bu yaklaşımın uzun süre çalışan iş yüklerinde çok daha düşük maliyetli olduğunu söylüyor. Kimi K3 testlerinde yaklaşık 1,500 izlenen oturum için maliyetin yaklaşık 51 dolar olduğunu, daha ucuz bir checker-model kurulumunda bunun yaklaşık 233 dolar, üst seviye bir kurulumda ise yaklaşık 10,000 dolar tuttuğunu aktarıyor. Goodfire ayrıca probelerin kötü niyetli hacking çalışmalarının yüzde 94’ünü yakaladığını, masum vakaların yüzde 8.7’sini ek incelemeye gönderdiğini ve dört probe birlikte çalıştığında yanıtın başlamasına eklediği sürenin yüzde 2’nin altında kaldığını belirtiyor.

Neden önemli

Baseten müşterileri artık hacking, kimyasal ve biyolojik silah kötüye kullanımı ile reward hacking için ayrı ayrı izleme yapabiliyor ve hangi tepkinin verileceğini seçebiliyor. Bu, güvenlik kontrolünü çıktıyı sonradan denetleyen pahalı bir katmandan, modelin iç davranışına bakan daha ucuz ve daha hızlı bir katmana taşıyor. Goodfire’ın hedefi de model davranışını eğitime kadar geri izlenebilir hale getirmek.

Kaynaklar

  • TechCrunch