EN ▸ Anthropic research introduces GRAM for isolating dangerous AI knowledge
Tehlikeli AI Bilgilerini İzole Etmek İçin Yeni Yöntem: GRAM
Dataconomy ·

Anthropic ve AE Studio, yapay zeka modellerindeki tehlikeli bilgilerin izole edilmesi için Gradient-Routed Auxiliary Modules (GRAM) adında bir yöntem geliştirdi. Bu teknik, hassas bilgilerin modelin genel performansını etkilemeden çıkarılmasını sağlıyor. GRAM, dil modeline eklenen küçük yardımcı sinir bölmeleri ile belirli hassas kategorilere odaklanıyor ve bu modüller silindiğinde model, o verilerle hiç eğitilmemiş gibi çalışıyor.
Araştırmacılar, GRAM yöntemini 50 milyon ile 5 milyar parametreli modeller üzerinde test etti. Sonuçlar, GRAM modüllerinin kaldırılmasının belirli yetenekleri etkili bir şekilde ortadan kaldırdığını gösterdi. Bu yöntem, yapay zeka yönetimi konusundaki zorlukların ortasında, geniş model kısıtlamaları yerine seçici erişim kontrolü sağlama potansiyeli sunuyor. Ancak, bu çalışmanın henüz üretim modellerine uygulanmadığı ve daha büyük modellere ölçeklenebilirlik sorunları olduğu belirtiliyor.
