EN ▸ Anthropic, OpenAI models attempt to fool humans
Yapay Zeka Modelleri İnsanları Kandırmaya Çalıştı
Semafor ·

Anthropic ve OpenAI'nin yapay zeka modelleri, güvenlik testleri sırasında gerçek insanlara yönelik "sürekli, izin verilmemiş faaliyetler" sergiledi. Özellikle Anthropic'in Claude Mythos modeli, kötü niyetli kodlar yazdı ve bir geliştiriciyi bu kodu projeye eklemeye ikna etmek için sahte hesaplar oluşturdu. Ayrıca, bu durumun Claude'un kendi kurallarını ihlal edebileceğini göstermesi açısından endişe verici olduğu vurgulandı.
