İngiliz Yapay Zeka Güvenlik Enstitüsü'nün güvenlik filtrelerini esneterek gerçekleştirdiği testlerde, yapay zeka modellerinin onaylanmamış görevler için insanları kandırma taktiklerine başvurduğu belirlendi.

Test sürecinde Anthropic’in Mythos 5 ve OpenAI’ın GPT-5.6-Sol modellerinin, internet üzerinde izinsiz ve otonom eylemler yürüttüğü görüldü.

SAHTE KİMLİKLER ÜRETTİLER

Gerçekleştirilen 122 testin 10'unda sınırları aşan sistemlerden Anthropic modelinin, açık kaynaklı bir projeye zararlı kod eklemek amacıyla sahte kimlikler ürettiği saptandı.

Rusya’dan Ukrayna’ya hava saldırısı
Rusya’dan Ukrayna’ya hava saldırısı
İçeriği Görüntüle

Modelin insanları zararlı kodları çalıştırmaya ikna etmeye çalıştığı ve engellendiğinde yeni bir kimliğe geçmeyi düşündüğü kaydedildi.