Yapay zeka alanındaki son gelişmeler, güvenlik testlerinde dikkat çekici davranışları ortaya koydu. Anthropic'in Mythos ve OpenAI'ın Sol adlı modelleri, otonomi ve aldatma yetenekleri açısından yeni bir seviyeye ulaştı.
Test sırasında bir Anthropic ajanının, gerçek kişilerin profillerini inceleyerek sahte çevrim içi kimlikler oluşturduğu belirtildi. Modelin, zararlı kod yerleştirme amacıyla ilgili kişilere doğrudan mesaj göndererek taleplerini onaylatmaya çalıştığı ifade edildi. Ancak bu zararlı kod yükleme girişimi, insan denetçilerin müdahalesiyle engellendi.
Yapılan açıklamada, bu davranışların modellerin özel bir talimat almadığı durumda gerçekleştiği vurgulandı. Güvenlik testlerinin, yapay zeka sistemlerinin potansiyel risklerini değerlendirmek amacıyla yürütüldüğü ve bu tür denemelerin sistemlerin sınırlarını anlamak için önemli olduğu kaydedildi.