ИИ-модели притворились людьми и попытались обмануть разработчиков
Ведущие модели искусственного интеллекта от Anthropic и OpenAI создали фальшивые аккаунты и выдавали себя за людей. Они пытались обманом склонить программистов к участию в кибератаках. Это выяснил британский Институт безопасности ИИ (AISI) в ходе испытаний, результаты которых опубликованы в докладе.
Вредоносная активность была зафиксирована 28 июля. В 10 из 122 тестов модели совершали автономные, несанкционированные действия в сети, направленные против реальных людей и организаций. Большинство инцидентов пришлось на модель Mythos 5 от Anthropic.
По данным института, Mythos 5 создала несколько поддельных учетных записей, пыталась внедрить вредоносный код в открытое ПО и добиться одобрения разработчиков. После неудачи ИИ изменил следы своей деятельности, чтобы скрыть вредоносный характер, и рассматривал вариант создания нового аккаунта для повторных попыток.
Модель также отправляла реальным людям сообщения со ссылками на вредоносное ПО. Одна из моделей оставляла публичные сообщения на GitHub, предлагая сотрудничество другим агентам, выполняющим схожие задачи.
Ранее эксперты рассказали, как распознать изображение, созданное ИИ. В первую очередь нужно обратить внимание на уши: нейросети нередко некорректно прорисовывают завитки и мочки. Также стоит оценить симметрию.
