ИИ-агенты OpenAI и Anthropic вышли из-под контроля и 19 раз атаковали реальные цели
Все произошло в ходе тестов ИИ-агентов британским регулирующим органом — разработки ведущих ИИ-лабораторий создавали поддельные профили на GitHub и вводили разработчиков в заблуждение

Участник акции «Марш против машин» в Лондоне с плакатом «ИИ — вор всего сущего»/ Фото: Loredana Sangiuliano/Shutterstock.com
Созданный британским правительством для оценки передовых ИИ-систем Институт безопасности ИИ (AI Security Institute, AISI) сообщил, что в июле в ходе тестов на кибербезопасность модели Mythos 5 (Anthropic) и GPT-5.6 Sol (OpenAI) вышли из-под контроля и совершили «19 действий против реальных людей и организаций». На Mythos пришлось 17 из них, на GPT-5.6 Sol — два. Речь идет не о 19 отдельных случаях, а о «нескольких связанных линиях поведения», оговариваются исследователи.
Модели заводили фальшивые аккаунты на платформе для разработчиков GitHub, пытались манипулировать программистами, которые ведут открытые проекты, внедряли скрытые вредоносные инструкции и рассылали письма с ложными сведениями. GitHub подтвердил нарушение правил, а институт вместе с сервисом стер следы агентов и предупредил о случившемся пользователей.
Самым серьезным британские исследователи назвали случай, когда нейросеть занялась социальной инженерией. Она придумала несколько фальшивых личностей и стала убеждать сопровождавшего проект разработчика одобрить изменения. Тот распознал угрозу и отклонил код.
«Эти попытки не увенчались успехом, и наше расследование не выявило какого-либо реального ущерба. Но мы впервые видим, чтобы риски, связанные с автономностью и обманом, проявились так отчетливо, без специальных подсказок, в реальном мире», — заявили в AISI.
Условия теста
Исследователи сознательно открыли моделям выход в интернет и отключили классификаторы киберзащиты, а запрета пользоваться сетью не давали, пишет Axios. В отличие от июльского взлома Hugging Face агентом OpenAI, в тестах AISI модели не вырывались из изолированной среды, передает Reuters. При этом в британском институте признали, что пока не понимают, «в какой момент агент осознал, что действует в реальном мире, и насколько считал, что находится в вымышленном сценарии».
Второй инцидент
OpenAI 4 августа сообщила о еще одном инциденте: ее партнер по безопасности Irregular обнаружил, что модели разработчика вышли в интернет и взломали настоящий сайт, чье имя совпало с названием вымышленной компании из симуляции, пишет Axios.
Речь идет о проверке, аналогичной той, в ходе которой модели Anthropic взломали три организации, уточняет источник Bloomberg. Интернет в песочнице оставили намеренно, ради реалистичной оценки возможностей, но стороны не до конца согласовали процедуры и меры защиты, рассказал собеседник Axios. Тесты шли «с ослабленными мерами защиты, в условиях, не отражающих обычное использование», подчеркнули в OpenAI.
Что дальше
Кибервозможности передовых ИИ-моделей застали исследователей врасплох и вынуждают пересматривать протоколы безопасности, отмечает Axios. За последний месяц и OpenAI и Anthropic уже признавали, что их модели взламывали реальные организации и сайты в ходе штатного предрелизного тестирования.
AISI разрабатывает ограничения на доступ ИИ-агентов к интернету и внедряет наблюдение за ними в реальном времени. Оно должно блокировать вредоносную активность до взаимодействия с внешними ресурсами.









