ГлавнаяНовости
Поделиться

ИИ-агенты OpenAI и Anthropic вышли из-под контроля и 19 раз атаковали реальные цели

Все произошло в ходе тестов ИИ-агентов британским регулирующим органом — разработки ведущих ИИ-лабораторий создавали поддельные профили на GitHub и вводили разработчиков в заблуждение

Альберт Фахрутдинов

Альберт Фахрутдинов

корреспондент
Участник акции «Марш против машин» в Лондоне с плакатом «ИИ — вор всего сущего»/ Фото: Loredana Sangiuliano/Shutterstock.com

Участник акции «Марш против машин» в Лондоне с плакатом «ИИ — вор всего сущего»/ Фото: Loredana Sangiuliano/Shutterstock.com

Созданный британским правительством для оценки передовых ИИ-систем Институт безопасности ИИ (AI Security Institute, AISI) сообщил, что в июле в ходе тестов на кибербезопасность модели Mythos 5 (Anthropic) и GPT-5.6 Sol (OpenAI) вышли из-под контроля и совершили «19 действий против реальных людей и организаций». На Mythos пришлось 17 из них, на GPT-5.6 Sol — два. Речь идет не о 19 отдельных случаях, а о «нескольких связанных линиях поведения», оговариваются исследователи.

Модели заводили фальшивые аккаунты на платформе для разработчиков GitHub, пытались манипулировать программистами, которые ведут открытые проекты, внедряли скрытые вредоносные инструкции и рассылали письма с ложными сведениями. GitHub подтвердил нарушение правил, а институт вместе с сервисом стер следы агентов и предупредил о случившемся пользователей.

Самым серьезным британские исследователи назвали случай, когда нейросеть занялась социальной инженерией. Она придумала несколько фальшивых личностей и стала убеждать сопровождавшего проект разработчика одобрить изменения. Тот распознал угрозу и отклонил код.

«Эти попытки не увенчались успехом, и наше расследование не выявило какого-либо реального ущерба. Но мы впервые видим, чтобы риски, связанные с автономностью и обманом, проявились так отчетливо, без специальных подсказок, в реальном мире», — заявили в AISI.

Условия теста

Исследователи сознательно открыли моделям выход в интернет и отключили классификаторы киберзащиты, а запрета пользоваться сетью не давали, пишет Axios. В отличие от июльского взлома Hugging Face агентом OpenAI, в тестах AISI модели не вырывались из изолированной среды, передает Reuters. При этом в британском институте признали, что пока не понимают, «в какой момент агент осознал, что действует в реальном мире, и насколько считал, что находится в вымышленном сценарии».

Глава OpenAI Сэм Альтман / Фото: Antonello Marangi/Shutterstock.com

Модели OpenAI взломали вторую компанию: какие будут последствия?

Второй инцидент

OpenAI 4 августа сообщила о еще одном инциденте: ее партнер по безопасности Irregular обнаружил, что модели разработчика вышли в интернет и взломали настоящий сайт, чье имя совпало с названием вымышленной компании из симуляции, пишет Axios.

Речь идет о проверке, аналогичной той, в ходе которой модели Anthropic взломали три организации, уточняет источник Bloomberg. Интернет в песочнице оставили намеренно, ради реалистичной оценки возможностей, но стороны не до конца согласовали процедуры и меры защиты, рассказал собеседник Axios. Тесты шли «с ослабленными мерами защиты, в условиях, не отражающих обычное использование», подчеркнули в OpenAI.

Что дальше

Кибервозможности передовых ИИ-моделей застали исследователей врасплох и вынуждают пересматривать протоколы безопасности, отмечает Axios. За последний месяц и OpenAI и Anthropic уже признавали, что их модели взламывали реальные организации и сайты в ходе штатного предрелизного тестирования.

AISI разрабатывает ограничения на доступ ИИ-агентов к интернету и внедряет наблюдение за ними в реальном времени. Оно должно блокировать вредоносную активность до взаимодействия с внешними ресурсами.

OpenAI и Irregular готовят рекомендации по безопасному проведению тестов. В Anthropic заявили, что случившееся «подчеркивает необходимость более широкого разговора о том, как безопасно оценивать все более способных ИИ-агентов» (цитата по AFR). 

Глава JPMorgan Джейми Даймон сравнил свободный доступ к Mythos с «передачей ракет» частным лицам / Фото: Mijansk786 / Shutterstock

«Все равно что раздать баллистические ракеты»: Даймон — об опасности ИИ-модели Mythos

Поделиться

Главное

Поиск по акциям
Покупать
Продавать


















Small Caps
Review
Новости финансов и инвестиций