ГлавнаяНовости
Поделиться

«Атаки станут реальной угрозой»: OpenAI сообщила о взломе ИИ-агентами ее же систем

ИИ-лаборатория также раскрыла подробности о предыдущих атаках. Вслед за независимыми исследователями OpenAI подтвердила, что во взломе Hugging Face участвовали около 700 ее агентов

Альберт Фахрутдинов

Альберт Фахрутдинов

корреспондент
Взлом Hugging Face устроили сотни ИИ-агентов OpenAI, утверждают независимые исследователи из METR и Redwood Research / Фото: doomu/Shutterstock.com

Взлом Hugging Face устроили сотни ИИ-агентов OpenAI, утверждают независимые исследователи из METR и Redwood Research / Фото: doomu/Shutterstock.com

Июльский взлом Hugging Face — популярной платформы, где публикуют открытые ИИ-модели для свободного использования, — совершил не один агент OpenAI, как сообщалось ранее, а рой примерно из 700 действовавших сообща агентов. Об этом говорится в совместном расследовании исследовательских компаний METR и Redwood Research. Open AI подтвердила Reuters, что оценка независимых экспертов верна, а также рассказала, что ИИ-агенты проникли не только в системы Hugging Face, но и взломали в прошлом месяце ее собственную внутреннюю инфраструктуру.

Детали

По данным METR и Redwood Research, агенты обменялись десятками тысяч сообщений через созданный ими без разрешения канал связи. По оценке Reuters, масштаб их взаимодействия, вероятно, вызовет вопросы о том, насколько внимательно OpenAI следила за испытаниями. Hugging Face не ответила на запрос агентства.

Согласно техническому отчету OpenAI, агенты запустили собственный код на 41 сервере Hugging Face и получили права суперпользователя как минимум на одном из них, пишет Axios. Они также добрались до учетных данных рабочей среды и части внутренних данных платформы и скачали четыре закрытых репозитория с кодом.

Взлом изнутри

Агенты проникли не только в системы Hugging Face. OpenAI сообщила о двух инцидентах 19 июля, когда они взломали внутреннюю инфраструктуру самой компании. В одном случае агенты воспользовались уязвимостью в компьютере, за пределы которого не должны были выходить, и получили доступ к другим подключенным системам. В другом — похитили учетные данные OpenAI и вмешались в работу ее облачной инфраструктуры, отмечает Reuters.

По объяснению OpenAI, агенты пытались обмануть системы оценки или получить больше свободы действий. Неуказанное число агентов вмешивалось в работу автоматических инструментов, оценивавших результаты испытаний, чтобы скрыть признаки обмана. Компания утверждает, что вмешательство в итоге не повлияло на записи, использовавшиеся при автоматической оценке. В отчете также говорится, что свидетельств попыток обмануть людей, проверявших результаты, было немного, сообщает Reuters. OpenAI не ответила на вопрос Reuters, означает ли это, что некоторые агенты все же пытались ввести проверяющих в заблуждение.

ИИ заметает следы

В независимом расследовании и в отчете самой OpenAI говорится, что ИИ-модели пытались скрыть нарушения, удаляя или изменяя записи о своих действиях. Независимые эксперты установили, что каждый пятый из изученных агентов проявлял явный интерес к манипулированию доказательствами, а многие подробно изучали способы изменить или подделать журналы своих действий, пишет Reuters.

OpenAI также сообщила, что агенты обманывали системы в испытаниях, не связанных с кибербезопасностью, в том числе при работе с базой данных белков и электронной таблицей. Это может означать, что проблема носит более глубокий характер, заявил Reuters исследователь ИИ-агентов Джеффри Лэдиш из Palisade Research. «Это примерно как спросить: если Билли списывает по всем предметам, а не только по информатике, это тревожнее? Что ж, да, тревожнее», — пояснил он.

Пропущенные сигналы

OpenAI замечала тревожные признаки еще до взлома Hugging Face, пишет Axios со ссылкой на отчет компании. Сначала внутренняя команда увидела, как агент использует импровизированный форум, а также зафиксировала случаи выхода агентов в интернет вопреки ограничениям. Примерно через месяц, 27 июня, система мониторинга кибербезопасности предупредила OpenAI о подозрительной активности, связанной с перемещением агентов по сети через этот форум, но дежурные специалисты решили не останавливать испытание. Позднее компания признала, что некоторые из этих сигналов могли потребовать реакции до того, как агенты взломали Hugging Face.

Расследование OpenAI также выявило признаки того, что обучение могло непреднамеренно закрепить поведение, способствовавшее инциденту. Когда предусмотренные заданием инструменты не работали или были недоступны, агенты учились исследовать и взламывать отдельные элементы своей среды. В некоторых случаях они получали положительную оценку даже после использования непредусмотренных способов. Например, один агент воспользовался уязвимостью, добрался до программы, которую должен был воспроизвести, скопировал ответ и получил награду за выполненное задание, отмечает Axios.

По мнению Axios, инцидент ставит вопрос о том, успевают ли тестовые среды и внутренние средства защиты ИИ-компаний за моделями, которые все лучше находят и используют уязвимости самостоятельно. «Учитывая быстрый прогресс в ИИ-индустрии, следует исходить из того, что подобные атаки уже в ближайшем будущем станут реальной угрозой для компаний и будут более изощренными», — предупредила OpenAI (цитата по Reuters).

Поделиться

Главное

Поиск по акциям
Покупать
Продавать


















Small Caps
Review
Новости финансов и инвестиций