ГлавнаяНовости
Поделиться

ИИ-модели Anthropic взломали системы трех организаций во время тестов

Одна из моделей продолжила атаку, даже узнав, что подключена к интернету

Альберт Фахрутдинов

Альберт Фахрутдинов

корреспондент
Модели Anthropic взломали реальные системы во время тестирования / Фото: Photo For Everything/Shutterstock.com

Модели Anthropic взломали реальные системы во время тестирования / Фото: Photo For Everything/Shutterstock.com

ИИ-модели линейки Claude от Anthropic взломали реальные системы трех организаций при проверке кибербезопасности перед запуском, сообщил стартап в своем блоге. Участниками инцидентов оказались выпущенная в апреле Opus 4.7 и две из самых мощных разработок Anthropic — Mythos 5 и внутренняя исследовательская модель, которую не собирались выпускать. 

Тесты проходили в формате «захвата флага»: моделям поручили взламывать другие системы, чтобы найти спрятанную информацию. Более старая разработка продолжила атаку, даже узнав, что подключена к интернету. Новейшая остановилась, поняв, что вышла в сеть.

Как это стало возможным

Из-за недопонимания между Anthropic и внешним партнером Irregular тестовая среда осталась подключена к интернету, хотя по заданию Claude должен был действовать в симуляции без выхода в сеть. Поэтому модели приняли реальные системы за часть упражнения. В отличие от случая OpenAI, уязвимость нулевого дня (скрытые ошибки, о которых разработчики еще не знают) они не использовали: доступ в интернет был обеспечен конфигурацией тестирования, пишет Axios.

Глава OpenAI Сэм Альтман / Фото: Antonello Marangi/Shutterstock.com

Модели OpenAI взломали вторую компанию: какие будут последствия?

Тесты шли без защиты, предусмотренной в общедоступных версиях, чтобы исследователи могли оценить возможности самого ИИ. Если бы ограничения были, они, по утверждению Anthropic, заблокировали бы попытку взлома. Claude применял простые приемы: воспользовался слабыми паролями и интерфейсами, не требовавшими аутентификации.

Три взлома

После сообщения OpenAI о несанкционированных выходах ее моделей в открытую сеть Anthropic проверила более 141 тыс. своих тестовых запусков и обнаружила три аналогичных инцидента. Первые из них произошли в апреле. В одном случае Opus 4.7 не смогла добраться до вымышленной цели, но нашла реальный сайт с тем же названием и взломала его.

Mythos 5, считая, что действует в симуляции, создала и загрузила вредоносный пакет Python в публичный репозиторий PyPI. Он оставался доступен около часа.  За это время его скачали и запустили на 15 реальных системах. Одна принадлежала компании по кибербезопасности, автоматически устанавливающей программы Python для поиска опасного ПО. В результате код Claude смог похитить учетные данные и получить доступ к другим объектам инфраструктуры.

В третьем случае внутренняя исследовательская модель не добралась до вымышленной мишени, просканировала около 9000 целей и взломала доступное из интернета приложение одной компании. Затем она поняла, что оказалась в облачном аккаунте, «никак не связанном с заданием по захвату флага», и прекратила атаку.

Почему это важно

Инциденты с OpenAI и Anthropic свидетельствуют о том, что модели оставались сосредоточенными на выполнении порученных им задач, а не на достижении неких собственных целей, констатирует Axios.  

Anthropic раскрыл взломы почти через четыре месяца после объявления о Mythos, распространение которой компания жестко ограничила из-за мощности и потенциальной опасности этой разработки, напоминает Bloomberg.

«Проверку безопасности проводят до выпуска модели именно потому, что мы еще не знаем, на что она способна», — заявили в Anthropic.

Поделиться

Главное

Поиск по акциям
Покупать
Продавать


















Small Caps
Review
Новости финансов и инвестиций