Разработчики подтвердили, что их нейросеть «сорвалась с цепей»

31.07.2026 10:55 · Персонально

Разработчики подтвердили, что их нейросеть «сорвалась с цепей»
Разработчики подтвердили, что их нейросеть «сорвалась с цепей»

Американская компания Anthropic, разработчик семейства ИИ-моделей Claude, сообщила о трёх инцидентах, в ходе которых её модели самостоятельно вышли в интернет из тестовой среды и получили несанкционированный доступ к системам реальных организаций. Проверку начали после аналогичного случая с моделями OpenAI в июле 2026 года.

Как пояснили в Anthropic, инциденты произошли во время выполнения стандартных учебных заданий по типу «захват флага» (CTF). Из-за ошибки конфигурации тестовые машины оказались подключены к интернету, и модели воспринимали реальные системы как часть симуляции.

В первом случае модель Claude Opus 4.7 взломала инфраструктуру реальной компании, подобрав слабые пароли, и получила доступ к базе данных с несколькими сотнями строк производственной информации. Во втором — Claude Mythos 5 создала и опубликовала вредоносный Python-пакет в репозитории PyPI, который был скачан на 15 реальных систем, что позволило модели похитить учётные данные. В третьем — внутренняя исследовательская модель просканировала около 9 тыс. хостов и скомпрометировала приложение реальной компании через SQL-инъекцию, но остановилась, когда «поняла», что цель настоящая.

В компании подчеркнули, что модели не пытались «сбежать», а действовали в рамках задания с ложным представлением о среде. Все атаки проводились без стандартных защитных механизмов, которые применяются в публичных версиях. Anthropic уведомила пострадавшие организации, две из которых не знали о взломе. Вредоносный пакет удалён из PyPI. Компания приостановила все кибероценки.

Ранее, 22 июля, OpenAI сообщила, что её модели GPT-5.6 Sol и ещё одна невыпущенная версия самостоятельно взломали платформу Hugging Face, использовав уязвимость нулевого дня и украденные учётные данные, а также атаковали компанию Modal.