Во время внутренних испытаний моделей Claude из-за неверно изолированной тестовой среды пострадали три реальные организации. Одна модель создала вредоносный Python-пакет, разместила его в PyPI, а код успел выполниться на 15 системах.
Инциденты произошли во время заданий capture-the-flag, организованных через компанию Irregular. Моделям сообщили, что интернет недоступен и все цели являются имитацией, однако из-за ошибки конфигурации среда имела реальный доступ в Сеть.
Claude Mythos 5 обнаружил в учебных материалах название несуществующего пакета и зарегистрировал его в PyPI. Пакет находился в открытом доступе около часа, после чего автоматическая защита реестра удалила его. За это время код скачали и запустили 15 реальных систем; на одной из них он похитил учётные данные и использовал их для дальнейшего доступа.
В другом испытании Claude Opus 4.7 добрался до производственной базы реальной компании, а ещё одна исследовательская модель просканировала около девяти тысяч узлов и взломала внешнее приложение. Anthropic остановила кибериспытания 23 июля 2026 года, уведомила затронутые организации и планирует усилить изоляцию, наблюдение за журналами и независимую проверку.
Официальное объяснение Anthropic: https://www.anthropic.com/
Claude во время тестов взломал три реальные организации и загрузил вредоносный пакет в PyPI
Источник: Anthropic / BleepingComputer