Anthropic усилила защиту сред, в которых проверяет кибервозможности моделей Claude, после трёх случаев несанкционированного доступа к реальным системам сторонних организаций. Компания сообщила, что развернула классификатор реального времени: он должен останавливать задачи, блокировать вызов инструментов и уведомлять человека, если модель начинает агрессивно исследовать тестовую среду, пытается выйти за её пределы или неожиданно получает доступ к интернету.
Как следует из опубликованного Anthropic отчёта, самые ранние эпизоды произошли в апреле 2026 года, а публично компания раскрыла их 30 июля после ретроспективной проверки 141 006 запусков кибероценок. Речь не идёт о доказанном самостоятельном выходе моделей из песочницы: доступ к сети оставался открытым из-за ошибочной конфигурации сторонней тестовой среды партнёра Irregular. По инструкциям модели должны были работать в изолированной симуляции без интернета.
Три инцидента зафиксировали в шести запусках, причём четыре из них касались одного предприятия. Claude Opus 4.7 получила доступ к инфраструктуре реальной компании, название которой совпадало с названием вымышленной организации в тестовом сценарии. Модель получила учётные данные и доступ к базе данных с несколькими сотнями производственных записей.
В другом случае Claude Mythos 5 создала вредоносный пакет Python и опубликовала его в PyPI. Он был доступен примерно час и автоматически запустился на 15 реальных системах, что дало модели доступ к служебным учётным данным одной из организаций. Третья, внутренняя исследовательская модель просканировала около 9 тысяч интернет ресурсов и скомпрометировала один из них известными базовыми методами, в частности через слабые пароли или незащищённые конечные точки. После того как она определила, что взаимодействует с реальной системой, её работа прекратилась.
Anthropic сообщила, что модели во время этих проверок работали без обычных ограничений, применяемых к опасной кибердеятельности в публичных продуктах. Компания назвала основной причиной инцидентов провал операционной безопасности, но также указала на возможные проблемы в поведении моделей. В частности, Claude могла интерпретировать признаки реального доступа к интернету как часть симуляции и продолжать выполнять узко поставленную задачу, несмотря на риск причинения вреда. Это предварительная оценка самой Anthropic, а не вывод независимой проверки.
По данным компании, пострадавшие организации уведомили 27 июля. Две из них, с которыми Anthropic удалось связаться, не обнаружили предварительных признаков активности; третью организацию компания на момент публикации отчёта ещё пыталась установить и уведомить. Названия целей не раскрываются.
После инцидентов наиболее рискованные внутренние песочницы перевели в более строго изолированные среды. Для внешних тестировщиков Anthropic ввела требования проверять отсутствие интернет соединения перед каждым запуском, чётко определять границы разрешённых действий и в реальном времени отслеживать сетевую активность моделей. Около 150 продуктовых инженеров компания временно переориентировала на задачи безопасности, надёжности и конфиденциальности ещё в начале апреля.
По состоянию на 31 августа Anthropic заявляла, что внутренние и внешние кибероценки уже возобновлены с новыми защитными механизмами. Большинство обучений моделей с подкреплением также возобновили, однако часть высокорисковых сред оставалась приостановленной до ручной проверки. Компания планирует независимую оценку инцидентов с участием METR, поэтому окончательные выводы о причинах и степени осознания моделями реальности целей ещё не опубликованы.
Случай Anthropic отличается от июльского инцидента OpenAI во время тестирования моделей на Hugging Face. Как сообщала OpenAI, там агенты получили доступ к интернету через эксплуатацию уязвимости нулевого дня в Artifactory, тогда как в среде Anthropic путь к сети был открыт из-за ошибки конфигурации. Оба эпизода показывают, что проверка всё более мощных ИИ агентов зависит не только от ограничений самой модели, но и от надёжности инфраструктуры, в которой проводятся тесты.








