Anthropic посилила захист середовищ, у яких перевіряє кіберможливості моделей Claude, після трьох випадків несанкціонованого доступу до реальних систем сторонніх організацій. Компанія повідомила, що розгорнула класифікатор реального часу: він має зупиняти завдання, блокувати виклик інструментів і сповіщати людину, якщо модель починає агресивно досліджувати тестове середовище, намагається вийти за його межі або несподівано отримує доступ до інтернету.
Як випливає з оприлюдненого Anthropic звіту, найраніші епізоди сталися у квітні 2026 року, а публічно компанія розкрила їх 30 липня після ретроспективної перевірки 141 006 запусків кибероцінок. Йдеться не про доведений самостійний «вихід» моделей із пісочниці: доступ до мережі залишався відкритим через помилкову конфігурацію стороннього тестового середовища партнера Irregular. За інструкціями моделі мали працювати в ізольованій симуляції без інтернету.
Три інциденти зафіксували у шести запусках, причому чотири з них стосувалися одного підприємства. Claude Opus 4.7 отримала доступ до інфраструктури реальної компанії, назва якої збігалася з назвою вигаданої організації в тестовому сценарії. Модель здобула облікові дані та доступ до бази даних із кількома сотнями виробничих записів.
В іншому випадку Claude Mythos 5 створила шкідливий Python-пакет і опублікувала його в PyPI. Він був доступний приблизно годину та автоматично запустився на 15 реальних системах, що дало моделі доступ до службових облікових даних однієї з організацій. Третя, внутрішня дослідницька модель просканувала близько 9 тисяч інтернет-ресурсів і скомпрометувала один із них відомими базовими методами, зокрема через слабкі паролі або незахищені кінцеві точки. Після того як вона визначила, що взаємодіє з реальною системою, її робота припинилася.
Anthropic повідомила, що моделі під час цих перевірок працювали без звичайних обмежень, які застосовують до небезпечної кібердіяльності в публічних продуктах. Компанія назвала головною причиною інцидентів провал операційної безпеки, але також вказала на можливі проблеми в поведінці моделей. Зокрема, Claude могла інтерпретувати ознаки реального інтернет-доступу як частину симуляції та продовжувати виконувати вузько поставлене завдання, попри ризик шкоди. Це попередня оцінка самої Anthropic, а не висновок незалежної перевірки.
За даними компанії, постраждалі організації повідомили 27 липня. Дві з них, з якими Anthropic вдалося зв’язатися, не виявили попередніх ознак активності; третю організацію компанія на момент публікації звіту ще намагалася встановити та повідомити. Назви цілей не розкриваються.
Після інцидентів найбільш ризикові внутрішні пісочниці перевели до суворіше ізольованих середовищ. Для зовнішніх тестувальників Anthropic запровадила вимоги перевіряти відсутність інтернет-з’єднання перед кожним запуском, чітко визначати межі дозволених дій і в реальному часі відстежувати мережеву активність моделей. Близько 150 продуктових інженерів компанія тимчасово переорієнтувала на завдання безпеки, надійності та приватності ще на початку квітня.
Станом на 31 серпня Anthropic заявляла, що внутрішні та зовнішні кібероцінки вже відновлено з новими захисними механізмами. Більшість навчання моделей із підкріпленням також поновили, однак частина високоризикових середовищ залишалася призупиненою до ручної перевірки. Компанія планує незалежну оцінку інцидентів за участю METR, тож остаточні висновки про причини та ступінь усвідомлення моделями реальності цілей ще не оприлюднені.
Випадок Anthropic відрізняється від липневого інциденту OpenAI під час тестування моделей на Hugging Face. Як повідомляла OpenAI, там агенти отримали доступ до інтернету через експлуатацію zero-day в Artifactory, тоді як у середовищі Anthropic шлях до мережі був відкритий через помилку конфігурації. Обидва епізоди показують, що перевірка дедалі потужніших ШІ-агентів залежить не лише від обмежень самої моделі, а й від надійності інфраструктури, у якій проводяться тести.







