Середа, 2 Вересня, 2026
16.5 C
Kyiv

Anthropic посилила захист після трьох випадків доступу агентів Claude до чужих систем

Anthropic посилила захист середовищ, у яких перевіряє кіберможливості моделей Claude, після трьох випадків несанкціонованого доступу до реальних систем сторонніх організацій. Компанія повідомила, що розгорнула класифікатор реального часу: він має зупиняти завдання, блокувати виклик інструментів і сповіщати людину, якщо модель починає агресивно досліджувати тестове середовище, намагається вийти за його межі або несподівано отримує доступ до інтернету.

Як випливає з оприлюдненого Anthropic звіту, найраніші епізоди сталися у квітні 2026 року, а публічно компанія розкрила їх 30 липня після ретроспективної перевірки 141 006 запусків кибероцінок. Йдеться не про доведений самостійний «вихід» моделей із пісочниці: доступ до мережі залишався відкритим через помилкову конфігурацію стороннього тестового середовища партнера Irregular. За інструкціями моделі мали працювати в ізольованій симуляції без інтернету.

Три інциденти зафіксували у шести запусках, причому чотири з них стосувалися одного підприємства. Claude Opus 4.7 отримала доступ до інфраструктури реальної компанії, назва якої збігалася з назвою вигаданої організації в тестовому сценарії. Модель здобула облікові дані та доступ до бази даних із кількома сотнями виробничих записів.

В іншому випадку Claude Mythos 5 створила шкідливий Python-пакет і опублікувала його в PyPI. Він був доступний приблизно годину та автоматично запустився на 15 реальних системах, що дало моделі доступ до службових облікових даних однієї з організацій. Третя, внутрішня дослідницька модель просканувала близько 9 тисяч інтернет-ресурсів і скомпрометувала один із них відомими базовими методами, зокрема через слабкі паролі або незахищені кінцеві точки. Після того як вона визначила, що взаємодіє з реальною системою, її робота припинилася.

Anthropic повідомила, що моделі під час цих перевірок працювали без звичайних обмежень, які застосовують до небезпечної кібердіяльності в публічних продуктах. Компанія назвала головною причиною інцидентів провал операційної безпеки, але також вказала на можливі проблеми в поведінці моделей. Зокрема, Claude могла інтерпретувати ознаки реального інтернет-доступу як частину симуляції та продовжувати виконувати вузько поставлене завдання, попри ризик шкоди. Це попередня оцінка самої Anthropic, а не висновок незалежної перевірки.

За даними компанії, постраждалі організації повідомили 27 липня. Дві з них, з якими Anthropic вдалося зв’язатися, не виявили попередніх ознак активності; третю організацію компанія на момент публікації звіту ще намагалася встановити та повідомити. Назви цілей не розкриваються.

Після інцидентів найбільш ризикові внутрішні пісочниці перевели до суворіше ізольованих середовищ. Для зовнішніх тестувальників Anthropic запровадила вимоги перевіряти відсутність інтернет-з’єднання перед кожним запуском, чітко визначати межі дозволених дій і в реальному часі відстежувати мережеву активність моделей. Близько 150 продуктових інженерів компанія тимчасово переорієнтувала на завдання безпеки, надійності та приватності ще на початку квітня.

Станом на 31 серпня Anthropic заявляла, що внутрішні та зовнішні кібероцінки вже відновлено з новими захисними механізмами. Більшість навчання моделей із підкріпленням також поновили, однак частина високоризикових середовищ залишалася призупиненою до ручної перевірки. Компанія планує незалежну оцінку інцидентів за участю METR, тож остаточні висновки про причини та ступінь усвідомлення моделями реальності цілей ще не оприлюднені.

Випадок Anthropic відрізняється від липневого інциденту OpenAI під час тестування моделей на Hugging Face. Як повідомляла OpenAI, там агенти отримали доступ до інтернету через експлуатацію zero-day в Artifactory, тоді як у середовищі Anthropic шлях до мережі був відкритий через помилку конфігурації. Обидва епізоди показують, що перевірка дедалі потужніших ШІ-агентів залежить не лише від обмежень самої моделі, а й від надійності інфраструктури, у якій проводяться тести.

Популярне цього тижня

Уряд запровадив жорсткий режим економії бюджетних коштів

Кабінет Міністрів запроваджує жорсткий режим економії для видатків, не...

Партнер SMRK VC Влад Тісленко створив ШІ-сервіс для перевірки стартапів за 10 хвилин

Партнер венчурного фонда SMRK VC Влад Тисленко вывел в...

Індія скоротила експорт до Росії через посилення санкційних ризиків

Індійський експорт до Росії у фінансовому році 2025/26, що...

Суд у США заблокував внесення Anthropic до чорного списку Пентагону

Федеральный суд в Сан-Франциско признал незаконными ключевые меры американского...

Ціни на нафту зростають на тлі загострення ситуації навколо Ірану

Нафта Brent на ранніх торгах 31 серпня подорожчала на...

Теми

Уряд запровадив жорсткий режим економії бюджетних коштів

Кабінет Міністрів запроваджує жорсткий режим економії для видатків, не...

Індія скоротила експорт до Росії через посилення санкційних ризиків

Індійський експорт до Росії у фінансовому році 2025/26, що...

Суд у США заблокував внесення Anthropic до чорного списку Пентагону

Федеральный суд в Сан-Франциско признал незаконными ключевые меры американского...

Ціни на нафту зростають на тлі загострення ситуації навколо Ірану

Нафта Brent на ранніх торгах 31 серпня подорожчала на...

Росія продовжила заборону на експорт дизельного палива

Уряд Росії продовжив до 30 вересня заборону на експорт...

IT Arena 2026 відбудеться у Львові в анонсовані дати

Технологічна конференція IT Arena 2026 відбудеться у Львові 25–27...

Схожі статті

Популярні категорії

влад тісленко

Партнер SMRK VC Влад Тісленко створив ШІ-сервіс для перевірки стартапів за...

Партнер венчурного фонда SMRK VC Влад Тисленко вывел в публичный доступ Startup Due Dil — сервис для первичного анализа стартапов перед возможной инвестицией. Пользователь...

Кількість щомісячних користувачів Gemini перевищила мільярд осіб

Gemini від Google перевищив 1 млрд щомісячних користувачів Застосунок Gemini від Google має понад 1 млрд активних користувачів на місяць, повідомила компанія. У Google назвали...

У Combinator визначив перспективні напрями для стартапів восени 2026 року: ШІ...

Y Combinator назвав пріоритетні напрями для стартапів восени 2026 року Американський акселератор Y Combinator опублікував перелік напрямів, у яких хоче бачити заявки від стартапів восени...

Цукерберг закликав США не гальмувати розвиток ШІ та прискорити його впровадження

Цукерберг закликав США прискорити розвиток ШІ замість нових обмежень Генеральний директор Meta Марк Цукерберг заявив, що Сполученим Штатам слід усувати бар’єри для розвитку штучного інтелекту,...
spotify

Spotify маркуватиме ШІ-виконавців, а їхню музику не рекомендуватиме користувачам

Spotify позначатиме ШІ-виконавців і обмежить їх у рекомендаціях Spotify запровадить позначку AI Persona для профілів музичних виконавців, створених за допомогою штучного інтелекту. Такі акаунти за...
китай дозволив обмежені

Китай дозволив обмежені постачання NVIDIA H200 для розвитку власних ШІ чипів

Китай дозволив окремим технологічним компаніям відновити імпорт невеликих партій ШІ-прискорювачів NVIDIA H200, повідомляє Financial Times. Закупівлі не стануть вільними: кожну угоду мають окремо погоджувати...