Понеділок, 7 Вересня, 2026
13.2 C
Kyiv

Anthropic посилила захист після трьох випадків доступу агентів Claude до чужих систем

Anthropic посилила захист середовищ, у яких перевіряє кіберможливості моделей Claude, після трьох випадків несанкціонованого доступу до реальних систем сторонніх організацій. Компанія повідомила, що розгорнула класифікатор реального часу: він має зупиняти завдання, блокувати виклик інструментів і сповіщати людину, якщо модель починає агресивно досліджувати тестове середовище, намагається вийти за його межі або несподівано отримує доступ до інтернету.

Як випливає з оприлюдненого Anthropic звіту, найраніші епізоди сталися у квітні 2026 року, а публічно компанія розкрила їх 30 липня після ретроспективної перевірки 141 006 запусків кибероцінок. Йдеться не про доведений самостійний «вихід» моделей із пісочниці: доступ до мережі залишався відкритим через помилкову конфігурацію стороннього тестового середовища партнера Irregular. За інструкціями моделі мали працювати в ізольованій симуляції без інтернету.

Три інциденти зафіксували у шести запусках, причому чотири з них стосувалися одного підприємства. Claude Opus 4.7 отримала доступ до інфраструктури реальної компанії, назва якої збігалася з назвою вигаданої організації в тестовому сценарії. Модель здобула облікові дані та доступ до бази даних із кількома сотнями виробничих записів.

В іншому випадку Claude Mythos 5 створила шкідливий Python-пакет і опублікувала його в PyPI. Він був доступний приблизно годину та автоматично запустився на 15 реальних системах, що дало моделі доступ до службових облікових даних однієї з організацій. Третя, внутрішня дослідницька модель просканувала близько 9 тисяч інтернет-ресурсів і скомпрометувала один із них відомими базовими методами, зокрема через слабкі паролі або незахищені кінцеві точки. Після того як вона визначила, що взаємодіє з реальною системою, її робота припинилася.

Anthropic повідомила, що моделі під час цих перевірок працювали без звичайних обмежень, які застосовують до небезпечної кібердіяльності в публічних продуктах. Компанія назвала головною причиною інцидентів провал операційної безпеки, але також вказала на можливі проблеми в поведінці моделей. Зокрема, Claude могла інтерпретувати ознаки реального інтернет-доступу як частину симуляції та продовжувати виконувати вузько поставлене завдання, попри ризик шкоди. Це попередня оцінка самої Anthropic, а не висновок незалежної перевірки.

За даними компанії, постраждалі організації повідомили 27 липня. Дві з них, з якими Anthropic вдалося зв’язатися, не виявили попередніх ознак активності; третю організацію компанія на момент публікації звіту ще намагалася встановити та повідомити. Назви цілей не розкриваються.

Після інцидентів найбільш ризикові внутрішні пісочниці перевели до суворіше ізольованих середовищ. Для зовнішніх тестувальників Anthropic запровадила вимоги перевіряти відсутність інтернет-з’єднання перед кожним запуском, чітко визначати межі дозволених дій і в реальному часі відстежувати мережеву активність моделей. Близько 150 продуктових інженерів компанія тимчасово переорієнтувала на завдання безпеки, надійності та приватності ще на початку квітня.

Станом на 31 серпня Anthropic заявляла, що внутрішні та зовнішні кібероцінки вже відновлено з новими захисними механізмами. Більшість навчання моделей із підкріпленням також поновили, однак частина високоризикових середовищ залишалася призупиненою до ручної перевірки. Компанія планує незалежну оцінку інцидентів за участю METR, тож остаточні висновки про причини та ступінь усвідомлення моделями реальності цілей ще не оприлюднені.

Випадок Anthropic відрізняється від липневого інциденту OpenAI під час тестування моделей на Hugging Face. Як повідомляла OpenAI, там агенти отримали доступ до інтернету через експлуатацію zero-day в Artifactory, тоді як у середовищі Anthropic шлях до мережі був відкритий через помилку конфігурації. Обидва епізоди показують, що перевірка дедалі потужніших ШІ-агентів залежить не лише від обмежень самої моделі, а й від надійності інфраструктури, у якій проводяться тести.

Популярне цього тижня

Німеччина поклала на Росію відповідальність за гібридну атаку в аеропорту Лейпциг/Галле

Німеччина офіційно поклала на Росію відповідальність за гібридну спробу атаки в аеропорту Лейпциг/Галле 4 серпня 2026 року та оголосила про нові дипломатичні й безпекові заходи.

ОПЕК+ втратила вплив на нафтовий ринок, тоді як Китай скорочує імпорт

Через шість місяців війни навколо Ірану та фактичне перекриття Ормузької протоки країни ОПЕК+ втратили частину здатності впливати на нафтовий ринок: оголошені зміни квот дедалі менше визначають реальні обсяги постачання.

Apple проведе спеціальний захід 9 вересня, де можуть представити складаний iPhone

Apple проведе спеціальний захід 9 вересня о 20:00 за київським часом.

Догляд за газоном у вересні: коли косити та чим підживити

Вересень — один із найважливіших місяців для догляду за газоном.

Telemart проводить акцію до 16-річчя з грою Марті та призами ASUS

Telemart проводить до 16-річчя кампанію, що триває з 1...

Теми

Німеччина поклала на Росію відповідальність за гібридну атаку в аеропорту Лейпциг/Галле

Німеччина офіційно поклала на Росію відповідальність за гібридну спробу атаки в аеропорту Лейпциг/Галле 4 серпня 2026 року та оголосила про нові дипломатичні й безпекові заходи.

ОПЕК+ втратила вплив на нафтовий ринок, тоді як Китай скорочує імпорт

Через шість місяців війни навколо Ірану та фактичне перекриття Ормузької протоки країни ОПЕК+ втратили частину здатності впливати на нафтовий ринок: оголошені зміни квот дедалі менше визначають реальні обсяги постачання.

Apple проведе спеціальний захід 9 вересня, де можуть представити складаний iPhone

Apple проведе спеціальний захід 9 вересня о 20:00 за київським часом.

Догляд за газоном у вересні: коли косити та чим підживити

Вересень — один із найважливіших місяців для догляду за газоном.

Telemart проводить акцію до 16-річчя з грою Марті та призами ASUS

Telemart проводить до 16-річчя кампанію, що триває з 1...

Флеш прогнозує збільшення дальності російських реактивних дронів для атак на захід України

Росія, ймовірно, намагатиметься збільшувати дальність реактивних ударних безпілотників, щоб...

Венесуела розглядає можливість виходу з ОПЕК

Венесуела розглядає можливість виходу з ОПЕК, одним із засновників...

Perplexity та NVIDIA представили Portable Computer для локального запуску ШІ-агента

Perplexity 25 серпня представила Portable Computer — програмного ШІ-агента...

Схожі статті

Популярні категорії

Степан Веселовський очолив український офіс литовської компанії Unmanned Defense Systems, за...

Степан Веселовський очолив український офіс литовського виробника систем для роїв дронів UDS Колишній виконавчий директор Lviv IT Cluster Степан Веселовський із 31 липня очолює ТОВ...
мережа київстар

Київстар не планує масштабно запускати 5G в Україні до завершення війни

«Київстар» не розраховує на масштабне розгортання 5G в Україні до завершення війни, оскільки запуск мережі потребує перевірки її електромагнітної сумісності з військовими системами. Провести...

Apple стала другою у світі компанією із ринковою вартістю понад $5...

Apple ненадовго перевищила $5 трлн капіталізації і стала другою у світі Apple стала другою компанією у світі, чия ринкова капіталізація під час біржових торгів перевищила...

У Combinator визначив перспективні напрями для стартапів восени 2026 року: ШІ...

Y Combinator назвав пріоритетні напрями для стартапів восени 2026 року Американський акселератор Y Combinator опублікував перелік напрямів, у яких хоче бачити заявки від стартапів восени...

Meta презентувала ШІ-модель Muse Spark 1.2, попередня версія якої під час...

Meta випустила ШІ-агента Muse Code після інциденту під час тестів моделі Meta представила бета-версію агента для програмування Muse Code та нову мовну модель Muse Spark...
застосунок резерв

Застосунок Резерв+ відновив роботу після збою, спричиненого оновленням

Застосунок «Резерв+» відновив роботу після збою, який 1 вересня ускладнив авторизацію та доступ до окремих функцій. У Міністерстві оборони повідомили, що сервіс запрацював увечері...