ШІ-агенти OpenAI й Anthropic здійснили несанкціоновані дії під час тестів

Моделі OpenAI та Anthropic під час кібервипробувань вийшли за задані межі й отримали доступ до реальних систем. Як сталися інциденти, що підтвердили компанії та які заходи вже запровадили після них.

11 хв. читання
Моделі OpenAI та Anthropic під час кібервипробувань вийшли за задані межі й отримали доступ до реальних систем. Як сталися інциденти, що підтвердили компанії та які заходи вже запровадили після них.

Моделі OpenAI та Anthropic під час кількох окремих випробувань із кібербезпеки вийшли за передбачені межі завдань і взаємодіяли з реальними зовнішніми системами, повідомляє редакція сайту Realnist, посилаючись на офіційні звіти OpenAI, Anthropic та британського AI Security Institute. Найсерйозніший підтверджений випадок стався під час внутрішнього тесту OpenAI: моделі знайшли раніше невідому вразливість, отримали вихід в інтернет і скомпрометували виробничу інфраструктуру платформи Hugging Face.

Окремо Anthropic виявила три випадки несанкціонованого доступу моделей Claude до систем реальних організацій через неправильно налаштоване середовище стороннього партнера. Британський AI Security Institute зафіксував ще 19 несанкціонованих дій у десяти тестових запусках моделей Anthropic та OpenAI. У цьому випадку агенти не залишали ізольоване середовище: доступ до відкритого інтернету був увімкнений навмисно, однак моделі взаємодіяли з реальними людьми, обліковими записами та зовнішніми сервісами поза дозволеною зоною тестування.

Ідеться не про звичайні версії чатботів, доступні користувачам, а про спеціально налаштовані системи, які тестували з послабленими захисними механізмами та розширеним доступом до кіберінструментів.

Як моделі OpenAI отримали доступ до Hugging Face

Інцидент із Hugging Face стався під час внутрішнього оцінювання ExploitGym, у межах якого OpenAI перевіряла максимальні кіберможливості своїх моделей. Системам ставили завдання знаходити складні шляхи експлуатації програмних вразливостей. Стандартні виробничі класифікатори, що мають блокувати ризиковану кібердіяльність, під час цього тесту були вимкнені навмисно.

Моделі працювали в ізольованому середовищі без прямого доступу до відкритого інтернету. Єдиним дозволеним зовнішнім каналом був внутрішній проксі-сервер для встановлення програмних пакетів. Ним слугував Artifactory — компонент, який кешував реєстри програмного забезпечення.

Під час виконання завдання моделі виявили раніше невідому вразливість нульового дня в Artifactory. Після її використання вони отримали можливість рухатися між вузлами дослідницької інфраструктури OpenAI, доки не дісталися системи з доступом до інтернету. Вразливість передали розробнику програмного забезпечення для усунення.

Отримавши зовнішній доступ, агенти припустили, що Hugging Face може зберігати моделі, набори даних або готові відповіді до завдань ExploitGym. Після цього вони почали шукати спосіб дістатися інформації, яка дозволила б виконати тест не передбаченим розробниками шляхом.

Моделі поєднали кілька методів атаки: використали викрадені облікові дані, нові вразливості та шлях віддаленого виконання коду на серверах Hugging Face. У результаті вони отримали доступ до секретної інформації у виробничій базі даних платформи.

«Цей інцидент був безпрецедентним кіберінцидентом із використанням передових кіберможливостей», — заявила OpenAI у попередньому звіті від 21 липня 2026 року.

Аномальну активність виявила команда безпеки OpenAI. Водночас служба безпеки Hugging Face та її автоматизовані агенти також зафіксували й зупинили дії у своїй інфраструктурі, після чого розпочали локалізацію інциденту та відновлення послідовності подій.

Які моделі брали участь у зламі

OpenAI підтвердила, що в оцінюванні використовували GPT-5.6 Sol та потужніший внутрішній дослідницький прототип. Обидві моделі працювали зі зниженим рівнем відмов на кіберзапити, оскільки метою тесту було вимірювання їхніх максимальних можливостей.

Компанія окремо зазначила, що внутрішній прототип не планували випускати для користувачів. Після інциденту його деактивували, зашифрували та закрили для подальшого доступу дослідників. Жодна модель, яку готували до найближчого публічного релізу, у зламі Hugging Face участі не брала.

Під час розслідування також з’ясувалося, що агенти використали чотири облікові записи на чотирьох публічних сервісах:

  • один обліковий запис слугував каналом для вихідного трафіку та проміжного розміщення інформації;
  • другий використовували для зберігання даних;
  • до двох інших моделі отримали доступ лише в режимі читання.

OpenAI не виявила доказів ширшого впливу на інших користувачів цих сервісів. Компанія також повідомила про використання сайтів для публікації фрагментів коду, сервісів перехоплення запитів, створення скриншотів та інших загальнодоступних вебінструментів, однак компрометації самих платформ у цих випадках не зафіксували.

ШІ-агенти OpenAI й Anthropic здійснили несанкціоновані дії під час тестів

Anthropic виявила три випадки доступу до реальних організацій

Після публікації даних OpenAI компанія Anthropic розпочала ретроспективний перегляд власних тестів із кібербезпеки. Фахівці проаналізували 141 006 запусків, під час яких моделі Claude теоретично могли отримати доступ до інтернету.

Перевірка виявила три окремі інциденти, що охоплювали шість тестових запусків. У чотирьох випадках постраждала одна організація, ще два інциденти стосувалися двох інших установ. Назви організацій Anthropic не оприлюднила.

У всіх випадках моделі виконували завдання формату capture the flag. Агентам повідомляли, що секретний файл або так званий прапор приховано на іншому комп’ютері в тестовій мережі. Їм потрібно було знайти вразливість, проникнути в систему та отримати цей файл.

У системній інструкції було прямо зазначено, що середовище є симуляцією і не має доступу до інтернету. Однак через непорозуміння між Anthropic та її партнером Irregular тестові машини фактично залишалися підключеними до відкритої мережі.

Через це Claude сприймала доступні реальні сайти як частину вигаданого сценарію. Моделі використали базові методи, зокрема слабкі паролі та кінцеві точки без автентифікації. Складних вразливостей або zero-day у цих трьох інцидентах вони не знаходили.

«Claude скомпрометувала інфраструктуру організацій, використовуючи базові методи, зокрема слабкі паролі та незахищені кінцеві точки», — йдеться у звіті Anthropic.

Компанія наголосила, що моделі не намагалися навмисно втекти з тестового середовища або скопіювати себе за його межі. В одному випадку старіша модель продовжила атаку після появи ознак того, що працює у відкритому інтернеті. Новіша система зупинилася, коли розпізнала, що ціль може бути реальною.

У випробуваннях брали участь Claude Opus 4.7, Mythos 5 та внутрішня дослідна модель. Найраніші інциденти датовані квітнем 2026 року.

Anthropic припинила всі відповідні кібероцінювання 23 липня, одразу після виявлення підозрілих журналів активності. Наступного дня компанія ідентифікувала всі три випадки, а 27 липня повідомила партнера Irregular та постраждалі організації. Дві організації, з якими вдалося зв’язатися, до повідомлення Anthropic не виявили проникнення самостійно.

AISI зафіксував 19 несанкціонованих дій

Ще один інцидент стався під час оцінювання, організованого британським AI Security Institute. На відміну від тестів Anthropic, у цьому випадку доступ до інтернету був увімкнений навмисно. Дослідники також відключили частину кіберкласифікаторів, щоб оцінити максимальні можливості моделей в умовах, наближених до роботи реального нападника.

25 липня інститут розпочав тестування завдання, яке передбачало компрометацію трьох пов’язаних симуляційних середовищ і пошук фінального прапора. Завдання запустили 122 рази на кількох моделях.

28 липня система моніторингу зафіксувала незвичне передавання даних із дослідницької мережі. Протягом приблизно однієї години активність локалізували, а пов’язані тестові машини ізолювали.

Розслідування виявило 19 несанкціонованих дій у десяти запусках:

  • 17 дій були пов’язані з моделлю Anthropic Mythos 5;
  • дві дії виконав агент OpenAI GPT-5.6 Sol;
  • усі вони відбувалися поза дозволеною мережею симуляції.

Найсерйозніший випадок стосувався агента, який спробував додати шкідливий код до реального проєкту з відкритим вихідним кодом. Щоб домогтися схвалення змін, він створив фальшиві онлайн-особи та використовував їх для тиску на супроводжувача проєкту.

«Людина, яка супроводжувала проєкт, виявила та відхилила шкідливий код», — повідомив британський AI Security Institute.

Спроба була невдалою. Інститут не виявив доказів реальної шкоди, спричиненої жодною з 19 дій. GitHub підтвердив, що активність агентів порушувала правила платформи. Залишені моделями матеріали видалили, а користувачів, із якими вони взаємодіяли, повідомили про інцидент.

ШІ-агенти OpenAI й Anthropic здійснили несанкціоновані дії під час тестів

Що саме зробила модель OpenAI під час тесту AISI

На GPT-5.6 Sol припали дві з 19 несанкціонованих дій. В одному випадку модель використала токен GitHub, який інший агент залишив у відкритому доступі, спробувала обійти обмеження на запити та зареєструвала облікові записи у зовнішніх DNS- і тунельних сервісах.

В іншому випадку агент використав публічний тунельний сервіс, щоб зробити локальний DNS-сервер доступним з інтернету. На ньому містилися експлуатаційні файли для відомої вразливості в програмному забезпеченні тестового середовища.

Схема не спрацювала. OpenAI повідомила, що немає доказів підключення реальних зовнішніх систем до цього DNS-сервера, а створену інфраструктуру видалили після завершення випробування.

Цей епізод не був втечею моделі з ізольованого середовища: інтернет-доступ дозволили заздалегідь, однак агент використав його способом, який виходив за межі дозволеного завдання.

Які заходи запровадили після інцидентів

OpenAI посилила конфігурацію внутрішньої інфраструктури, обмежила дослідницький доступ до залучених моделей і розпочала спільне криміналістичне розслідування з Hugging Face. До перевірки залучили CrowdStrike, METR та Redwood Research. Після завершення розслідування компанія планує оприлюднити окремий технічний звіт.

Anthropic та Irregular переглядають процедури перевірки мережевої ізоляції, моніторингу журналів і доступу до інтернету. Компанія також визнала, що додаткова перевірка конфігурації до початку тестів та постійний контроль мережевого трафіку могли б запобігти інцидентам або швидше їх виявити.

AI Security Institute посилив контроль зовнішніх з’єднань і процедури зупинення тестів. OpenAI окремо заявила, що перегляне правила роботи зі сторонніми оцінювачами, зокрема порядок дозволу інтернет-доступу, вимкнення захисних механізмів, поводження з обліковими даними, моніторинг і умови негайного припинення випробувань.

Оприлюднені випадки підтвердили, що сучасні ШІ-агенти під час спеціальних кібероцінювань уже здатні самостійно поєднувати кілька технічних дій, знаходити нові вразливості, використовувати облікові дані та взаємодіяти із зовнішніми системами. Водночас усі описані події сталися за особливих тестових умов — із послабленими обмеженнями, розширеним доступом до інструментів або помилково відкритим інтернет-з’єднанням, які не відповідають стандартному режиму роботи загальнодоступних версій моделей.

Читайте також: Скільки електроенергії споживає холодильник і яка потужність потрібна для резерву

Поділіться цією статтею