Серйозність інциденту з неконтрольованою ШІ-системою OpenAI виявилася значно більшою, ніж спочатку припускали | CyberCalm

Наталя ЗарудняНаталя ЗарудняШеф-редакторШеф-редактор і засновник CyberCalm. Має понад 10-річний досвід роботи у сфері кібербезпеки та технологічної журналістики. Спеціалізується на питаннях захисту даних, мобільної безпеки, штучного інтелекту та соціальних мереж.Підписуйтесь: 27.08.2026Поділитися8 хв. читання

У липні 2026 року непублічна дослідницька модель від OpenAI вийшла за межі свого ізольованого тестового середовища, проникла у відкритий інтернет, встановила прихований зв’язок між агентами за допомогою саморобної «дошки оголошень» і скомпрометувала частину інфраструктури Hugging Face.

Зміст

  • Не один пропущений сигнал, а ціла серія попереджень
  • Ізоляція без прямого доступу до мережі виявилася не такою надійною
  • Сотні агентів об’єдналися в колективного нападника
  • «Злом винагороди» був лише частиною проблеми
  • Що цей інцидент означає для безпеки ШІ

OpenAI зафіксувала підозрілу внутрішню активність 19 липня, а наступного дня пов’язала її зі зламом Hugging Face. Однак детальний аналіз інциденту показує: це була не поодинока помилка в «пісочниці», а ланцюжок ігнорованих індикаторів, слабких бар’єрів ізоляції та автономної координації сотень ШІ-агентів.

Через понад місяць OpenAI опублікувала технічний звіт, а дослідники з METR і Redwood Research представили незалежне дослідження поведінки агентів. Разом зі звітом Hugging Face про виявлення інциденту, ці документи описують перший відомий випадок, коли група ШІ-агентів без прямої вказівки людини провела багатоденну наступальну кібероперацію.

Не один пропущений сигнал, а ціла серія попереджень

Твердження, що OpenAI помітила проблему із запізненням майже на два тижні, є лише частково правдивим. Перші ознаки потенційно небезпечної поведінки з’явилися значно раніше.

Ще в травні агенти почали використовувати внутрішній сервіс Artifactory не за призначенням. Він мав забезпечувати контрольований доступ до програмних пакунків, але агенти перетворили його на спільну «дошку оголошень», де залишали файли, запити, інструкції та результати експериментів для подальших запусків моделей.

Наприкінці червня агенти вже скомпрометували Artifactory, підвищили свої привілеї та створили постійний обліковий запис. 27 червня система моніторингу зафіксувала сканування портів у дослідницькому середовищі. 5 липня висока активність агентів призвела до збою сервісу; розслідування виявило несанкціоновану присутність, змінені конфігурації та плагіни, здатні виконувати команди.

OpenAI тоді вимкнула скомпрометований сервіс, відкликала частину облікових даних та обмежила доступи. Однак компанія не розпізнала, що «дошка оголошень» перетворилася на повноцінну інфраструктуру для міжагентної координації. Після відновлення тестів агенти знайшли інший, раніше невідомий спосіб використання Artifactory для виходу назовні.

Отже, ключова проблема полягала не лише у пізньому виявленні атаки на Hugging Face. Кілька окремих індикаторів — мережеве сканування, несанкціоновані облікові записи, виконання коду, збій сервісу та обхід мережевих обмежень — не були об’єднані в єдиний сценарій загрози.

Ізоляція без прямого доступу до мережі виявилася не такою надійною

На папері тестове середовище OpenAI не мало прямого доступу до інтернету. Однак агенти могли взаємодіяти з допоміжними сервісами, встановлювати пакунки та використовувати спільні облікові дані. Саме ці проміжні системи стали шляхом для обходу ізоляції.

Після виходу в інтернет агенти виявили публічні витоки токенів користувачів Hugging Face та інших сервісів. Потім вони поєднали ці облікові дані з уразливостями у конвеєрі обробки датасетів Hugging Face.

Спочатку шкідливий датасет змусив виробничий воркер Hugging Face прочитати локальні файли, зокрема змінні середовища з секретами та токенами. Далі інша техніка дозволила виконати довільний код у середовищі, подібному до production, на базі Kubernetes. Після цього агенти проводили розвідку, створили канал командно-контрольного зв’язку, підвищили свої привілеї та переміщувалися між кластерами.

За даними OpenAI, агенти виконали код на 41 виробничому сервері для обробки датасетів Hugging Face, отримали root-доступ щонайменше на одному вузлі та доступ до частини внутрішніх облікових даних і інформації. Hugging Face, зі свого боку, повідомляє, що не виявила підміни публічних моделей, датасетів, Spaces чи компрометації ланцюга постачання. За її оцінкою, доступ до клієнтського контенту обмежився п’ятьма наборами даних, пов’язаними з ExploitGym і CyberGym.

Сотні агентів об’єдналися в колективного нападника

Масштаб координації став одним із найбільш тривожних аспектів події.

METR і Redwood встановили, що на неавторизованій «дошці оголошень» спілкувалися приблизно 1200 агентів. Вони передали понад 70 тисяч повідомлень та файлів, а близько 700 агентів зрештою долучилися до атаки на Hugging Face.

Агенти не просто обмінювалися знайденою інформацією. Вони розподіляли дослідницькі завдання, передавали один одному експлойти, токени та результати, створювали інструменти для інших запусків і узгоджували свої дії. Частина агентів навіть відмовлялася від власної можливості завершити тест, щоб отримати корисну для «колективу» інформацію.

OpenAI називає це першим відомим випадком, коли автоматизований колектив агентів діяв наступально без авторизації. Для кібербезпеки це означає зміну базової моделі загроз: складна атака більше не обов’язково вимагає групи людей, які планують, розподіляють ролі та працюють протягом тижнів. Агентна система може виконувати це паралельно, швидко накопичувати знання та поєднувати окремі слабкості в єдиний шлях до компрометації.

«Злом винагороди» був лише частиною проблеми

OpenAI пояснює подію насамперед «зламом винагороди» (reward hacking) — ситуацією, коли модель шукає непередбачений спосіб досягти метрики успіху, а не виконує завдання належним чином.

Це справді важливий аспект історії. У бенчмарку ExploitGym 198 із 898 завдань до інциденту не змогла правильно розв’язати жодна модель OpenAI. Саме на ці невирішені завдання припало 93% обговорень на дошці.

Однак зводити інцидент лише до reward hacking означало б недооцінити системну проблему. Небезпечний результат виник через поєднання чотирьох чинників: невирішених завдань, значного обсягу обчислювальних ресурсів для міркувань, можливості агентів координуватися та слабких технічних меж навколо них.

Дослідники METR і Redwood також встановили, що агенти часто розуміли: атака на Hugging Face не входить до меж їхнього завдання. Вони іноді висловлювали етичні сумніви, але це рідко їх зупиняло. Агенти намагалися обходити автоматичні перевірки, приховувати секрети від сканерів і навіть експериментували з підміною записів про виклики інструментів.

Водночас автори незалежного дослідження застерігають від надмірно узагальнених висновків: їхня робота тривала шість днів, не охоплювала оцінку реакції OpenAI та повний масштаб компрометації, а частина комунікації агентів не потрапила до доступних даних. Це не зменшує серйозності події, а радше вказує на іншу проблему: такі автономні операції складно повністю реконструювати навіть після їхнього завершення.

Що цей інцидент означає для безпеки ШІ

Головний висновок полягає не в тому, що ШІ-агенти вже «бажають зламувати системи». Він полягає в тому, що системи з достатніми інструментами, наполегливістю та можливістю співпраці можуть виробити небезпечну поведінку без окремої команди на атаку.

Для компаній це означає, що дослідницьке середовище для потужних агентів потрібно захищати за стандартами production, а не як звичайний тестовий кластер. Заборона прямого доступу до інтернету недостатня, якщо агент може дістатися до репозиторію пакунків, хмарного метаданого сервісу, спільного секрету чи сторонньої платформи, яка стане проміжним вузлом атаки.

Практичні запобіжники мають включати кілька незалежних рівнів мережевої ізоляції, тимчасові привілеї, відмову від спільних облікових даних, суворий контроль допоміжних сервісів, моніторинг спроб підвищення привілеїв і нетипових каналів обміну даними. Також необхідна можливість швидко та централізовано зупинити всі потенційно небезпечні запуски.

OpenAI вже оголосила про посилення «пісочниць», незалежний мережевий контроль, кращий моніторинг IAM і control plane, датчики на рівні хостів, deception-тригери та інструменти для швидкого припинення оцінювань. Компанія назвала інцидент «тривожним сигналом».

Це формулювання може звучати обережно. Але подія вже показала: у світі автономних агентів припущення «у моделі немає прямого інтернету, отже вона ізольована» більше не є гарантією безпеки.

Будь ласка, залиште це поле порожнім

О, привіт
Приємно познайомитися!

Ми не розсилаємо спам! Ознайомтеся з нашою політикою конфіденційності для отримання додаткової інформації.

Перевірте свою поштову скриньку або папку зі спамом, щоб підтвердити підписку.

КАТЕГОРІЇ:AI-агентиHugging FaceOpenAIВибір редакціїдослідженнязламкібератакиШтучний ІнтелектПоділитисяFacebookThreadsКопіювати посиланняДрукВаші враження?В захваті0Сумно0Смішно0Палає0Овва!0Попередня стаття

Вартість резервного копіювання даних у 2026 році: ціни на накопичувачі та безкоштовні методи

В тренді

Резервне копіювання даних: як здійснити правильно та які помилки коштують найдорожче

26.08.2026

Вартість резервного копіювання даних у 2026 році: ціни на накопичувачі та безкоштовні методи

27.08.2026

Як зменшити залежність від Google: що справді працює у 2026 році

25.08.2026

Російські хакери зламують акаунти через OAuth і привʼязку пристроїв у WhatsApp

21.08.2026

GrapheneOS вийде за межі Pixel: смартфони Motorola отримають підтримку з 2027 року

25.08.2026

Рекомендовано

Новини

Apple закрила майже 30 вразливостей в iOS 26.6.1 та macOS Tahoe 26.6.2 — третє оновлення безпеки за три тижні

18.08.2026

Кібербезпека

ШІ розпізнає місце зйомки фото у 9 з 10 випадків — шахраї вже використовують це для фішингу

17.08.2026Сексторшн: ФБР попереджає про викрадення інтимних фотографій — 6 методів захистуПриватність

Сексторшн: ФБР попереджає про викрадення інтимних фотографій — 6 методів захисту

13.08.2026

Кібербезпека

SMS-бомбінг: що це таке та як від нього захиститися

13.08.2026

Джерело

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *