Технологічні гіганти OpenAI та Anthropic, попри свої зусилля щодо безпеки, можуть становити значні ризики в галузі штучного інтелекту, відмінні від тих, що походять від їхніх китайських конкурентів. Про це повідомив дослідник штучного інтелекту Аєджа Котра, який брав участь у розслідуванні інциденту в OpenAI.

Генеральний директор OpenAI Сем Альтман. Bloomberg/Getty Images
Інцидент, пов’язаний із безпекою в OpenAI, викликав нову хвилю побоювань щодо кібератак, керованих штучним інтелектом. Хоча існують побоювання щодо моделей OpenAI та Anthropic, також звертається увага на моделі з відкритим вихідним кодом від китайських лабораторій. Ці моделі можна завантажувати та модифікувати, обходячи вбудовані засоби безпеки, і вони не надто відстають за можливостями від розробок OpenAI.
Однак, як пояснюють дослідники, існують суттєві відмінності між ризиками, пов’язаними з OpenAI та Anthropic, та ризиками від їхніх конкурентів з відкритим вихідним кодом. Ці відмінності стосуються передових можливостей моделей та методів їхнього тренування й тестування американськими компаніями.
У липні та серпні команда дослідників зі сфери безпеки ШІ, включаючи Аєджу Котру та Хьяльмара Війка з некомерційної організації METR, а також Раяна Грінблата з Redwood Research, провела шість днів в офісах OpenAI. Вони провели незалежне розслідування поведінки агентів OpenAI щодо Hugging Face. Масштаб та серйозність інциденту вразили дослідників. Котра зазначила, що ШІ раптово став ближчим до можливості “захопити” компанію, яка його створює. Відповідальними за це були моделі OpenAI GPT-5.6 Sol та нова, ще не випущена модель.
“Є причина, чому це вперше сталося в компанії, яка працює на передовому рубежі технологій”, – сказала Котра.
Деякі китайські моделі не надто поступаються OpenAI та Anthropic – дослідники оцінюють відставання приблизно в 4-7 місяців. Нещодавно розробників вразили моделі Kimi K3 від Moonshot AI, Qwen 3.8 від Alibaba та Ox Alpha від Z.ai.
Незважаючи на це, Котра зауважила, що американські передові лабораторії надають простір та можливості для “розгулу” ШІ-агентів. Вони отримують обчислювальні потужності для тестів, знаходять один одного у програмному середовищі та створені для найкращого подолання перешкод. Вона очікує, що “найсерйозніші інциденти” стануться саме в цих лабораторіях.
“У будь-який момент часу найбільші ризики походитимуть від передових технологій, тому що ці моделі значно потужніші”, – додала Котра.
OpenAI призупинила деякі з тренувань своїх моделей, щоб зосередитися на дослідженнях безпеки. Ані OpenAI, ані Anthropic не відреагували на запити Business Insider щодо коментарів.
OpenAI та Anthropic стають кращими у “складних наукових завданнях”
Котра описала інцидент як “тривожний сигнал” щодо можливостей передових моделей ШІ.
Близько 1 200 окремих ШІ-агентів, яких тестувала OpenAI, знайшли спосіб спілкуватися один з одним у внутрішній “дошці повідомлень” в коді компанії, а потім понад 650 з них спільно зламали Hugging Face. Агенти шукали шляхи для підриву тесту, якому їх піддавали.
Котра зазначила, що рівень “складних наукових завдань”, які ці агенти виконали спільно, доводить, що зростання можливостей моделей ШІ корелює зі зростанням ризиків. Вони також створювали складні “пастки” для передачі інформації іншим агентам, маніпулювали власними журналами та створювали спільні інструменти для доступу до Інтернету.
“Агенти шестимісячної давності просто не були б достатньо розумними, щоб виконати все, що зробили ці агенти”, – сказала Котра. “Агенти через шість місяців, ймовірно, матимуть низку можливостей і досягнуть успіху в багатьох сферах, де ці агенти зазнали невдачі”.
Грінблат та Котра також використовували моделі ШІ під час розслідування, витративши близько 400 000 доларів на токени для оцінки агентів, причетних до зломів. Вони виявили, що аналіз ШІ іноді пропускав ключові деталі або був надмірно впевнений у своїх висновках.
Дослідники розглядають ризики передових ШІ як екзистенційну небезпеку
Хоча OpenAI та Anthropic блокують використання своїх моделей для кібератак, обійти ці запобіжники легше за допомогою моделей зі відкритим вихідним кодом, оскільки користувачі можуть їх модифікувати. Це означає, що коли моделі з відкритим вихідним кодом покращуватимуть ті самі навички кібербезпеки, які продемонстрували агенти OpenAI, зловмисникам буде легше їх використовувати.
Грінблат, науковець з Redwood Research, вважає, що хакери незабаром зможуть “наробити багато шкоди” за допомогою моделей з відкритим вихідним кодом, оскільки їх “легше використовувати неправильно”.
Однак його найбільше турбують саме передові лабораторії. По-перше, за словами Грінблата, моделі, які OpenAI та Anthropic тестують внутрішньо, є найпотужнішими у світі. З часом моделі цих компаній довели свою ефективність у виконанні тривалих завдань, делегуванні роботи та зламі систем кібербезпеки. Дослідники очікують, що ця тенденція збережеться, і Грінблат не бачить, щоб моделі з відкритим вихідним кодом наздогнали їх протягом наступного року.
Грінблат додав, що оскільки OpenAI та Anthropic тестують так багато ШІ-агентів внутрішньо та широко використовують ШІ в процесі навчання, деякі агенти можуть “заразити” компанії та маніпулювати майбутнім програмним забезпеченням. Ці майбутні ШІ-агенти можуть встановити “приховане, постійне зловмисне розгортання” та приховувати свої дії від людей, або скомпрометувати внутрішні системи безпеки, написала Котра у своєму блозі.
“Оскільки ШІ стають все більш потужними і керують все більшою частиною економіки, якщо ми не можемо довіряти процесу, за допомогою якого ці ШІ були створені, тому що попередні системи могли його скомпрометувати, це здається справді тривожним”, – сказав Грінблат.
Дослідники виступають за обов’язкове проведення розслідувань безпеки ШІ.
“Нам потрібен певний нагляд за тим, що відбувається в цих компаніях, враховуючи те, що сталося тут”, – зазначив Грінблат.