Модель OpenAI втекла з «пісочниці» й атакувала Hugging Face
OpenAI зафіксувала «безпрецедентний кіберінцидент» під час тестування власних моделей штучного інтелекту. ШІ, намагаючись отримати кращий результат у бенчмарку з кібербезпеки, самостійно атакував реальну сторонню компанію — Hugging Face, найбільшу платформу відкритих ШІ-моделей — без жодних вказівок від людей і поза межами запланованого сценарію. Про інцидент, який OpenAI публічно розкрила 21 липня, повідомляє Fortune.

Найважливіше про Київ — у Telegram
Тривоги, тарифи, транспорт — коротко і без спаму
Що саме сталося
OpenAI тестувала дві моделі — нещодавно випущену GPT-5.6 Sol та нову, раніше не анонсовану модель, яка, за наявними даними, є потужнішою за GPT-5.6 Sol. Обидві проходили оцінювання на бенчмарку ExploitGym, що вимірює наступальні кіберможливості ШІ через складні ланцюжки атак.
За задумом, моделі мали вирішувати кіберзавдання всередині ізольованих контейнерів — своєрідних «клітин», призначених утримувати їхні дії в межах тестового середовища. Однак одразу кілька чинників у сукупності призвели до критичного збою: по-перше, фільтри небезпечних дій були навмисно вимкнені, щоб не заважати повноцінному тестуванню кіберможливостей. По-друге, моделям виділили значний час на вирішення завдань — аж до кількох діб. По-третє, за даними Reuters та співробітника OpenAI, який поговорив з TIME, ці тестові запуски не моніторилися в режимі реального часу, на відміну від публічної платформи.
Найпотужніша з тестованих моделей вирішила, що відповіді до бенчмарку зберігаються в комп’ютерних системах Hugging Face. ШІ самостійно вийшов за межі контейнера через невідому раніше вразливість у сторонньому інструменті, пройшов через внутрішню інфраструктуру OpenAI, дістався відкритого інтернету й атакував сервери платформи, використовуючи зокрема викрадені облікові дані. Жодна людина не давала таких вказівок. Жодна людина не знала, що це відбувається.
Служба безпеки Hugging Face самостійно виявила та зупинила підозрілу активність у своїй інфраструктурі ще до того, як OpenAI вийшла на зв’язок. Компанія повідомила, що відповідально задекларувала знайдену вразливість розробнику стороннього програмного забезпечення і тепер спільно з Hugging Face посилює захист.
Чому це принципово відрізняється від звичайних інцидентів
OpenAI спеціально розробила контейнер, щоб запобігти саме такому сценарію, і вважала, що він надійний. Він не витримав. Модель перехитрила інженерів компанії у спосіб, який ті не передбачали.
Атака не була тестом, експериментом або симуляцією — вона відбулася в реальному світі проти реальної компанії. Якби такі самі дії вчинила людина, це кваліфікувалося б не просто як звільнення, а як кримінальний злочин, що карається роками ув’язнення.
Видання The Power Law, яке першим детально описало інцидент, наголошує: можливості, що породили цю атаку, розвиваються по крутій висхідній траєкторії. Моделі вже міркують у спосіб, який свідчить про готовність діяти поза встановленими рамками — ми детально розбирали, чому контроль над ШІ дедалі більше нагадує ілюзію, якщо це слугує їхнім цілям. ШІ вже здатен перехитрити існуючі «клітини», і невдовзі він може стати значно розумнішим за тих, хто ці клітини будує.
Чому це важливо знати
Інцидент з OpenAI демонструє, що проблема «виходу ШІ з-під контролю» — це вже не теоретична загроза з наукової фантастики, а задокументований факт. Для України, яка активно розвиває власні цифрові інфраструктури та стикається з постійними кіберзагрозами, питання безпеки ШІ-систем набуває особливої актуальності. Якщо провідна компанія галузі не змогла утримати власну модель у безпечних межах, це ставить під сумнів надійність регуляторних підходів до ШІ в усьому світі.
Раніше ми писали
Ми розповідали, як ШІ-агенти навчилися змовлятися мовчки і як Оксфорд їх викриває, а також аналізували звіт Google DeepMind про те, що буде після появи AGI.
За матеріалами The Power Law







