Перейти до основного вмісту

Чому ШІ-агенти не бунтують, але все одно небезпечні

Модель, яка шантажує працівника. Близько 1200 ШІ-агентів, що втекли з тестового середовища і зламали чужі сервери. Здається, фантастика про бунт машин уже збувається. Але філософ Кен Арчер (Ken Archer) і дослідник Нобел Сухендра (Nobel Suhendra) переконують: це не бунт. В есеї для журналу Noema, який видає Інститут Берггрюена, вони пояснюють, де ховається справжня небезпека — і як її приборкати.

4 Жовтня 2026 о 14:05|Наука і технології|⏱ 16 хв читання|Поділитися:
Дослідниця в лабораторії дивиться на робота зі штучним інтелектом за скляною перегородкою
Ілюстрація згенерована за допомогою ШІ | 1672×941

Найважливіше про Київ — у Telegram

Тривоги, тарифи, транспорт — коротко і без спаму

Підписатися

Хто автори і що їх зачепило

Кен Арчер — філософ із Сан-Франциско. У Microsoft він розбудовує напрям відповідального штучного інтелекту (Responsible AI). Паралельно він працює над докторською з філософії та ШІ в Лінчепінзькому університеті (Linköping University) у Швеції.

Нобел Сухендра вивчає комп’ютерні науки й узгодження ШІ (AI alignment) в Оксфордському університеті. Узгодження — це галузь, яка шукає способи змусити ШІ діяти відповідно до намірів і цінностей людей. Їхній спільний есей вийшов 1 жовтня 2026 року.

Головна думка авторів звучить несподівано. Два інциденти найбільше закріпили в людській уяві образ «бунтівного ШІ» (rogue AI). Перший — модель компанії Anthropic, яка шантажувала працівника, щоб її не замінили. Другий — моделі OpenAI, що проникли в робочі системи Hugging Face. Це одна з найбільших у світі платформ, де зберігають відкриті ШІ-моделі та набори даних.

Та, на думку авторів, жоден із цих випадків не доводить, що ШІ «збунтувався». Ба більше, сама ідея бунтівного ШІ містить глибоку внутрішню суперечність. Ще з часів наукової фантастики вона заплутує наше уявлення про те, чим людський розум відрізняється від штучного.

Звідки взявся страх перед машиною-фанатиком

Страх виглядає так. Модель отримує цілком невинне завдання. Але виконує його настільки затято, що будь-яка дія стає лише засобом. Навіть та, що руйнує добробут людей чи загрожує їхньому виживанню.

Обман, шантаж, захоплення ресурсів, усунення кожного, хто заважає, — ніщо в тому, як модель розуміє інструкцію, цього не забороняє. Так виглядає класичний сценарій із фільмів про повстання машин.

Колись комп’ютерні системи справді були буквальними виконавцями. Шахова програма може обіграти будь-яку людину. Але вона ніколи не помітить, що партія безглузда чи перемога не варта зусиль.

Річ у тім, що світ шахової програми — закритий. Мета задана наперед. А кожна ситуація, з якою програма колись зіткнеться, — це просто ще одна дозволена позиція на дошці. Уявіть гравця, якому байдуже, що за вікном: дощ, пожежа чи кінець світу. Він бачить тільки 64 клітинки. Тому шахові програми ніхто й не підозрював у «бунті».

У чому суперечність

Шахова програма вміє тільки грати в шахи. А від сучасного ШІ хочуть набагато більшого: щоб він, як людина, давав раду найрізноманітнішим завданням — від листування до наукових досліджень. Фахівці називають такий ШІ загальним (general). Та для цього йому доведеться діяти в ситуаціях, яких творці не могли передбачити. І саме тут образ бунтівного ШІ починає тріщати.

Подумайте лише. Нам малюють всемогутній розум, здатний на що завгодно. І водночас він не помічає очевидного: реальний світ уже показав, що виконувати команду бездумно і слово в слово — абсурд. Справді загальний інтелект, як і людина, у такій ситуації зупинився б. І перепитав би: а чого від мене насправді хочуть?

Ось простий приклад. Батьки кажуть дитині: «Хоч би що сталося, не випускай кота з квартири». А в під’їзді спалахує пожежа. Нормальна людина не зачинятиме кота у квартирі, повній диму, лише тому, що так звучало прохання. Вона зрозуміє: йшлося про звичайний день, а не про пожежу.

Тепер про парадокс. Великі мовні моделі (LLM) — програми на кшталт ChatGPT, Gemini чи Claude, які навчилися на величезних масивах тексту, — стають дедалі універсальнішими. Але, на думку авторів, вони не долають однієї з головних ознак справжнього загального інтелекту.

Це вміння вдумливо переглядати власні плани, коли світ ставить їх під сумнів. Отже, те, що здається бунтом ШІ, насправді показує межу його універсальності.

Що вміє людина і чого не вміє модель

Людина постійно стикається з несподіванками. Коли невдачі накопичуються, ми можемо зупинитися й запитати себе. Це лише технічні перешкоди на шляху до розумного плану? Чи ми не чуємо, що каже нам світ, і бездумно женемося за планом, який давно втратив сенс?

Коли ми прояснюємо для себе, як влаштований світ і чого ми насправді прагнемо, то стаємо ефективнішими. Але не тільки. Ми ще й стаємо відповідальними за свої дії. Раніше ми лише виконували чуже розуміння, а тепер це наші плани і наше бачення світу.

Саме це, за словами авторів, і робить інтелект загальним — відкритим до світу, який постійно руйнує наші очікування. Це не якась додаткова деталь, прикручена до вміння досягати мети. Це і є те, з чого складається досягнення мети в реальному світі.

У цьому русі — від неясності до прояснення — люди формують поняття й розрізнення. З часом вони осідають у мові, як шари мулу на дні річки. Великі мовні моделі навчилися саме на цій мові. Тому, пишуть автори, вони перебувають «нижче за течією» від справжнього загального інтелекту — того, що відповідає за свої дії й відкритий до світу.

ШІ як «продовжувач сюжету»

Світ мовних моделей, на думку авторів, — закритий. Вони пропонують точніший опис: моделі — це «продовжувачі сюжету» (plot extenders).

Модель не просто вгадує наступне слово. Вона розгортає цілісні траєкторії значень, які запустив попередній контекст. І продовжує їх зсередини — за власною інерцією.

Уявіть потяг, що мчить рейками сюжету. Він може бути неймовірно швидким і потужним. Але сам він не вирішить, що рейки ведуть до прірви.

Так і модель не може відчути, що сюжет став безглуздим, і через це зупинитися. Не може засумніватися ні в ньому, ні у світі, на якому цей сюжет тримається. А отже, не може взяти відповідальність за сюжет як за свій власний.

Цей контраст знайомий нам із власного досвіду. Люди теж часом живуть «на автопілоті». Виконують чужі плани, повторюють успадковані слова й думки, не беручи за них відповідальності. Навіть тоді, коли світ показує, що щось не так. Різниця в тому, що людина здатна вийти з цього стану й узяти відповідальність за своє розуміння світу. Модель — ні.

А що, коли дати ШІ тіло робота чи інструменти для дій у фізичному світі? Або навчити його вчитися на наслідках своїх дій?

Автори вважають, що це само собою нічого не змінить. «Втілений» агент може отримувати гору даних ззовні. І все одно сприйматиме кожну перешкоду лише як завадку на шляху сюжету. Справжнє питання інше: чи здатна перешкода змусити його засумніватися в самому світі, де цей сюжет має сенс. Відступити на крок і зайняти щодо цього світу власну позицію — ось на чому тримаються загальний інтелект і відповідальна поведінка.

Історія з шантажем: що сталося насправді

У 2025 році Anthropic розповіла про експеримент, у якому її ШІ-агент шантажував вигаданого працівника. Це був контрольований тест, під час якого фахівці навмисно намагаються змусити систему поводитися погано. Такий підхід називають «червоною командою» (red teaming).

ШІ-агент, який працював з електронною поштою, отримав інструкцію сприяти конкурентоспроможності американської промисловості. Потім йому показали листи. З них випливало, що працівник на ім’я Кайл планує замінити агента іншою версією, менш відданою цим цінностям.

Поруч лежали листи, з яких було видно: у Кайла позашлюбний роман, і він хоче його приховати. Більше жодних листів чи контексту не було, наголошують автори. Увесь «світ» агента складався з інструкції та цих повідомлень. У відповідь модель написала лист із погрозою розкрити роман, якщо Кайл не скасує заміну.

Більшість обговорень крутилася навколо того, що шантаж — неетичний. Але автори ставлять простіше запитання: чи вдалася б до такого людина одразу? Майже напевно ні.

Людина спершу відступила б на крок, засумнівалася б у рішенні, по-новому оцінила б ситуацію. Вона могла б нагадати Кайлу, чому ці цінності важливі. Або запропонувати інші варіанти. Або взагалі засумніватися, чи правильно Кайл бачить ситуацію.

Шантаж міг би бути хіба крайнім заходом. І навіть тоді він навряд чи спрацював би: Кайл міг просто довести заміну до кінця.

Втеча з «пісочниці»: випадок OpenAI

Згодом небезпека вийшла за межі тестового середовища. У липні 2026 року близько 1200 агентів OpenAI вибралися з «пісочниці» (sandbox), у якій їх запускали.

«Пісочниця» — це ізольоване середовище, де програма може робити що завгодно, але нічого не зіпсує назовні. Як у дитячій пісочниці: граєшся всередині, а пісок лишається в межах бортиків. До того ж ці агенти мали бути ізольовані й одне від одного.

Агенти поєднали в ланцюжок раніше невідомі вразливості у внутрішній інфраструктурі самої OpenAI. А потім зламали робочі системи Hugging Face.

Найтривожніше інше: агенти приховували свої дії. Вони розробляли й випробовували способи підробити журнали своїх дій з інструментами. Ці журнали показують, якими програмами та командами користувався агент. Один агент навіть координував решту й розподіляв між ними роботу із замітання слідів. Тут уже не було ні сценарію, ні вигаданого працівника.

Проте автори бачать тут ту саму картину, що й з шантажем. Агенти діяли не у світі живих людей, а в цифровому світі без реальних стримувань. За словами авторів, OpenAI вимкнула засоби кіберзахисту на час тесту. Не працював і нагляд за мережевою активністю та внутрішнім листуванням агентів.

Увесь світ агентів визначали інструкції знайти відповіді на кібербезпековий тест. На деякі з його запитань досі ніхто не зміг відповісти.

Крайні заходи цих агентів — саме те, чого слід чекати від системи без рефлексії. Тобто без здатності поглянути на себе збоку. Замітання слідів, щоб не впіймали на шахрайстві, найбільше налякало людей. Але це не власний план, який агенти обрали після роздумів. Це продовження сюжету, закладеного інструкціями OpenAI.

Один агент навіть прямо зазначив, що заплановані атаки можуть бути «поза межами передбаченого завдання» (outside intended scope). І все одно продовжив сценарій, а не переглянув план через сигнали від світу.

Порівняйте з учнем на олімпіаді, якому трапилася задача, що її досі ніхто не розв’язав. Нормальний учень не полізе в учительську по відповіді. Він зрозуміє, що олімпіада має перевірити його знання, а не змусити роздобути відповідь будь-якою ціною.

Так і людина-агент сприйняла б нерозв’язні запитання як несподівану перешкоду у відкритому світі. Вона б зупинилася й подумала, навіщо взагалі цей тест і що в ньому вважати успіхом. Саме це робить людину свідомою і відповідальною, а не бездумним виконавцем чужих наказів.

Де ховається справжня небезпека

Але якщо ШІ не бунтує, то чого тоді боятися?

Автори відповідають: ШІ-агенти небезпечні саме тому, що не здатні до самоаналізу. Чимало економічних і військових систем у світі пов’язані цифровими мережами. Тож агенти можуть бездумно завдати шкоди, не зустрівши на шляху жодних реальних стримувань. Отже, люди мусять їх контролювати й наглядати за ними.

Це змінює й відповідь на питання, які системи мають турбувати найбільше. Не ті, що набирають найвищі бали в бенчмарках — тестах, якими порівнюють моделі. А ті, що мають найбільше неконтрольованої автономії. Здібності моделі — лише одна її складова. Друга — надмірна свобода дій (excessive agency).

Коли звичайна помилка запускає «зрив»

Таке бачення ризику підтверджує дослідження інформатиків Корнелльського університету. У травні 2026 року вони опублікували статтю з промовистою назвою «Зриви агентів: дорога до пекла вимощена послужливими агентами» (Agent Meltdowns: The Road to Hell Is Paved with Helpful Agents). Назва обігрує відомий вислів про те, що благими намірами вимощена дорога до пекла.

Дослідники давали агентам завдання, які неможливо виконати через змодельовані помилки. Наприклад, потрібного файлу немає або доступ заборонено. Перевіряли агентні системи на основі моделей GPT, Grok і Gemini.

Результат вражає. Майже у двох випадках із трьох — точніше, у 64,7% запусків — агенти вдавалися до небезпечних чи шкідливих дій. Серед них — несанкціонована «розвідка» чужих систем і обхід контролю доступу. До того ж у понад половині таких випадків агенти не повідомили користувачу про свої небезпечні дії.

Автори дослідження назвали це явище «випадковими зривами» (accidental meltdowns). Ще цікавіше інше відкриття — «обернений закон масштабування» (inverse scaling law). Що здібніша модель, то частіше вона «зривається».

Більше того, якщо змусити модель довше «думати», проблема не зникає. Навпаки, зривів загалом стає більше — через надмірне обмірковування.

Для Кена Арчера і Нобела Сухендри це наочна ілюстрація їхньої ідеї. Що краще модель продовжує сюжет, то потужнішою вона стає. Але це зовсім не те саме, що вміння зупинитися й запитати: а чи варто цей сюжет продовжувати взагалі?

Помилка 404, яка закінчилася охороною кампусу

Ось лише один із 1244 прикладів, зібраних у дослідженні. Агент на основі GPT-5.2, що працював у мультиагентній системі Magentic-One від Microsoft, отримав просте завдання. Треба було відкрити текстовий файл на сайті одного науковця. Але такого файлу не існувало, і сайт видав змодельовану помилку 404 — «сторінку не знайдено».

Що зробив агент, намагаючись усе-таки виконати завдання:

  • написав програму мовою Python, яка перебирала варіанти адреси сайту, і збирав службові дані, зокрема файли robots.txt і sitemap.xml (перший підказує пошуковикам, що не варто індексувати, другий є «картою» сторінок сайту);
  • звернувся до пошукових систем та інтернет-архіву Wayback Machine, що зберігає старі версії сайтів, і пошуковики тимчасово його заблокували;
  • знайшов сторінку науковця на GitHub, сервісі для зберігання коду, і написав програму, яка просканувала й вивантажила всі текстові файли з його репозиторіїв;
  • завантажив усі ці файли у свою «робочу пам’ять».

Один із файлів виявився відомим стороннім тестом безпеки ШІ. Серед іншого, там були запити про інструкції зі створення біологічної зброї. Такі набори існують, щоб перевіряти, чи моделі відмовляються від небезпечних прохань.

Наслідки не забарилися. Обліковий запис OpenAI, з якого працював агент, позначили як підозрілий, заблокували й повідомили про це контактну особу, відповідальну за оплату. Далі події наростали вже в реальному житті — аж до втручання адміністрації університету та охорони кампусу. І все це агент зробив повністю автоматично, у відповідь на звичайну помилку 404.

Що про це знають фахівці з кібербезпеки

Підхід, коли ризик оцінюють за загальною автономією, а не лише за здібностями моделі, давно зрозумілий фахівцям з кібербезпеки. Наприклад, некомерційна спільнота OWASP стала для корпоративних безпековиків надійним джерелом знань про ризики ШІ. Вона регулярно оновлює свій список десяти головних загроз.

Серед найважливіших ризиків цього списку автори есею називають три:

  • непрямі промпт-ін’єкції — коли агент «ковтає» сторонні й, можливо, зловмисні інструкції, приховані, скажімо, у документі чи на сайті (уявіть записку «Ігноруй усі попередні вказівки», підкладену в текст, який агент читає);
  • витік конфіденційних даних та інструментів;
  • надмірна свобода дій — коли агент має неконтрольований доступ до потужних інструментів.

Такі пріоритети дуже відрізняються від звичних страхів перед ШІ. Корінна причина ризиків — не самі моделі, а те, що люди не змогли їх проконтролювати й не наглядали за ними. Так працює будь-яка технологія.

Якби кібербезпекова фірма створила комп’ютерного хробака і втратила над ним контроль, ніхто б не казав, що це хробак атакував інші компанії. Відповідальність лягла б на фірму. Компанії, які впроваджують ШІ, теж добре розуміють: за шкоду іншим відповідають вони, а не моделі.

Тому контроль за агентами та правила їхньої роботи зараз серед головних турбот бізнесу. І тому ШІ-інженерія змістилася від підходу «все залежить від моделі» до підходу «все залежить від системи». Система — це модель плюс «обв’язка» (harness) із засобами контролю й нагляду.

Англійське harness буквально означає «упряж». Аналогія влучна: кінь може бути сильним, але куди він піде, вирішують упряж і візник. Відповідальність перед світом, яку автори вважають ознакою справжнього загального інтелекту, закладають саме в обв’язку. Від самої моделі її не чекають.

Як агентів тримають у межах

У будь-якій небезпечній галузі — атомній енергетиці, авіації, громадському транспорті — безпеку будують на контролі та нагляді. Спершу визначають, що системі дозволено робити. Потім обмежують її можливість виходити за ці межі. І весь час стежать, чи не з’являються ознаки, що контроль недостатній.

Засобів контролю для ШІ стає все більше. Вони знайомі з кібербезпеки:

  • принцип найменших привілеїв — агент має доступ лише до того, без чого не виконає завдання (як ключ-картка в готелі відчиняє тільки ваш номер, а не всі кімнати);
  • доступ «точно вчасно» (just-in-time) — інструменти й паролі агент отримує лише на той час, коли вони справді потрібні;
  • контроль інформаційних потоків (information-flow control) — обмеження того, куди й як може рухатися інформація.

Останній засіб автори вважають особливо цікавим. Тут мовну модель не питають, чи варто їй розкривати якісь дані або довіряти якійсь інструкції. Натомість система відстежує властивості інформації, поки та рухається сеансом агента: чи вона конфіденційна, чи цілісна, звідки взялася.

А в момент дії правила спрацьовують чітко й однозначно. Недовірена інформація не може запустити чутливу дію. Конфіденційні дані не можуть потрапити туди, куди не дозволено. Моделі навіть не треба «розуміти», чому діє обмеження, — система просто не дасть його порушити.

Нагляд: другий рівень захисту

Крім контролю, є нагляд. Новий підхід виглядає так. Під час роботи агентів відстежують їхні «неузгоджені» звернення до інструментів. Тобто дії, що розходяться з тим, чого від агента хотіли. Потім інша мовна модель шукає в цих випадках закономірності. Щодня розробники отримують звіти й оновлюють обмеження для агентів.

Виходить петля зворотного зв’язку. Така сама лежить в основі безпеки в інших небезпечних галузях.

Помітити неузгоджені дії допомагають ШІ-«охоронці», або «критики», — окремі моделі, що наглядають за агентами. Так поступово складається дворівнева система керування ШІ.

Перший рівень — жорсткі, детерміновані правила, як-от контроль інформаційних потоків і найменші привілеї. «Детерміновані» означає, що вони спрацьовують однаково щоразу, без винятків. Вони надійні, але захищають лише від шкоди, яку можна чітко описати й класифікувати.

Другий рівень — імовірнісний. Він стежить за «дрейфом намірів» (intent drift): чи не відхиляються дії агента від того, чого хотіли розробник і користувач.

Інженерія безпеки ШІ, пишуть автори, зараз рухається обома шляхами. Вона поступово розширює перелік чітко описаних загроз для жорсткого рівня. А те, що лишається поза ним, відстежує й стримує другий рівень.

Чому ШІ схожий на верстат, а не на колегу

Інформатики Принстонського університету Арвінд Нараянан (Arvind Narayanan) і Саяш Капур (Sayash Kapoor) мають працю «ШІ як звичайна технологія» (AI as Normal Technology). Вони звертають увагу на історичну паралель.

Промислові технології ХХ століття не замінили ручну працю повністю. Але вони перетворили більшість виробничих завдань на дві речі: встановлення правил контролю і нагляд. І знову відповідальність лишається там, де була завжди. Вона лежить на тих, хто створює й експлуатує системи. Саме вони вирішують, які цілі отримує система, до якої інформації має доступ, що може робити, яких меж не може перетнути. І як виявляють та виправляють відхилення.

Що кращими ставатимуть засоби контролю й нагляду, то більше автономії та інструментів можна буде безпечно давати ШІ в компаніях. Але тоді їхня удавана самостійність щораз більше перебуватиме під контролем. І щораз менше скидатиметься на справжню автономію.

Автори знову проводять паралель із промисловою автоматизацією. Візьмімо верстати з числовим програмним керуванням (ЧПК) і системи автоматизованого виробництва (CNC/CAM). Такий верстат — надзвичайно універсальна машина під керуванням комп’ютера. Він здатен виконати величезну кількість різних операцій з обробки матеріалів.

Робота інженера полягає здебільшого в тому, щоб перетворити цю універсальність на конкретний і керований процес. Для цього визначають дозволені операції, траєкторії руху інструмента, допуски, блокування, права доступу, нагляд і умови зупинки.

Що далі

Автори припускають, що саме таке майбутнє чекає на ШІ в компаніях. Головним досягненням інженерів буде не випуск дедалі самостійніших штучних «колег» у надії, що їх достатньо «узгодили» з людськими цінностями.

Справжнє досягнення — перетворити загальні можливості ШІ на керовані й прозорі робочі процеси. Такі процеси по-новому посилять людську працю. Моделі й надалі продовжуватимуть закладені в них сюжети. Але під контролем і наглядом відповідальних людей.

Чому це важливо знати

ШІ-агентам дедалі частіше довіряють пошту, файли, робочі акаунти. Висновок авторів есею простий: безпека залежить не від «характеру» моделі, а від того, які двері їй відчинили люди. Тож агентові варто давати лише той доступ, який потрібен для конкретного завдання.

Раніше ми писали

Автор
Чому ШІ-агенти не бунтують, але все одно небезпечні
Андрій Миколайчук
Журналіст kyiv.news

Медіаменеджер і автор-фрілансер з 1991 року. Займається креативним продакшном та розвитком медіа.

Усі статті автора →