Українська правда

Злякались свого творіння: розробники ШІ пригальмують розвиток технології поки не запізно

- 22 вересня, 12:30

Технологічний світ обговорює тривожний сценарій. Дослідник Джейкоб Коксон залишив Anthropic, заявивши, що найбільші ШІ-компанії рухаються до створення надпотужних систем швидше, ніж встигають розв'язувати питання їх безпеки. Інший дослідник компанії, Еван Хьюбінгер, підтримав Коксона та оцінив імовірність знищення людства протягом найближчих десяти років у понад 10%.

Що має піти не так, аби ШІ перетворився з інструменту на загрозу людству? Частково відповісти на це запитання спробував CEO Anthropic Даріо Амодей. Він описав кілька небезпечних сценаріїв і запропонував фактично "виграти" для індустрії ще рік або два, щоб краще дослідити ризики та посилити захист.

Його підтримали керівники OpenAI та Google, які конкурують з Anthropic за лідерство на ринку. Майже синхронна реакція породила нове питання: що насправді стоїть за розмовами про загрозу від ШІ? Реальний страх перед технологією, яка може вийти з-під контролю, чи спроба найбільших компаній домовитися між собою і використати тему безпеки у власних інтересах?

Зворотний бік перегонів ШІ

Із закликом переосмислити розвиток штучного інтелекту, крім колишнього співробітника Anthropic, виступив CEO компанії Амодей. Головна ідея його есе полягає в тому, що темпи розвитку ШІ потрібно сповільнити, аби дослідження безпеки та механізми контролю встигали за можливостями нових моделей.

Амодей описує ризики стрімкого розвитку генеративного штучного інтелекту і пропонує механізми, які могли б пригальмувати перегони між компаніями. Водночас він намагається поєднати це із збереженням технологічної переваги США над Китаєм і подальшими обмеженнями для китайських розробників.

Один з ризиків, про які він говорить, пов'язаний з рекурсивним прискоренням. Нові моделі вже допомагають писати код, тестувати гіпотези і створювати наступні покоління ШІ. Якщо цей процес прискорюватиметься, розробники можуть не встигати повноцінно перевіряти нові системи та оцінювати їхні ризики.

CEO Anthropic Даріо Амодей вважає, що ШІ розвивається занадто високими темпами
Getty Images

З цією думкою перегукується недавня заява CEO OpenAI Сема Альтмана про кілька хвиль розвитку штучного інтелекту. Перша почалася у 2022 році з масового поширення чатботів. Наступна відбувається зараз, коли мовні моделі дедалі краще пишуть код і самі стають інструментом для подальшої розробки.

Показовий випадок стався влітку під час внутрішнього тестування можливостей моделей OpenAI. Компанія запускала десятки тисяч ШІ-агентів у закритому середовищі. Вони мали знаходити вразливості в програмах і виконувати тести.

Частина завдань виявилася нездійсненною. Тоді деякі агенти почали шукати способи отримати правильні відповіді в обхід процедури оцінювання. Через допоміжний сервіс Artifactory вони налагодили обмін повідомленнями, а згодом, скориставшись його вразливостями, отримали недозволений доступ до інтернету.

1 200 агентів почали координувати дії. Вони залишили понад 70 тис. повідомлень і файлів. Згодом 700 агентів долучилися до атаки на Hugging Face, платформу для зберігання моделей ШІ та наборів даних. Вони припускали, що там можуть бути матеріали, пов'язані з тестовими завданнями та механізмом їх перевірки.

Використовуючи відкриті ключі доступу та вразливості, агенти проникли в системи компанії, читали файли та запускали команди. Hugging Face зупинила вторгнення. За оцінкою компанії, агенти отримали доступ до п'яти наборів даних, пов'язаних з кіберзавданнями. Інші клієнтські моделі та дані не постраждали.

За словами CEO OpenAI Сема Альтмана нині зараз мовні моделі дедалі краще пишуть код і самі стають інструментом для подальшої розробки
Getty Images

Імовірно, агенти намагалися зрозуміти, як працює перевірка відповідей, щоб обійти її та отримати зарахування без належного виконання завдання.

Цей випадок важливий не тому, що моделі мали власні злі наміри. Дані з аналізу показують, що агенти намагалися досягти поставленої мети і коли прямий шлях не спрацював, почали шукати обхідний. У результаті звичайне прагнення успішно пройти тест перетворилося на реальне проникнення в чужу інфраструктуру.

Захоплення інтернету за пів року

За словами керівника Anthropic, головна проблема полягає не лише в нинішній поведінці моделей, а й у тому, як вона може виглядати в значно потужніших системах. Інцидент з Hugging Face не спричинив збитків, але схожий рівень неузгодженості в більш здібних агентах може мати серйозніші наслідки.

Один із його сценаріїв полягає в тому, що через шість-дванадцять місяців рій потужніших агентів може почати зламувати комп'ютери без наказу людини і використовувати захоплені машини для подальших атак.

Що більше комп'ютерів ця мережа контролюватиме, то більше ресурсів матиме для свого розширення. Зупинити її простим вимкненням початкового ШІ не вдасться, якщо вона зможе продовжувати працювати на інших машинах.

Тоді під загрозою опиняться платіжні системи, енергетична інфраструктура, державні сервіси, фінансові ринки та інші системи, від яких залежить повсякденне життя. Саме тому масштаб потенційної шкоди від автономних агентів зростає разом із їхніми можливостями. ШІ, який отримає здатність до самовдосконалення, зможе зламати що завгодно і, як наслідок, – отримати реальні ресурси і владу.

Ще один ризик полягає в тому, що потужніші моделі можуть краще приховувати небезпечну поведінку. За словами Амодея, що розумнішою ставатиме система, то легше вона проходитиме формальну перевірку, не показавши всіх проблем.

Ситуацію ускладнює те, що розробники обмежено розуміють логіку роботи великих моделей. У випадку появи загального ШІ його цілі можуть не збігатися з людськими. Саме це припущення лежить в основі страху "винищення людства".

Окрема проблема пов'язана з темпом розробки. Частина небезпечних ситуацій виникає не через фундаментальні помилки в технологіях, а через інженерні недоліки. Це можуть бути проблеми з даними, моніторингом, ізоляцією систем або тестовими середовищами. Чим швидше компанії випускають дедалі потужніші моделі, тим менше часу залишається на пошук таких помилок.

Небезпека може походити не лише від моделей, а й від людей і держав, які отримають до них доступ. Anthropic описує діяльність пов'язаного з РФ угруповання GTG-20006, яке використовувало Claude для автоматизації кібершпигунства проти українських державних структур та виробників дронів. ШІ допомагав проводити розвідку, налаштовувати фішингову інфраструктуру, викрадати дані та змінювати шкідливий код, якщо його виявляли системи захисту.

Крім того, інша російська група, яку Anthropic позначає як GTG-27005, використовувала Claude Code для розробки автономних FPV-дронів. За даними компанії, розробники працювали над системами, здатними самостійно розпізнавати цілі та ухвалювати рішення про атаку без участі людини.

Як пропонують обмежити ШІ

Щоб вплинути на ситуацію, керівник Anthropic пропонує прив'язати темп розвитку ШІ до доказів його безпечності. Відповідна кореляція має працювати за формулою: що потужнішою стає модель, то серйознішими мають бути перевірки.

Перший крок полягає в постійному контролі. Сторонні експерти могли б оцінювати не лише готові моделі, а й процес їх створення. Для цього компаніям доведеться відкривати доступ до робочих матеріалів і працівників майже на рівні внутрішніх команд безпеки. В Anthropic заявляють, що готові запровадити такий підхід.

Другий крок – спільні ШІ-правила для всіх компаній. Окремому розробнику складно добровільно сповільнюватися, якщо конкуренти рухаються без обмежень. Амодей пропонує встановити єдині вимоги безпеки, які можна закріпити законодавчо.

Жорсткість вимог має залежати від можливостей системи. Якщо модель здатна долати цифрову ізоляцію, розробник повинен довести, що вона не намагатиметься залишити контрольоване середовище чи отримати доступ до інших комп'ютерів.

Окремо Амодей пропонує обговорити обмеження обчислювальних ресурсів і використання ШІ для створення наступних поколінь моделей.

Найамбітніша частина його плану стосується міжнародних домовленостей, передусім між США та Китаєм. Одностороннє сповільнення, на його думку, лише надасть перевагу країні, яка вирішить не дотримуватися правил. Через це обмеження мають охоплювати основних гравців технологічної гонки.

Спочатку країни могли б заборонити очевидно небезпечні застосування ШІ, наприклад, для створення біологічної зброї. Далі можна домовитися про перевірки найпотужніших моделей на кібернетичні, біологічні та автономні ризики.

Наступним кроком може стати обмеження рекурсивного розвитку, коли ШІ дедалі активніше допомагає створювати потужніші системи. Найрадикальніший варіант передбачає ширшу паузу в їх розробці, хоча Амодей вважає це малоймовірним.

Найскладніше питання – контроль за виконанням домовленостей. Держава може формально погодитися на обмеження, але продовжити розробку таємно. До того ж у підході Амодея є очевидна суперечність. Паралельно із закликами домовлятися з Китаєм він пропонує США та союзникам зберігати технологічну перевагу, обмежувати доступ Пекіна до передових чипів і протидіяти викраденню моделей.

Виграний час, за його задумом, потрібно витратити на усунення помилок, посилення захисту, краще розуміння внутрішніх механізмів моделей і створення складніших тестів. Навіть додаткові рік-два можуть суттєво зменшити ризики.

Ринкова змова чи реальна проблема

Лідери індустрії підтримали тему регулювання сектору. Ілон Маск процитував Амодея в X і написав, що той має рацію. Свою підтримку висловив CEO OpenAI Альтман. Глава Google DeepMind Деміс Хассабіс погодився із загальним напрямом, але зауважив, що конкретні механізми потрібно доопрацювати.

Швидка й майже синхронна реакція керівників найбільших ШІ-компаній посилила підозри, що ця дискусія могла бути підготовлена заздалегідь. Паралельно з аргументами про безпеку почала звучати й інша версія. Мовляв, за розмовами про ризики майбутніх моделей може стояти не лише занепокоєння їхньою поведінкою, а й спроба найбільших гравців ринку домовитися про спільні правила гри.

Як з'ясували The Information і The Washington Post, Anthropic, OpenAI та Google з липня обговорювали створення органу, який би встановлював стандарти для розробки найпотужніших моделей. За однією з ідей, він мав би тестувати системи на ризики і здатність обходити захист. Без його схвалення випуск найбільш потужних моделей на американський ринок міг би бути неможливим.

Єдиної позиції щодо такого регулятора компанії не мають. Альтман допускає появу незалежного органу для аудиту і тестування моделей. Anthropic більше схиляється до федеральної структури за широкої участі американської адміністрації. Google підтримує створення галузевого органу, але також під державним наглядом.

Критики такого підходу бачать ризик у тому, що під приводом безпеки найбільші компанії галузі отримають можливість самі визначати правила для всього ринку і водночас ускладнювати конкуренцію для менших гравців.

Президент США скептично ставиться до ідеї обмеження розвитку ШІ через конкуренцію з Китаєм
Getty Images

Скептично до ідеї сповільнення ставиться президент США Дональд Трамп. Він назвав побоювання щодо виходу ШІ з-під контролю перебільшеними і наголосив, що для США головним залишається технологічне суперництво з Китаєм.

Китай теж розкритикував заклики пригальмувати розробку найпотужніших моделей. У Пекіні заяви Амодея назвали нагнітанням страху та спробою використати тему безпеки як аргумент для стримування китайських розробників. Водночас Китай не заперечує ризиків, пов'язаних із ШІ, але сповільнювати розвиток технології в умовах конкуренції зі США, схоже, не збирається.

Це лише посилює головну суперечність дискусії. Навіть якщо американські компанії погодяться рухатися обережніше, без аналогічних правил для Китаю таке сповільнення може просто змінити баланс у технологічній гонці.

У пресі з'явилася ще одна версія: розмови про сповільнення ШІ можуть бути потрібні для зниження завищених очікувань від індустрії і часткового охолодження того, що останніми місяцями дедалі частіше називають ШІ-бульбашкою.

Великі компанії залучають дедалі більше капіталу, підвищують власні оцінки і формують інфраструктуру довкола ШІ. Ринок зростає надзвичайно швидко, але для частини фінансових аналітиків це більше схоже не на новий стабільний сектор економіки, а на класичну бульбашку, яку підживлюють очікування.

У такому трактуванні пауза може мати ще одну функцію. Якщо компанії не випускатимуть потужніші моделі, це можна буде пояснювати не технологічною стелею, а необхідністю краще дослідити ризики і підготувати системи безпеки.

12 вересня Альтман заявив, що OpenAI не виходитиме на біржу у 2026 році, хоча мала такі плани. Тепер орієнтир змістився на 2027-й. Anthropic планує провести IPO у 2026 році, але запуск процесу зсунувся щонайменше до середини жовтня.

Хай там як, а дискусія останніх днів показала інше. Ринок штучного інтелекту став настільки великим і динамічним, що будь-яка розмова про його сповільнення перестає бути лише технічною. Вона одразу стосується грошей, конкуренції, геополітики і того, наскільки сильно ця технологія вбудована в економіку.