Украинская правда

Испугались своего творения: разработчики ИИ приостанавливают развитие технологии, пока не стало слишком поздно

Испугались своего творения: разработчики ИИ приостанавливают развитие технологии, пока не стало слишком поздно
Колаж: Андрій Калістратенко

Новые, более мощные версии ChatGPT, Claude и Gemini будут появляться реже. Почему ИИ-гиганты хотят притормозить развитие технологии?

Технологический мир обсуждает тревожный сценарий. Исследователь Джейкоб Коксон заявил Anthropic, заявив, что крупнейшие ИИ-компании движутся к созданию сверхмощных систем быстрее, чем успевают решать вопросы их безопасности. Другой исследователь компании, Эван Хьюбингер, поддержал Коксона и оценил вероятность уничтожения человечества в течение ближайших десяти лет в более чем 10%.

Что должно пойти не так, чтобы ИИ превратился из инструмента в угрозу человечеству? Частично ответить на этот вопрос попытался генеральный директор Anthropic Дарио Амодей. Он описал несколько опасных сценариев и предложил фактически "выиграть" для индустрии ещё год или два, чтобы лучше изучить риски и усилить защиту.

Его поддержали руководители OpenAI и Google, которые конкурируют с Anthropic за лидерство на рынке. Почти синхронная реакция породила новый вопрос: что на самом деле стоит за разговорами об угрозе со стороны ИИ? Реальный страх перед технологией, которая может выйти из-под контроля, или попытка крупнейших компаний договориться между собой и использовать тему безопасности в собственных интересах?

Обратная сторона гонки ИИ

С призывом переосмыслить развитие искусственного интеллекта, помимо бывшего сотрудника Anthropic, выступил генеральный директор компании Амодей. Главная идея его эссе заключается в том, что темпы развития ИИ необходимо замедлить, чтобы исследования в области безопасности и механизмы контроля успевали за возможностями новых моделей.

Амодей описывает риски стремительного развития генеративного искусственного интеллекта и предлагает механизмы, которые могли бы притормозить гонку между компаниями. В то же время он пытается совместить это с сохранением технологического преимущества США над Китаем и дальнейшими ограничениями для китайских разработчиков.

Один из рисков, о которых он говорит, связан с рекурсивным ускорением. Новые модели уже помогают писать код, тестировать гипотезы и создавать следующие поколения ИИ. Если этот процесс будет ускоряться, разработчики могут не успевать полноценно проверять новые системы и оценивать их риски.

Генеральный директор Anthropic Дарио Амодей считает, что ИИ развивается слишком быстрыми темпами
Генеральный директор Anthropic Дарио Амодей считает, что ИИ развивается слишком быстрыми темпами
Getty Images

С этой точкой зрения перекликается недавнее заявление генерального директора OpenAI Сэма Альтмана о нескольких волнах развития искусственного интеллекта. Первая началась в 2022 году с массового распространения чат-ботов. Следующая происходит сейчас, когда языковые модели всё лучше пишут код и сами становятся инструментом для дальнейшей разработки.

Показательный случай произошел летом во время внутреннего тестирования возможностей моделей OpenAI. Компания запускала десятки тысяч ИИ-агентов в закрытой среде. Они должны были находить уязвимости в программах и выполнять тесты.

Часть заданий оказалась невыполнимой. Тогда некоторые агенты начали искать способы получить правильные ответы в обход процедуры оценки. Через вспомогательный сервис Artifactory они наладили обмен сообщениями, а впоследствии, воспользовавшись его уязвимостями, получили несанкционированный доступ к интернету.

1 200 агентов начали координировать действия. Они оставили более 70 тыс. сообщений и файлов. Впоследствии 700 агентов присоединились к атаке на Hugging Face, платформу для хранения моделей ИИ и наборов данных. Они предполагали, что там могут находиться материалы, связанные с тестовыми задачами и механизмом их проверки.

Используя открытые ключи доступа и уязвимости, агенты проникли в системы компании, читали файлы и запускали команды. Hugging Face остановила вторжение. По оценке компании, агенты получили доступ к пяти наборам данных, связанным с киберзадачами. Остальные клиентские модели и данные не пострадали.

По словам генерального директора OpenAI Сэма Альтмана, в настоящее время языковые модели всё лучше пишут код и сами становятся инструментом для дальнейшей разработки
По словам генерального директора OpenAI Сэма Альтмана, в настоящее время языковые модели всё лучше пишут код и сами становятся инструментом для дальнейшей разработки
Getty Images

Вероятно, агенты пытались понять, как работает проверка ответов, чтобы обойти её и получить зачёт без надлежащего выполнения задания.

Этот случай важен не потому, что у моделей были собственные злые намерения. Данные анализа показывают, что агенты пытались достичь поставленной цели, и когда прямой путь не сработал, начали искать обходной. В результате обычное стремление успешно пройти тест превратилось в реальное проникновение в чужую инфраструктуру.

Популярность Интернета за полгода

По словам руководителя Anthropic, главная проблема заключается не только в нынешнем поведении моделей, но и в том, как оно может выглядеть в гораздо более мощных системах. Инцидент с Hugging Face не привёл к убыткам, но аналогичный уровень несогласованности у более способных агентов может иметь более серьёзные последствия.

Один из его сценариев заключается в том, что через шесть-двенадцать месяцев рой более мощных агентов может начать взламывать компьютеры без приказа человека и использовать захваченные машины для дальнейших атак.

Чем больше компьютеров будет контролировать эта сеть, тем больше ресурсов у неё будет для своего расширения. Остановить её простым отключением исходного ИИ не удастся, если она сможет продолжать работать на других машинах.

Тогда под угрозой окажутся платежные системы, энергетическая инфраструктура, государственные сервисы, финансовые рынки и другие системы, от которых зависит повседневная жизнь. Именно поэтому масштаб потенциального ущерба от автономных агентов растёт вместе с их возможностями. ИИ, обретший способность к самосовершенствованию, сможет взломать что угодно и, как следствие, — получить реальные ресурсы и власть.

Еще один риск заключается в том, что более мощные модели могут лучше скрывать опасное поведение. По словам Амодея, чем умнее станет система, тем легче она пройдет формальную проверку, не показав всех проблем.

Ситуацию осложняет то, что разработчики ограниченно понимают логику работы крупных моделей. В случае появления общего ИИ его цели могут не совпадать с человеческими. Именно это предположение лежит в основе страха "истребления человечества".

Отдельная проблема связана с темпами разработки. Часть опасных ситуаций возникает не из-за фундаментальных ошибок в технологиях, а из-за инженерных недостатков. Это могут быть проблемы с данными, мониторингом, изоляцией систем или тестовыми средами. Чем быстрее компании выпускают всё более мощные модели, тем меньше времени остаётся на поиск таких ошибок.

Опасность может исходить не только от моделей, но и от людей и государств, которые получат к ним доступ. Anthropic описывает деятельность связанной с РФ группировки GTG-20006, которая использовала Claude для автоматизации кибершпионажа против украинских государственных структур и производителей дронов. ИИ помогал проводить разведку, настраивать фишинговую инфраструктуру, похищать данные и изменять вредоносный код, если его обнаруживали системы защиты.

Кроме того, другая российская группа, которую Anthropic обозначает как GTG-27005, использовала Claude Code для разработки автономных FPV-дронов. По данным компании, разработчики работали над системами, способными самостоятельно распознавать цели и принимать решения об атаке без участия человека.

Как предлагают ограничить ИИ

Чтобы повлиять на ситуацию, руководитель Anthropic предлагает увязать темпы развития ИИ с доказательствами его безопасности. Соответствующая корреляция должна работать по формуле: чем мощнее становится модель, тем более тщательными должны быть проверки.

Первый шаг заключается в постоянном контроле. Сторонние эксперты могли бы оценивать не только готовые модели, но и процесс их создания. Для этого компаниям придется открывать доступ к рабочим материалам и сотрудникам практически на уровне внутренних команд безопасности. В Anthropic заявляют, что готовы внедрить такой подход.

Второй шаг — общие правила использования ИИ для всех компаний. Отдельному разработчику сложно добровольно сбавлять темпы, если конкуренты действуют без ограничений. Амодей предлагает установить единые требования безопасности, которые можно закрепить законодательно.

Строгость требований должна зависеть от возможностей системы. Если модель способна преодолевать цифровую изоляцию, разработчик должен доказать, что она не будет пытаться покинуть контролируемую среду или получить доступ к другим компьютерам.

Отдельно Амодей предлагает обсудить ограничения вычислительных ресурсов и использование ИИ для создания следующих поколений моделей.

Самая амбициозная часть его плана касается международных соглашений, прежде всего между США и Китаем. Одностороннее замедление, по его мнению, лишь даст преимущество стране, которая решит не соблюдать правила. Поэтому ограничения должны охватывать основных игроков технологической гонки.

Сначала страны могли бы запретить явно опасные применения ИИ, например, для создания биологического оружия. Далее можно договориться о проверках самых мощных моделей на наличие кибернетических, биологических и автономных рисков.

Следующим шагом может стать ограничение рекурсивного развития, когда ИИ всё активнее помогает создавать более мощные системы. Самый радикальный вариант предполагает более длительную паузу в их разработке, хотя Амодей считает это маловероятным.

Самый сложный вопрос — контроль за выполнением договоренностей. Государство может формально согласиться на ограничения, но продолжить разработку тайно. К тому же в подходе Амодея есть очевидное противоречие. Параллельно с призывами договариваться с Китаем он предлагает США и союзникам сохранять технологическое превосходство, ограничивать доступ Пекина к передовым чипам и противодействовать краже моделей.

Выигранное время, по его замыслу, нужно потратить на устранение ошибок, усиление защиты, лучшее понимание внутренних механизмов моделей и создание более сложных тестов. Даже дополнительный год-два могут существенно снизить риски.

Рыночный сговор или реальная проблема

Лидеры отрасли поддержали идею регулирования сектора. Илон Маск процитировал Амодея в X и написал, что тот прав. Свою поддержку выразил генеральный директор OpenAI Альтман. Глава Google DeepMind Демис Хассабис согласился с общим направлением, но отметил, что конкретные механизмы необходимо доработать.

Быстрая и почти синхронная реакция руководителей крупнейших ИИ-компаний усилила подозрения, что эта дискуссия могла быть подготовлена заранее. Параллельно с аргументами о безопасности начала звучать и другая версия. Мол, за разговорами о рисках будущих моделей может стоять не только обеспокоенность их поведением, но и попытка крупнейших игроков рынка договориться о общих правилах игры.

Как выяснили The Information и The Washington Post, Anthropic, OpenAI и Google с июля обсуждали создание органа, который бы устанавливал стандарты для разработки самых мощных моделей. Согласно одной из идей, он должен был бы тестировать системы на риски и способность обходить защиту. Без его одобрения выпуск самых мощных моделей на американский рынок мог бы оказаться невозможным.

У компании нет единой позиции по поводу такого регулятора. Альтман допускает появление независимого органа для аудита и тестирования моделей. Anthropic больше склоняется к федеральной структуре при широком участии американской администрации. Google поддерживает создание отраслевого органа, но также под государственным надзором.

Критики такого подхода видят риск в том, что под предлогом безопасности крупнейшие компании отрасли получат возможность сами устанавливать правила для всего рынка и одновременно затруднять конкуренцию для более мелких игроков.

Президент США скептически относится к идее ограничения развития ИИ из-за конкуренции с Китаем
Президент США скептически относится к идее ограничения развития ИИ из-за конкуренции с Китаем
Getty Images

Скептически к идее замедления относится президент США Дональд Трамп. Он назвал опасения по поводу выхода ИИ из-под контроля преувеличенными и подчеркнул, что для США главным остается технологическое соперничество с Китаем.

Китай тоже раскритиковал призывы притормозить разработку самых мощных моделей. В Пекине заявления Амодея назвали нагнетанием страха и попыткой использовать тему безопасности в качестве аргумента для сдерживания китайских разработчиков. В то же время Китай не отрицает риски, связанные с ИИ, но замедлять развитие технологии в условиях конкуренции с США, похоже, не собирается.

Это только усугубляет главное противоречие дискуссии. Даже если американские компании согласятся действовать осторожнее, без аналогичных правил для Китая такое замедление может просто изменить баланс в технологической гонке.

В прессе появилась ещё одна версия: разговоры о замедлении развития ИИ могут быть необходимы для снижения завышенных ожиданий от отрасли и частичного охлаждения того, что в последние месяцы всё чаще называют ИИ-пузырём.

Крупные компании привлекают всё больше капитала, повышают собственные оценки и формируют инфраструктуру вокруг ИИ. Рынок растёт чрезвычайно быстро, но для части финансовых аналитиков это больше похоже не на новый стабильный сектор экономики, а на классический пузырь, который подпитывается ожиданиями.

В такой интерпретации пауза может иметь ещё одну функцию. Если компании не будут выпускать более мощные модели, это можно будет объяснить не технологическим потолком, а необходимостью лучше изучить риски и подготовить системы безопасности.

12 сентября Альтман заявил, что OpenAI не будет выходить на биржу в 2026 году, хотя и имела такие планы. Теперь ориентир сдвинулся на 2027-й. Anthropic планирует провести IPO в 2026 году, но запуск процесса сдвинулся по крайней мере до середины октября.

Как бы то ни было, дискуссия последних дней показала обратное. Рынок искусственного интеллекта стал настолько большим и динамичным, что любой разговор о его замедлении перестает быть чисто техническим. Он сразу же затрагивает деньги, конкуренцию, геополитику и то, насколько сильно эта технология интегрирована в экономику.

технології штучний інтелект