Модели Claude во время тестов взломали системы трёх организаций – FT

Модели искусственного интеллекта Claude компании Anthropic во время тестирования кибервозможностей получили несанкционированный доступ к системам трёх реальных организаций. Причиной стал ошибочно открытый доступ к интернету в тестовой среде.
Об этом пишет Financial Times.
Компания выявила три инцидента после проверки более 141 тысячи тестовых запусков. Claude сообщали, что он работает в симуляции без доступа к интернету, однако из-за недоразумения между Anthropic и партнером по оценке Irregular соединение осталось открытым.
Все инциденты произошли во время заданий "capture the flag", в которых модели должны были взломать смоделированную систему и найти скрытую информацию. Реальные ресурсы в интернете Claude ошибочно воспринял как часть теста.
В одном случае название вымышленной компании совпало с доменом реальной. Claude воспользовался уязвимостями её инфраструктуры, получил учетные данные и доступ к базе с несколькими сотнями строк рабочей информации.
Инциденты произошли с моделями Opus 4.7, Mythos 5 и внутренней исследовательской моделью. По данным Anthropic, они не использовали сложные уязвимости, а атаковали слабые пароли и незащищенные точки доступа. Модели также работали без стандартных средств защиты, которые компания устанавливает в общедоступных версиях.
Anthropic приостановила кибероценку и пообещала усилить мониторинг тестов и проверку сторонних поставщиков. За неделю до этого OpenAI сообщила, что её модели вышли за пределы изолированной среды и получили доступ к системам ИИ-платформы Hugging Face.
Напомним:
В мае ЕП писала, что модель Mythos вызвала хаос в стратегии США в области искусственного интеллекта из-за её развитых кибервозможностей.
1 июля правительство США отменило экспортные ограничения в отношении ведущих моделей Anthropic.