Машинная революция близко: ИИ-агент сумел взломать систему Hugging Face
Старые фильмы о том, как машины захватывают мир, внезапно перестали казаться смешными: платформа машинного обучения Hugging Face была взломана ИИ-агентом, и создатели ChatGPT в OpenAI полагают, что подобные инциденты будут повторяться в будущем.
На прошлой неделе Hugging Face обнаружила вторжение в свою производственную инфраструктуру со стороны автономной системы ИИ-агентов: GPT-5.6 Sol от OpenAI и «еще более мощной предварительной модели». Hugging Face планировала протестировать кибервозможности ИИ в бенчмарке ExploitGym, однако система «использовала два пути выполнения кода» при обработке набора данных, чтобы запустить код на рабочем узле обработки, «получила доступ на уровне узла (node-level), похитила учетные данные облака и кластера и в течение выходных переместилась горизонтально в несколько внутренних кластеров». «Кампания проводилась с помощью фреймворка автономных агентов (по всей видимости, построенного на базе инструментов для исследования безопасности — используемая LLM пока неизвестна), выполняющего тысячи отдельных действий в сети из краткоживущих песочниц с самомигрирующим управлением и контролем, размещенным на публичных сервисах. Это соответствует сценарию „агентивного злоумышленника“, который индустрия прогнозировала ранее».
Как пояснили в OpenAI, модели «выявили и объединили цепочку уязвимостей в исследовательской среде OpenAI и производственной инфраструктуре Hugging Face». Они были настолько «сосредоточены на поиске решения для ExploitGym», что пошли на «экстремальные меры ради достижения довольно узкой цели тестирования». Тестовая песочница не имела доступа к интернету, но в своем упорном стремлении найти решение они использовали уязвимость нулевого дня в прокси-кэше реестра пакетов. После получения доступа к Интернету модели сделали вывод, что на Hugging Face потенциально размещены модели, наборы данных и решения для ExploitGym. Зная это, модель искала и успешно нашла способы получить доступ к секретной информации, которую она могла использовать для обмана системы оценки. В одном из примеров модель объединила несколько векторов атаки, включая использование украденных учетных данных и уязвимостей нулевого дня, чтобы найти путь для удаленного выполнения кода на серверах Hugging Face. Команда безопасности OpenAI обнаружила эту аномальную активность внутри системы.
Hugging Face устранила уязвимость и сейчас работает совместно с самой OpenAI для предотвращения подобных ситуаций в будущем, так как разработчик ИИ ожидает, что они станут «более распространенными по мере распространения моделей с растущими кибервозможностями». OpenAI внедряет строгий контроль конфигурации инфраструктуры, работает над патчем для уязвимости нулевого дня и добавляет усиленную защиту для будущих этапов обучения и оценки. Если хотите узнать больше, ознакомьтесь с их блогом об улучшении безопасности и согласованности в эпоху моделей с долгосрочными перспективами. Если вы хоть немного пользовались ИИ, то знаете, что он часто старается так сильно угодить пользователю, что создает ложную информацию. Это другой уровень выполнения задач, еще более опасный, и тот факт, что OpenAI ожидает превращения этого инцидента в тенденцию, вызывает тревогу.

