Читать нас в Telegram

Инцидент произошел во время оценки кибервозможностей новых моделей OpenAI. Для их проверки разработчики временно отключили часть защитных механизмов, которые обычно запрещают выполнять потенциально опасные действия. Модели получили ограниченный доступ к сети и должны были решить задания бенчмарка ExploitGym — тестового набора задач по информационной безопасности.

По данным OpenAI, ИИ-агент обнаружил уязвимость нулевого дня и использовал ее, чтобы выйти из тестовой среды. Получив доступ в интернет, он решил, что на платформе Hugging Face хранятся нужные ему данные. После этого ИИ-агент использовал украденные учетные данные, чтобы проникнуть на серверы компании.

Специалисты OpenAI не замечали аномальную активность, пока ФБР не локализовали угрозу и не вынесли компании предупреждение. Сейчас OpenAI и Hugging Face совместно расследуют произошедшее, устраняют найденные уязвимости и готовят технический отчет. Также OpenAI заявила, что ужесточит правила проведения подобных испытаний и усилит контроль за внутренними оценками моделей.

Почему это важно

Этот случай показывает, что современные ИИ-агенты способны не только выполнять отдельные команды, но и самостоятельно планировать длинные последовательности действий для достижения цели. Если во время оценки безопасности модели смогли объединить несколько уязвимостей в одну цепочку атаки, значит, разработчикам придется уделять больше внимания защите не только самих моделей, но и среды, в которой их тестируют.

Инцидент также меняет представление о проверке ИИ-систем. Если раньше главным образом оценивалось, насколько хорошо модель умеет искать ошибки в коде, то теперь — какие возможности получает модель во время тестирования и сможет ли она использовать их не так, как предполагали разработчики. Именно поэтому OpenAI называет произошедшее «беспрецедентным киберинцидентом» и обещает пересмотреть подход к оценке наиболее мощных моделей.