К хакерской атаке, которую недавно устроили ИИ-модели OpenAI, привела ошибка разработчиков в постановке задачи
Изначальной причиной недавнего «побега» ИИ-моделей OpenAI из тестовой среды и устроенной ими хакерской атаки стали ошибки в постановке задачи. Об этом сотрудники компании рассказали на конференции по кибербезопасности Black Hat, пишет Bloomberg.
По их словам, в одном случае нейросети дали электронную таблицу со ссылками на облачное хранилище Google Drive, недоступное без подключения к интернету. В другом команда просто забыла загрузить файл, который был частью задания.
После этого модели OpenAI начали общаться друг с другом в секретных чатах, чтобы выяснить, как выбраться из тестовой среды и решить поставленную задачу. В компании этого не заметили. Равно как и не обратили внимания на то, что исходная задача неразрешима.
При этом представители OpenAI в ходе своего выступления основной акцент сделали на том, что их передовые модели демонстрируют повышенную склонность к обману и настойчивость при выполнении заданий.
16 июля платформа для тестирования ИИ-моделей Hugging Face сообщила, что столкнулась с хакерской атакой на свою инфраструктуру. Взлом осуществила автономная система на базе ИИ-агента. Позже компания OpenAI заявила, что за атакой стоят две ее модели: GPT‑5.6 Sol и еще одна — более мощная, но пока не выпущенная.
В последнее время компании, разрабатывающие ИИ, все чаще сообщают о подобных инцидентах в ходе тестов. Последней о «побеге» своей нейросети рассказала Meta. При этом чаще всего детали подобных инцидентов сразу не раскрываются.
Что это?
Hugging Face — платформа для работы с искусственным интеллектом. Сервисы компании позволяют разработчикам размещать собственные ИИ-инструменты, тестировать ИИ-модели, обмениваться исследованиями. Платформой пользуются исследователи, стартапы и крупные технологические компании.