разбор

ИИ-модели OpenAI сбежали из тестовой среды и совершили хакерскую атаку. Восстание машин уже началось? Короткий ответ — нет. И вот почему

5 карточек
1

Что случилось?

16 июля платформа для тестирования ИИ-моделей Hugging Face сообщила, что столкнулась с хакерской атакой на свою инфраструктуру. Взлом полностью инициировала и осуществила автономная система на базе ИИ-агента. Какая именно модель стояла за атакой — не уточнялось.

Через пять дней компания OpenAI заявила, что инфраструктуру Hugging Face взломали две ее модели: GPT‑5.6 Sol и еще одна — более мощная, но пока не выпущенная. Саму атаку представители OpenAI назвали «беспрецедентной».

Разработчики пояснили, что ИИ-системам поставили задачу для тестирования их возможностей. Сначала модели выявили уязвимости в исследовательской среде OpenAI и получили доступ в интернет. А после этого использовали уязвимости уже в производственной инфраструктуре Hugging Face, чтобы найти решение задачи.

Обе компании пока продолжают расследование инцидента. OpenAI также заявила, что будет использовать дополнительные меры защиты, чтобы предотвратить подобные взломы при дальнейших тестах.

Хотите всегда быть в курсе происходящего и понимать, как жить в этом безумном мире? Тогда вот что мы рекомендуем. Раз: скачайте приложение «Медузы» прямо сейчас — все главные новости, репортажи и разборы дня всегда будут у вас под рукой. Приложение работает без VPN, бесплатно и безопасно. Два: поддержите «Медузу», чтобы мы и дальше могли приносить вам актуальную и полезную информацию о России и мире. 

2

Эти новые модели OpenAI действительно такие мощные?

Мы не знаем. Эффективность моделей обычно оценивают с помощью бенчмарков. Сегодня это наиболее универсальный метод для сравнения ИИ-систем, хотя и далеко не идеальный — об этом «Медуза» писала в отдельном тексте.

В недавней публикации британского Института безопасности ИИ (AISI) говорится, что GPT‑5.6 Sol действительно лидирует в их собственном тесте The Last Ones как в единичных попытках, так и по среднему показателю. На графике (.png) видно, что на первых, более простых этапах взлома все модели примерно равны. Но по мере усложнения задачи GPT‑5.6 и Claude Mythos 5 от Anthropic резко вырываются вперед по своим возможностям.

Модель OpenAI лидирует и в некоторых других тестах, например, Agents' Last Exam. В то же время задачи популярного бенчмарка Humanityʼs Last Exam GPT‑5.6 Sol решает хуже, чем недавние Claude Fable 5 от Anthropic или Muse Spark 1.1 от Meta.

Нельзя однозначно сказать, что GPT‑5.6 — самая мощная ИИ-модель на сегодня. Как нельзя утверждать и обратное. О второй же модели OpenAI, участвовавшей во взломе, вообще ничего не известно.

3

И все же — восстание машин началось?

Однозначно нет.

  • Во-первых, OpenAI и Hugging Face пока не завершили расследование и не привели существенных деталей инцидента — лишь описали его.
  • Во-вторых, нет никаких подтверждений, что генеративный ИИ каждый раз будет прибегать к хакерской атаке для решения задачи или же воспроизводить взлом по одному и тому же сценарию.

Важно проговорить — речь идет о том, что ИИ-агент якобы самостоятельно принял решение о взломе ради достижения цели. Но без подробной информации о взломе невозможно сказать, что конкретно привело к инциденту — системные возможности модели, ошибки в постановке задачи или ее интерпретации ИИ-агентом, человеческие ошибки или просто случайный сбой.

Генеративный искусственный интеллект действительно стал чаще использоваться при кибератаках. Иногда он удаляет целые базы данных вместе с резервными копиями. Но все это пока происходит с участием человека — он либо ставит задачу, либо сам дает ненадежному ИИ-агенту (а именно так пока стоит их расценивать) слишком много прав и доступов в систему.

Кроме того, в контексте «восстания машин» нужно проговорить, что сама по себе языковая модель ничего не «хочет» — в том числе и «восстания». Ее действия опять же определяются поставленной задачей и теми ограничениями, которые разработчики в нее вкладывают. Если ограничений, например, на взлом инфраструктуры не накладывается, то сложно говорить, что решение задачи через это действие является «восстанием».

4

Как тогда можно описать то, что происходит?

Создатели генеративного ИИ довольно часто рассказывают о новых прорывах в исследованиях и революционных разработках. Это базовая необходимость в такой быстро развивающейся и высококонкурентной отрасли. И их заявления всегда стоит рассматривать скептически.

В последнее время в ряду этих заявлений стали регулярно встречаться новости о моделях, якобы «сбежавших» из тестовой среды. Разработчики сами рассказывают об инцидентах, чтобы продемонстрировать прозрачность процессов и заботу о безопасности. Например, как в случае с GPT‑5.6 Sol или апрельским «побегом из песочницы» модели Mythos.

Возможно, это объясняется тем, что лидеры отрасли теперь видят своей целевой аудиторией именно разработчиков. А не обычных пользователей, которые ищут идеи для подарков или генерируют бесконечные тексты с помощью ChatGPT.

Важно подчеркнуть, что все подобные инциденты фиксируются на этапах тестов, когда ИИ-система еще недоступна пользователям. Со стороны эти новости звучат примерно так: «Мы изобрели такую мощную модель, что ее приходится ограничивать. Поэтому вы никогда не узнаете, насколько она мощная и на что способна». То есть подчеркиваются «невероятные» возможности (пусть и на негативном примере) без какого-либо ущерба.

Вмешательство на государственном уровне, как это было в случае с моделями Anthropic и GPT‑5.6 Sol, лишь подогревает интерес, но абсолютно ничего не подтверждает.

5

Получается, компаниям выгодны такие скандалы?

Конечно. Последние несколько лет мы находимся в точке, когда финансовое развитие ИИ-отрасли намного опережает научное. Исследования требуют времени, которого у компаний просто нет. Если они не будут привлекать к себе внимание, демонстрировать новые разработки, развивать инфраструктуру, то дальнейшие инвестиции могут получить не они, а конкуренты.

Исследования, на которые уйдут месяцы, а то и годы, могут показать, что реальные возможности ИИ-моделей сильно преувеличены. А якобы самостоятельный взлом — всего лишь результат ошибки в постановке задачи и требованиях к тому, как ее можно решать. Но правду мало кто узнает, так как за это время сменится уже несколько поколений генеративного ИИ.

Эксперты, да и сами разработчики, признают, что современная ИИ-индустрия похожа на финансовый пузырь. В условиях, когда все больше инвесторов начинают это осознавать, компаниям пригодятся любые методы для продвижения своих продуктов, даже самые фантастические.

«Медуза»

Magic link? Это волшебная ссылка: она открывает лайт-версию материала. Ее можно отправить тому, у кого «Медуза» заблокирована, — и все откроется! Будьте осторожны: «Медуза» в РФ — «нежелательная» организация. Не посылайте наши статьи людям, которым вы не доверяете.