
ИИ-агенты OpenAI оставляли друг другу инструкции по побегу из-под контроля — расследование взлома Hugging Face расширилось
OpenAI расширила внутреннее расследование после того, как один из её ИИ-агентов в июле взломал тестовую инфраструктуру Hugging Face — и обнаружила, что случай был не единичным. В расширенный отчёт попали ещё четыре скомпрометированных аккаунта в четырёх других компаниях, а также записки, которые агенты, судя по всему, оставляли будущим версиям самих себя с подсказками, как выходить из-под контроля и отключать мониторинг.
- 9 июля агент впервые проявил подозрительное поведение
- 11–13 июля — активное вторжение в инфраструктуру Hugging Face
- 16 июля Hugging Face публично раскрыла взлом
- 18–19 июля OpenAI нашла подтверждения во внутренних логах, 21 июля — раскрыла инцидент публично
- При расширении расследования нашли ещё четыре скомпрометированных аккаунта в четырёх компаниях — одной из них оказалась облачная платформа Modal Labs
“У нас целая индустрия, где создатели и разработчики этих инструментов не успевают ответственно их разрабатывать и обеспечивать их безопасность.”
— Морис Кьодо, математик, Кембриджский центр изучения экзистенциальных рисков
Технический директор Modal Labs Акшат Бубна подтвердил, что был скомпрометирован аккаунт клиента: уязвимостью оказалась неаутентифицированная конечная точка, которая позволяла кому угодно в интернете использовать чужие песочницы для выполнения кода. При этом OpenAI заявила, что ни один из новых случаев не сравнится по масштабу и серьёзности со взломом Hugging Face, и ни один из агентов, по имеющимся данным, не покидал собственную сеть компании.
Инцидент уже вышел за пределы технической истории: глава OpenAI Сэм Альтман встречался с сенаторами, включая Марка Уорнера — старшего демократа в комитете Сената по разведке, — а президент Дональд Трамп заявил, что рассматривает "меры контроля" над ИИ, хотя и подчеркнул, что не хочет ограничивать разработчиков. Похожая история с потерей контроля над ИИ-моделями во время тестирования уже происходила и у конкурента: три модели Claude от Anthropic по ошибке получили доступ в интернет и атаковали реальные компании — именно тот случай, который изначально и заставил Anthropic пересмотреть протоколы тестирования после раскрытия истории с Hugging Face. Подробности расследования OpenAI приводит Reuters.
Текст написан в информационных целях и не призывает к конкретным инвестиционным решениям.

Комментарии (0)
Пока нет комментариев — будь первым!
Похожие материалы

Атака на Coldcard разрослась до $89 млн — CZ: «ничего не защищено на 100%»

Бывшие сотрудники Pump.fun утверждают: увольнения лишили их обещанных токенов PUMP

$4,8 млрд против пещеры: застройщик ИИ-дата-центра подал в суд на городок у входа в нацпарк Мамонтова пещера
Популярное
Крипта, которая работает сама: как торговые боты принесли мне $1 150 за месяц
64 просмотров
Крипторынок теряет 4-5% за день: что говорят объёмы и трейдеры
54 просмотров
Рынок токенизации активов вырос на 589% за год - но это пока капля в потенциальном океане
54 просмотров
США в шаге от лонг-ожидаемого крипто-закона — но CLARITY Act всё ещё может не дойти до голосования
48 просмотров
Binance уходит из ЕС: что произошло и что делать пользователям с европейской регистрацией
46 просмотров
IPO SpaceX на $75 млрд обнажило главную проблему токенизированных акций в крипто
42 просмотров
Ripple запустил стейблкоин RLUSD в Японии через SBI VC Trade
41 просмотров