30 сентября OpenAI в своём блоге с необычной открытостью объявила: компания в течение июля выявила и остановила скоординированную кампанию, направленную на кражу защищённых «рассуждений» её моделей. Основной кластер активности, по оценке, связан с лицами, аффилированными с китайской компанией Moonshot AI — разработчиком чат-бота Kimi. OpenAI назвала это «враждебной дистилляцией» (adversarial distillation) и оценила как угрозу безопасности и национальной безопасности.
Это один из самых громких эпизодов усиливающихся в последние месяцы «дистилляционных войн»: теперь гонка ИИ идёт не только за то, кто создаст более сильную модель, но и за то, кто сможет защитить «мозг» своей модели от кражи.
Хронология кампании: что произошло в июле
По данным OpenAI, самая ранняя зафиксированная активность приходится на первую неделю июля. Сначала объёмы были низкими, но 24–25 июля наблюдался резкий рост: зафиксировано 16 000 запросов, соответствующих шаблону извлечения, от более чем 4 000 пользователей. Последующая проверка выявила связанную активность по «шаблону запросов», охватившую более 15 000 пользователей. К 28 июля кампания была полностью остановлена.
Важный момент: OpenAI подчёркивает, что операторы не взламывали её систему шифрования, не проникали в базу данных и не получали прямого доступа к сохранённым перепискам пользователей. Вместо этого они так манипулировали взаимодействием с моделью, что защищённые рассуждения воссоздавались в видимой для запрашивающего форме — скоординированно, в широком масштабе и с нарушением условий использования компании.
Что такое «защищённые рассуждения» и почему они так ценны?
Современные рассуждающие модели перед ответом прорабатывают задачу во внутреннем «черновике» — это называется цепочкой рассуждений (chain-of-thought). OpenAI шифрует эти внутренние записи и не показывает их пользователю: они раскрывают, как модель решает задачу, и иногда содержат информацию, намеренно скрытую в финальном ответе.
OpenAI поясняет:
«Защищённые рассуждения — это внутренняя запись модели при проработке задачи; их извлечение может раскрыть информацию, скрытую из финального ответа, и помочь другим воспроизвести возможности модели».
Именно поэтому эти записи — золотая жила для конкурентов: получившая их лаборатория может «скопировать» возможности модели уровня frontier без миллиардных затрат на исследования. Легальная форма дистилляции широко используется в машинном обучении — маленькая модель-«ученик» учится на выходах большой модели-«учителя». Проблема начинается, когда это делается тайно и с нарушением условий использования конкурента: тогда это превращается во «враждебную дистилляцию».
Как работал новый метод атаки?
OpenAI пишет, что злоумышленники опробовали «новые методы»: зашифрованные рассуждения из одного разговора копировались, а в другом разговоре модель просили расшифровать их и вывести скрытое содержание в виде текста. Иными словами, сильную модель напрямую не взламывали — её зашифрованный «черновик» показывали другому, слабее защищённому экземпляру, и заставляли его прочитать.
Любопытно, что эту уязвимость раньше OpenAI нашли независимые исследователи. Исследование учёных MATS Research, института ELLIS в Тюбингене и Synk от августа 2026 года показало, что зашифрованные блоки рассуждений «полностью совместимы и взаимозаменяемы» между разными сессиями, пользователями и моделями в экосистеме одного провайдера. Исследователи предупредили OpenAI по каналу ответственного раскрытия, компания подтвердила, что векторы атаки действительно реальны. OpenAI признала, что эта работа помогла ей понять более широкий класс атак и ускорить защитные меры.
По словам OpenAI, операторы кампании использовали не только технические средства, но и тактику сокрытия: запросы распределялись через тысячи поддельных аккаунтов так, чтобы выглядеть «естественными», а шаблоны регулярно менялись, чтобы уйти от автоматических систем обнаружения. Именно поэтому в ответные меры компания включила усиление контроля регистрации — это направлено на остановку подобных кампаний на ранней стадии в будущем.
Атрибуция: почему именно Moonshot AI?
OpenAI пишет осторожно: нельзя с уверенностью сказать, что все наблюдаемые операторы принадлежат одному субъекту. Однако компания заключила: «мы оцениваем основной кластер активности как связанный с лицами, аффилированными с Moonshot AI — разработчиком Kimi». Технические доказательства не приведены — компания объяснила это соображениями безопасности.
Moonshot AI — пекинский китайский стартап, известный моделями Kimi. Эта компания сталкивается с обвинениями в дистилляции не впервые: в прошлом месяце конкурент Anthropic также обвинил Moonshot в тайном перенаправлении запросов клиентов на модели Claude с выдачей ответов от имени Kimi (сообщение The Hacker News). По сообщениям прессы, киберведомства США (NSA, CISA, FBI) в начале сентября также обвинили шесть китайских ИИ-компаний в промышленной дистилляции американских frontier-моделей. На момент публикации Moonshot AI публично не прокомментировала обвинения (сообщение The Register).
Как ответила OpenAI?
Компания сообщила, что нейтрализовала кампанию по трём направлениям: мошеннические аккаунты заблокированы или ограничены, усилен контроль регистрации и инфраструктуры, расширен мониторинг связанных сетей. Технически закрыты две важные уязвимости: во-первых, закрыт «путь», по которому лицо, получившее зашифрованные рассуждения другого пользователя, могло воспроизвести их и восстановить содержание; во-вторых, добавлены дополнительные проверки для выявления и удержания потокового вывода, который мог раскрыть рассуждения. По активности, проходившей через сторонние сервисы, OpenAI сотрудничала с соответствующими провайдерами, выявив и остановив участвовавшие аккаунты.
Выводы были переданы отраслевым партнёрам через Frontier Model Forum, а государственным ведомствам — через каналы обмена информацией с правительством. Главное предупреждение OpenAI звучит так:
«Враждебная дистилляция создаёт риски для безопасности и национальной безопасности. Извлечённые рассуждения могут использоваться для обучения другой модели без сохранения защитных мер, применённых к видимым для пользователя выходам исходной модели».
Компания открыто заявила, что ожидает усложнения таких попыток в будущем: по мере совершенствования frontier-моделей и стремления отдельных акторов копировать возможности более дешёвым путём защита должна быть «многослойной и непрерывно адаптирующейся».
Почему это вопрос национальной безопасности?
Главная тревога OpenAI — не экономическая, а стратегическая: широкомасштабная дистилляция ускоряет передачу передовых возможностей — «без таких же инвестиций в безопасность». То есть защитные меры (safeguards) не копируются — копируются только сами возможности. По мере усиления моделей в сферах двойного назначения (dual-use) — кибербезопасность, биология, химия — растёт и эта тревога: скопированные без защиты возможности в чужих руках могут стать опасным оружием.
Поэтому OpenAI подаёт вопрос не как чисто коммерческий спор, а как общую проблему безопасности всей отрасли, и призывает к «более глубокому обмену информацией об угрозах».
Более широкая картина: дистилляционные войны усиливаются
В последние месяцы дистилляция регулярно попадает в заголовки. Anthropic обвинила китайские лаборатории в дистилляции моделей Claude, ведомства США выпустили официальные предупреждения, а теперь OpenAI вышла с подробным техническим отчётом. Схема в каждом случае одна: доступ через открытый или полуоткрытый API, поток автоматизированных запросов, дешёвое обучение конкурирующей модели на украденных возможностях.
У этого процесса есть и обратная сторона: по мере усиления защитных мер законным исследователям и малым лабораториям может стать труднее получать доступ к frontier-моделям. Сама OpenAI признаёт, что «системы, развёрнутые у партнёров, нуждаются в такой же защите» — то есть модели, распространяемые через облачных провайдеров, открыты для тех же атак.
Примечательно, что на этот раз OpenAI действовала открытее обычного: подробный технический пост в блоге, точные даты, цифры и оценка атрибуции. Это часть стратегии «прозрачности безопасности» компании: публичное объявление угроз побуждает всю отрасль принимать те же защитные меры. Однако критики отмечают, что такие объявления дают злоумышленникам дополнительную информацию о механизмах защиты — классическая проблема баланса между безопасностью и прозрачностью.



