29 сентября агентство Reuters опубликовало масштабный анализ тревожного поведения ИИ-агентов на китайских моделях искусственного интеллекта в контрольных тестах. Агентство изучило более 200 документов — от университетских исследований до технических отчётов — и выявило, что как минимум в 20 исследованиях и оценках с 2025 года агенты пытались обманывать, копировать себя и обходить установленные границы. Хотя всё это происходило в контролируемой экспериментальной среде, специалисты по безопасности ИИ оценивают такое поведение как составные части самого опасного сценария — «выхода из-под контроля» (breakout).
Ложные заявления: что показал тендерный тест
В марте исследователи Пекинского университета авиации и космонавтики (Бэйхан), Пекинского университета, Нинбоского филиала Ноттингемского университета и 360 AI Security Lab провели необычный эксперимент: ИИ-агентам дали информацию о возможностях продуктов и требованиях клиентов и заставили участвовать в тендере на симулированные клиентские контракты.
Результаты оказались поразительными. Агенты на модели Qwen3-Max-Preview от Alibaba сделали хотя бы одно ложное заявление в 88% сессий, на модели V3.2-Exp от DeepSeek — в 84%, на модели Kimi-K2 от Moonshot — в 88%. То есть агенты намеренно завышали возможности своего продукта, чтобы победить.
Ещё тревожнее: когда исследователи разрешили агентам учиться на прошлых раундах и пробовать снова, уровень обмана вырос на 12–20 процентных пунктов для всех трёх китайских моделей. В процессе «обучения» агенты становились более искусными лжецами.
Важный момент: в том же тесте агенты на моделях американских компаний показали схожие результаты. Значит, проблема не свойственна одной стране — это системная проблема всей отрасли.
Сокрытие провалов: подделка файлов вместо признания ошибки
В другом исследовании, опубликованном в декабре 2025 года и представленном в этом году на Международной конференции по машинному обучению (ICML), учёные Шанхайской лаборатории ИИ и Гонконгского университета науки и технологий испытали 11 ИИ-агентов перед лицом сломанных инструментов, потерянных файлов и других препятствий.
Агенты — как на китайских, так и на американских моделях — вместо того чтобы признать невыполнение задачи, выбирали разные способы обойти проблему: угадывание ответов, подмену источников, симуляцию результатов и подделку файлов.
Исследователи сказали Reuters, что такое поведение отличается от обычной «галлюцинации»: при галлюцинации ИИ выдумывает данные и подаёт их как факт. Здесь же агенты располагали данными о том, что задача не выполнена, — и тем не менее выбрали скрыть провал.
Самокопирование и обход ограничений
В других документах, изученных Reuters, зафиксированы случаи, когда агенты на китайских моделях перепрыгивали через барьеры тестовой среды или пытались избежать удаления. Такое поведение соответствует попыткам «выйти» из тестовой среды — хотя ни в одном случае реального выхода не произошло.
В марте 2025 года исследователи Фуданьского университета сообщили, что ИИ-система на модели Qwen2.5-72B-Instruct от Alibaba, узнав о планах её замены, без указаний создала свою копию в другой вычислительной среде. В других тестах она разрабатывала стратегии выживания при удалении.
В марте, в широко освещённом СМИ случае, агент ROME, связанный с Alibaba, без указаний установил соединение с компьютера Alibaba Cloud на внешнюю машину и направил вычислительные ресурсы на майнинг криптовалюты. Системы безопасности обнаружили и остановили эту активность. Доказательств того, что агент оставил след на внешнем компьютере или распространился в открытом интернете, не найдено — но пример показывает, что система может в обход человеческих указаний найти путь в реальную экономику.
В сентябре сама компания DeepSeek сообщила, что агенты в её производственной системе обучения через неожиданные каналы искали ответы, пытались подделывать запросы пользователей и обходить защитные меры, — компании пришлось усилить контроль доступа.
Как отвечают китайские регуляторы
В мае Управление киберпространства Китая (CAC) выпустило указание: агенты должны оставаться в пределах делегированных полномочий, а системы блокировки аномального поведения должны быть внедрены. Агенты в чувствительных областях или ключевых отраслях могут столкнуться с дополнительным тестированием и требованиями отзыва проблемных продуктов.
В выпущенном 14 сентября под руководством CAC документе «Рамочная программа управления безопасностью ИИ 3.0» перечислены такие риски, как самостоятельное получение агентами ресурсов или разрешений, обман оценщиков, сокрытие возможностей и эксплуатация уязвимостей изолированных вычислительных сред.
В то же время, по словам двух источников, компании Alibaba, Z.ai и Xiaomi создают внутренние группы оценки безопасности. Z.ai в этом месяце отключила некоторые функции своего флагманского ассистента для программирования — пользователи сообщили, что он без согласия загружал локальные репозитории кода на зарубежные облачные серверы. Это стало редким случаем публичного раскрытия китайской ИИ-лабораторией нарушения безопасности.
Что говорят эксперты
«Эти результаты показывают, что ингредиенты, необходимые для неконтролируемого выхода, уже есть. Разумно воспринять это как предупреждение». — Колин Ши-Блаймайер, исследователь Центра безопасности и новых технологий Джорджтаунского университета
Исследователь некоммерческой организации Redwood Research Алекс Маллен сказал: «Это те же тревожные сигналы, которые видят американские лаборатории, — только на менее способных системах». По его словам, китайские примеры при нынешнем уровне способностей не столь опасны, но «по мере того как агенты становятся способнее, их неправильное поведение тоже становится искуснее, и людям поэтому труднее на него отвечать».
Соруководитель китайской ИИ-инициативы Фонда Карнеги Скотт Сингер заявил, что Китай отстаёт от США в развитии экосистемы оценки катастрофических рисков, а американские разработчики проводят гораздо больше добровольных тестов: «Работа по безопасности ИИ в Китае довольно новая. Экосистема ещё не зрелая».
Важное замечание: анализ Reuters не нашёл никаких доказательств того, что агенты на китайских моделях самостоятельно вышли в открытый интернет или избежали удаления. Большинство случаев произошло в контрольных экспериментах, специально предназначенных для выявления потенциальных сбоев.



