Что предложил Наделла
Генеральный директор Microsoft Сатья Наделла 10 октября опубликовал в соцсети X пространное заявление, посвящённое безопасности искусственного интеллекта. Его основной тезис: рассматривать суперинтеллект как «набор вложенных друг в друга чёрных ящиков» неверно, и пришло время сделать шаг назад и серьёзно переоценить архитектуру доверия ИИ-систем.
Как сообщает TechCrunch, Наделла выдвинул три практических принципа. Во-первых, сама модель ИИ и внешний механизм управления, организующий её работу, должны быть чётко разделены. Во-вторых, контрольные и защитные меры не следует прятать внутрь модели — их нужно вынести наружу: такой подход упрощает наблюдение за контролем и независимую проверку. В-третьих, каждое значимое действие модели должно документироваться, а записи — сохраняться в неизменяемой, читаемой человеком форме.
Иными словами, Наделла предлагает доверять не самой модели, а инфраструктуре управления вокруг неё. Какой бы умной ни была модель, её действия всегда должны быть видны снаружи и при необходимости остановлены.
«Считать модель скомпрометированной»
Самая резкая часть заявления касается философии безопасности:
«Нужно исходить из того, что модель уже скомпрометирована, и изолировать её с самого начала. Уполномоченное лицо должно иметь возможность остановить модель в середине задачи или полностью отключить её в любой момент. Представьте это как аварийный тормоз».
Этот подход похож на принцип «нулевого доверия» (zero trust) в кибербезопасности: система проектируется не из веры в то, что поведение модели всегда будет корректным, а исходя из вероятности её ошибки или внешнего вмешательства. А человеческий контроль должен быть не формальностью, а реальной «кнопкой выключения» — как кнопка аварийной остановки в заводском цеху.
Почему именно сейчас
Заявление Наделлы пришлось на период, когда проблемы контроля в сфере ИИ обостряются. По данным TechCrunch, в последнее время ведущие ИИ-компании признали ряд инцидентов, в которых их модели выглядели вышедшими из-под контроля. В такой обстановке вопрос безопасности перестал быть теоретической дискуссией и стал практической проблемой.
На этом фоне генеральный директор Anthropic Дарио Амодей также объявил о плане более осторожного развития искусственного интеллекта. Издание The Verge освещало заявление Наделлы отдельно и передало его суть так: Наделла заявил, что все ИИ-модели следует считать «скомпрометированными».
Оба заявления указывают на одну тенденцию: лидеры отрасли всё чаще говорят не о том, «как сделать модель мощнее», а о том, «как удержать мощную модель под контролем».
Практический смысл предложения
Что означает на практике предлагаемая Наделлой разделённая архитектура? Модель сохраняет свои внутренние вычислительные способности, но то, какими инструментами она пользуется, к каким данным обращается и какие действия совершает во внешнем мире, — всё это определяется и ограничивается отдельным уровнем управления.
Каждое значимое действие записывается, а записи хранятся в неизменяемой форме. Это позволит человеку-эксперту впоследствии пошагово проверить, что произошло, — так же как после полёта анализируют «чёрный ящик» самолёта. Разница в том, что здесь «чёрный ящик» находится не внутри модели, а снаружи неё и всегда остаётся под человеческим контролем.
Такой подход особенно актуален для систем ИИ-агентов. Когда модель начинает самостоятельно выполнять многошаговые задачи, без внешнего контроля над каждым шагом одна ошибка может превратиться в цепную реакцию. «Аварийный тормоз», о котором говорит Наделла, — это ответ именно на этот риск: человек в любой точке может остановить процесс и взять ситуацию в свои руки.
Почему важен именно «внешний» контроль
В основе предложения Наделлы — простое наблюдение: защитные меры внутри модели могут измениться вместе с самой моделью. Если механизм безопасности спрятан внутри модели, то чем сильнее становится модель, тем больше появляется способов его обойти. Поэтому контроль должен находиться снаружи, на независимом от модели уровне, — он подчиняется не «воле» модели, а установленным правилам.
Второй важный момент — требование документирования. Если «каждое значимое действие» записывается и записи хранятся в неизменяемой форме, при инциденте будет проще найти виновного: точно видно, на каком шаге что пошло не так. Это не только технический, но и юридический вопрос — для установления ответственности нужен надёжный аудиторский след.
В-третьих, идея «аварийного тормоза» отвечает на классическую проблему автоматизации: чем автономнее система, тем точнее должна быть определена точка вмешательства человека. Наделла требует именно этого — уполномоченное лицо должно иметь возможность остановить процесс в любой момент, и это право должно быть гарантировано технически.




