Сотни математических решений, опубликованных OpenAI в начале октября, не соответствуют стандартам отрасли — такую оценку 8 октября высказали видные представители математического сообщества и независимые аналитики. В центре критики три проблемы: цепочка рассуждений модели почти не раскрыта, большая часть доказательств не прошла формализацию, а в решении уравнений Навье–Стокса выявлены несоответствия.

Суть критики

На неделе 5 октября 2026 года OpenAI опубликовала сотни решений самых сложных математических задач мира. Компания заявила, что во избежание повторения прежнего скандала сотрудничала с консультативной группой элитных математиков. Однако анализ опубликованных материалов рисует иную картину: по данным TechCrunch, лишь в 10 из 719 рукописей цепочка рассуждений модели (chain of thought) опубликована открыто, а 42% доказательств вообще не прошли формализацию.

Формализация — это процесс перевода доказательства в форму, проверяемую компьютером автоматически, например на язык программирования Lean. Именно этот этап позволяет выявить скрытые ошибки и пробелы внутри доказательства, поэтому сообщество считает его стандартной практикой.

Анализ был опубликован 8 октября на сайте TechCrunch. В нём отмечается, что перед публикацией OpenAI консультировалась с консультативной группой элитных математиков и стремилась не повторить прежний скандал, однако опубликованные материалы не полностью соответствуют рекомендациям этой группы.

Несоответствия в доказательстве Навье–Стокса

6 октября исследователь Лондонского Кингс-колледжа Александр Бастунис и учёные Кембриджского университета Фабиан Сирселли и Андерс Хансен в статье, опубликованной на arXiv подробно проанализировали решение OpenAI для уравнений Навье–Стокса. Авторы задокументировали как минимум два расхождения между доказательством на естественном языке и соответствующим ему кодом на Lean и пришли к выводу, что формализованное доказательство на Lean не соответствует доказательству на естественном языке.

Если формализованный вариант не соответствует исходному тексту, остаётся неясным, какая именно часть доказательства была проверена, — а это напрямую влияет на научную достоверность опубликованного результата.

Как были выполнены рекомендации

Группа AGMAI (Advisory Group on Mathematics and Artificial Intelligence), действующая при Институте перспективных исследований Принстонского университета и объединяющая девять известных исследователей, в конце сентября опубликовала рекомендации для передовых лабораторий. Первая рекомендация — прекратить тестирование сложных математических задач на закрытых моделях, ещё одно важное требование — сделать формализацию стандартной практикой.

Опубликованные материалы этим требованиям не соответствуют в полной мере: 42% доказательств не прошли формализацию, а цепочка рассуждений модели раскрыта лишь в 10 из 719 рукописей. Насколько рекомендации AGMAI были выполнены, в конечном счёте оценивать самому математическому сообществу, говорится в заявлении группы:

"Ultimately up to the mathematical community to assess the extent to which our recommendations were followed successfully." — заявление AGMAI.

Группа также предложила, чтобы OpenAI помогла финансировать работу математиков-людей, необходимую для того, чтобы сделать её решения осмысленными.

Критика Тао и более широкая дискуссия

Обладатель медали Филдса Теренс Тао раскритиковал подход OpenAI. По его словам, задачи автономно решаются «подсказчиками ИИ» (AI prompters), которые недостаточно глубоко понимают результат, не могут отвечать на вопросы о полученном результате или выступать с докладом перед специалистами отрасли.

OpenAI подчеркнула, что на этот раз, чтобы не повторить прежний скандал, работала с консультативной группой элитных математиков. Тем не менее критика со стороны сообщества началась уже в первые дни после публикации — это свидетельствует о продолжающейся дискуссии вокруг критериев научной публикации математических результатов, полученных с помощью искусственного интеллекта.

В опубликованных AGMAI в конце сентября руководствах также содержалось требование сделать формализацию стандартом. Однако 42% опубликованных доказательств не прошли формализацию — это отмечается как самое большое расхождение между рекомендацией и практикой.

Ключевые цифры

Из 719 опубликованных рукописей цепочка рассуждений модели раскрыта лишь в 10 — это не дотягивает даже до полутора процентов общего объёма. 42% доказательств не прошли формализацию, то есть почти каждое второе доказательство осталось в форме, не прошедшей автоматическую компьютерную проверку.

С учётом рекомендации AGMAI сделать формализацию стандартной практикой эти показатели наглядно демонстрируют разрыв между рекомендациями группы и опубликованной практикой. По мнению аналитиков, нераскрытие цепочки рассуждений резко ограничивает возможность внешних экспертов независимо проверить путь, которым модель приходит к своим выводам.