Google 8 октября 2026 года официально представил новый флагманский искусственный интеллект — модель Gemini 3.0 Pro. По заявлению компании, модель установила новые рекорды в 27 публичных бенчмарках и поддерживает контекстное окно на 1 миллион токенов. Это — крупное обновление поколения после предыдущего флагмана Gemini 2.5 Pro.
Google одновременно анонсировал всех трёх членов семейства Gemini 3 — Pro, Flash и Nano. Модель открыта по трём основным каналам: приложение Gemini, подписки Google AI Pro и Ultra, а также Gemini API и Vertex AI для разработчиков.
Новые рекорды в бенчмарках
По опубликованным Google показателям, Gemini 3.0 Pro превзошёл прежние лучшие результаты в каждом из 27 измеренных бенчмарков. В официальном заявлении компании подчёркивается, что новые рекорды установлены во всех 27 тестах. Ниже — десять показателей, которые компания выделила особо.
В LMArena — общем рейтинге моделей искусственного интеллекта — Gemini 3.0 Pro набрал 1501 балл, что выше прежнего рекорда в 1458 баллов. В тесте ARC-AGI-2, измеряющем логическое мышление и способность решать сложные задачи, результат вырос с 31,1% до 37,5%. В Terminal-Bench 2.0, предназначенном для программных агентов, работающих в терминальной среде, показатель вырос с 35,5% до 43,8%.
В подборке экспертных вопросов Humanity's Last Exam модель показала 37,5% вместо 33,0%. В тесте по научным вопросам GPQA Diamond зафиксирован рост с 89,8% до 93,8%. В SWE-Bench Verified, оценивающем задачи программной инженерии, результат вырос с 89,8% до 93,2%.
В Tau2-Bench Telecom, предназначенном для агентских задач в телекоммуникационной отрасли, показатель улучшился с 82,6% до 91,0%. В Vending Bench 2, проверяющем долгосрочное планирование и управление ресурсами, результат вырос с 51,5% до 66,0%. В тесте FACTS Grounding, проверяющем опору ответов на факты и их надёжность, показатель вырос с 75,1% до 81,0%. В MRCR v2, измеряющем способность к запоминанию в длинном контексте, результат вырос с 61,0% до 73,0%.
Наибольшие скачки наблюдались в тестах, связанных с долгосрочным планированием и памятью: в Vending Bench 2 рост составил 14,5 процентного пункта, в MRCR v2 — 12 процентных пунктов, в Tau2-Bench Telecom — 8,4 процентного пункта и в Terminal-Bench 2.0 — 8,3 процентного пункта. Эти цифры означают, что модель одновременно превзошла прежние лучшие показатели сразу в десятках разных направлений — от логического мышления до программирования и агентских задач.
Анализ десяти показателей: что измеряет каждый тест
Каждый из десяти тестов выше измеряет отдельную способность модели. Их содержание и значение — ниже.
LMArena — общий рейтинг. Здесь модели разных компаний сравниваются вслепую: пользователи видят два анонимных ответа, выбирают лучший, и на этой основе формируется рейтинг. Gemini 3.0 Pro набрал 1501 балл при прежнем рекорде 1458. Поскольку этот показатель строится на оценках реальных пользователей, он отражает качество модели в повседневных задачах.
ARC-AGI-2 — логическое мышление. Тест измеряет способность модели решать новые, ранее не встречавшиеся задачи: здесь заученные ответы не помогают, проверяется только способность к обобщению. Результат вырос с 31,1% до 37,5%. Этот показатель отражает уровень самостоятельного мышления модели в нестандартных ситуациях.
Terminal-Bench 2.0 — терминальные агенты. Этот тест оценивает навыки модели как программного агента, работающего в терминальной среде: выполнение команд, работа с файлами, самостоятельное завершение многошаговых заданий. Показатель вырос с 35,5% до 43,8% — прирост 8,3 процентного пункта. Агентские способности в терминале — один из самых практических показателей для разработчиков, поскольку они определяют возможность подключения модели к реальному рабочему процессу.
Humanity's Last Exam — экспертные знания. Это подборка вопросов экспертного уровня из разных научных областей, в составлении которой участвовали сотни учёных. Результат модели вырос с 33,0% до 37,5%. Высокий результат в этом тесте показывает, что модель способна отвечать на вопросы, требующие глубоких научных и профессиональных знаний.
GPQA Diamond — научные вопросы. Это набор сложных вопросов высокого уровня по физике, химии и биологии. Результат вырос с 89,8% до 93,8%. Результат такого уровня — показатель потенциала модели как помощника в научных исследованиях.
SWE-Bench Verified — программирование. Этот тест составлен на основе задач программной инженерии из реальных проектов: модель должна находить ошибки и исправлять их. Результат вырос с 89,8% до 93,2%. Этот показатель измеряет практическое мастерство в написании кода и решении проблем.
Tau2-Bench Telecom — телеком-агенты. Этот тест оценивает агентские задачи в телекоммуникационной отрасли — многошаговые процессы вроде обслуживания клиентов и управления услугами. Показатель улучшился с 82,6% до 91,0%. Это направление важно для применения ИИ-агентов в корпоративных сервисах.
Vending Bench 2 — долгосрочное планирование. Этот тест проверяет модель в длительной симуляции, требующей управления ресурсами: модель должна длительное время самостоятельно принимать решения и достичь поставленной цели. Результат вырос с 51,5% до 66,0% — скачок на 14,5 процентного пункта, самый большой среди десяти показателей. Этот тест измеряет самое сложное место агентских систем — долгосрочную последовательность.
FACTS Grounding — обоснованность фактов. Этот тест проверяет, опираются ли ответы на заданные источники и насколько они надёжны: модель не должна выдумывать данные. Показатель вырос с 75,1% до 81,0%. Надёжные ответы имеют решающее значение в корпоративном применении.
MRCR v2 — память длинного контекста. Этот тест измеряет способность модели находить и запоминать нужную информацию внутри очень длинных текстов. Результат вырос с 61,0% до 73,0% — прирост 12 процентных пунктов. Именно эта способность даёт практическую разницу при работе с длинными документами и напрямую связана с контекстным окном на 1 миллион токенов.
В целом самые высокие темпы роста наблюдались в агентских направлениях и в работе с памятью: скачки в Vending Bench 2, MRCR v2, Tau2-Bench Telecom и Terminal-Bench 2.0 показывают, что возможности модели как самостоятельно работающего агента усилились.
Где и для кого доступна модель
Использование модели организовано по трём основным каналам.
Первый канал — приложение Gemini. Обычные пользователи работают с новой моделью именно через это приложение. По сообщению Android Authority, Gemini 3 Pro изначально открыт в тестовом режиме.
«По сообщению Android Authority, Gemini 3 Pro изначально открыт в тестовом режиме в приложении Gemini, по подпискам Google AI Pro и Ultra, а также через инструменты для разработчиков и предприятий — Gemini API и Vertex AI».
Второй канал — система подписок. Подписчики Google AI Pro и Google AI Ultra получают полный доступ к возможностям модели. То есть владельцы платных подписок используют все функции флагманской модели.
Третий канал — Gemini API и платформа Vertex AI, предназначенные для разработчиков и предприятий. Через эти каналы модель можно подключать к внешним продуктам и сервисам: разработчики интегрируют Gemini 3.0 Pro в свои приложения, предприятия — в свою инфраструктуру.
В Google AI Studio также появилась возможность бесплатно опробовать модель — пока эта возможность открыта только для разработчиков в США. О сроке тестирования или дате открытия в других странах дополнительной информации не сообщалось.
Отдельного внимания заслуживает техническое новшество — контекстное окно на 1 миллион токенов. Контекстное окно — это объём текста, который модель способна обработать за один запрос. Окно на 1 миллион токенов позволяет работать в одной сессии с текстами очень большого объёма: можно загрузить в модель сразу подборку длинных документов или большую кодовую базу, сохранить историю долгого диалога. На практике это означает, что пользователь может поручить анализ документа в сотни страниц, не разбивая его на части, или показать сразу весь код проекта и задать вопрос.
Семейство моделей расширяется: Flash и Nano
Вместе с версией Pro анонсированы ещё два члена семейства Gemini 3.
Gemini 3.0 Flash представлен как более лёгкий и дешёвый вариант — он предназначен для повседневных быстрых задач. В простых запросах, требующих быстрого ответа, используется именно такой лёгкий вариант вместо тяжёлого флагмана.
А Gemini 3.0 Nano работает прямо в браузерах Chrome и Edge, то есть его можно использовать внутри браузера без отдельного приложения. Это — направление использования модели в самом веб-браузере: пользователь получает возможности искусственного интеллекта внутри браузера, не открывая отдельный сайт или приложение.
Таким образом, Google вместе с обновлением флагманской модели предлагает её в трёх формах: самый мощный Pro, быстрый Flash и работающий внутри браузера Nano.
Кто осветил анонс
Google официально представил новую модель 8 октября 2026 года. Анонс широко освещали технологические издания: Android Authority рассказал о деталях выхода, TechRadar — об основных новшествах, а 9to5Google прокомментировал дополнительные технические детали. Все три издания отметили рекордные результаты в 27 бенчмарках и контекстное окно на 1 миллион токенов как центральные новости анонса. По опубликованным данным, все три члена семейства — Pro, Flash и Nano — были представлены одновременно.
Подробные технические данные приведены в обзорах Android Authority и TechRadar, дополнительные детали — в материале 9to5Google.

