По сообщению The Wall Street Journal, опубликованному 5 октября 2026 года, лишь 11% из почти 400 опрошенных компаний могут точно заранее рассчитать расходы на ИИ. Остальные 89% — почти девять из десяти компаний — не могут точно спрогнозировать, сколько потратят на ИИ-сервисы. Издание объясняет это тем, что потребление токенов моделями ИИ и итоговый счёт резко меняются от запроса к запросу. Опрос проводился недавно, его результаты опубликованы в технологическом разделе WSJ.
Стремясь сократить расходы, компании обычно выбирают модели с более низкой ценой в прайс-листе, исходя из логики: раз цена токена ниже, ниже будет и общий счёт. Однако новое исследование учёных Стэнфордского университета, Университета Карнеги — Меллона, Калифорнийского университета в Беркли и Microsoft Research показало, что эта логика работает не всегда: в отдельных случаях более дешёвая модель обходится, наоборот, дороже.
Как проводилось исследование
Учёные прогнали модели из разных ценовых категорий через более чем 6 800 задач. В каждой задаче модели сравнивались попарно: дешёвая и дорогая модели выполняли один и тот же запрос, после чего сопоставлялись их общий расход токенов и итоговая стоимость. По итогам таких парных сравнений в 32% случаев суммарные затраты модели с более низкой ценой в прайс-листе превышали затраты более дорогой модели.
Исследователи назвали это явление «ценовым реверсом». В отдельных парах масштаб обратного разрыва достигал 28 раз — то есть в самых резких случаях итоговый счёт модели, выбранной как более дешёвая, оказывался в 28 раз выше, чем у дорогой модели. По словам исследователей, цена в прайс-листе показывает стоимость лишь одного токена, а итоговый счёт зависит от того, сколько токенов модель суммарно потратит на конкретную задачу. Поэтому дешёвый токен — не всегда дешёвый итоговый счёт.
Работа под названием «The Price Reversal Phenomenon: When Cheaper Reasoning Models Cost More» была опубликована 28 мая 2026 года на сервере препринтов arXiv под номером 2603.23971v2. В своей публикации от 5 октября 2026 года WSJ опиралось именно на результаты этого исследования. Авторы — Линцзяо Чэнь и её коллеги из Стэнфордского университета, Калифорнийского университета в Беркли, Университета Карнеги — Меллона и Microsoft Research.
Один запрос — два счёта
Практический пример, приведённый WSJ, наглядно показывает разницу. Более дорогая модель Gemini 3.1 Pro выполнила запрос за 85 шагов, потратив в общей сложности $1. Когда тот же запрос передали более дешёвой модели Gemini 3 Flash, она сделала почти 1 000 шагов — почти в 12 раз больше по числу шагов — и в итоге не справилась с задачей. Тем не менее потраченные токены обошлись в $14, и эта сумма осталась в счёте.
Иными словами, в этом случае дешёвая модель обошлась в 14 раз дороже, да ещё и не довела задачу до конца. Этот пример показывает главный вывод исследования на одном конкретном случае: дешёвая модель не только сделала больше шагов, но и тратила токены на каждом шаге — в результате задача за $1 превратилась в $14.
Причина — токены рассуждения
Авторы исследования видят главную причину явления в резком разбросе количества токенов рассуждения (thinking tokens), которые используют рассуждающие модели (reasoning models). При ответе на один запрос расход токенов рассуждения у разных моделей различается до 900%. Даже при низкой цене токена в прайс-листе: чем больше модель «думает», формируя ответ, тем выше итоговый счёт.
В примере с Gemini виден тот же механизм: дешёвая модель сделала почти 1 000 шагов вместо 85 — то есть потратила куда больше токенов рассуждения на формирование ответа. Более дорогая модель, «подумав» меньше, выполнила задачу быстрее и дешевле. Более того, результат нестабилен и при повторной отправке одного и того же запроса: расход токенов от попытки к попытке меняется до 9,7 раза. То есть один и тот же запрос каждый раз может «стоить» по-разному. Эти два фактора вместе в корне затрудняют точное прогнозирование цены отдельного запроса — именно к такому выводу пришли авторы.
Реакция компаний
Представитель Google в комментарии WSJ заявил, что изменчивость на уровне запросов — неотъемлемое свойство ИИ. По его словам, компания предлагает клиентам лимиты расходов и гибкие тарифные планы.
«Изменчивость на уровне запросов — неотъемлемое свойство ИИ», — заявил представитель Google в комментарии WSJ. Он добавил, что компания предлагает клиентам лимиты расходов и гибкие тарифные планы.




