9 октября 2026 года Microsoft представила новую модель Microsoft-Decision-1 для быстрой оценки решений. В отличие от классических больших языковых моделей (LLM), она не генерирует текст: модель принимает строго заданный набор вариантов и через структурированный API возвращает для каждого варианта калиброванную вероятностную оценку. Новая модель открыта для использования на платформе Microsoft Foundry и через сервис OpenRouter.

Как работает модель

Microsoft-Decision-1 создан специально для задачи оценки решений (decision-scoring). Вместо свободного текстового запроса он получает от пользователя готовый список вариантов и присваивает каждому вероятностный показатель — например, ответы «да/нет», варианты с множественным выбором или оценку по рейтинговой шкале. Кроме того, модель способна оценивать ответы ИИ и действия ИИ-агентов по заранее заданным критериям (рубрикам).

«В отличие от текстовых LLM, Microsoft-Decision-1 принимает строго заданный набор вариантов и через структурированный API возвращает калиброванную вероятностную оценку для каждого варианта; он поддерживает варианты «да/нет», множественный выбор и рейтинговые шкалы, а также оценку ответов ИИ и действий агентов по заданным критериям». — официальное объявление Microsoft

Microsoft нацеливает модель именно на задачи для агентных систем: маршрутизация (routing), классификация, приоритизация, проверка и управление рабочими процессами. Всё это — небольшие, но важные решения, которые современные ИИ-агенты принимают каждую секунду.

На чём построена модель

Microsoft создала модель с помощью дополнительного обучения (post-training) на открытой по весам модели Qwen3.5-9B компании Alibaba. Обучение за один проход было сфокусировано на задаче оценки решений. Компания заявила, что в будущем планирует перенести модель на основу моделей Microsoft AI (MAI) и OpenAI.

Такой подход показывает путь специализации существующей открытой модели вместо обучения большой языковой модели с нуля. Подобный post-training позволяет более компактной модели достигать на узкой задаче результатов на уровне больших моделей. Выбор Qwen3.5-9B не случаен: специализация на открытой весовой основе даёт Microsoft полный контроль для адаптации модели к собственной инфраструктуре и экосистеме Foundry. А план переноса базовой модели на MAI и модели OpenAI в будущем показывает, что компания рассматривает это направление как долгосрочную стратегию.

Цена и доступность

Модель представлена на платформе Microsoft Foundry и через сервис OpenRouter. Эти два канала позволяют разработчикам быстро подключать модель к существующим рабочим процессам: Foundry удобна для тех, кто работает в облачной экосистеме Microsoft, а OpenRouter — для тех, кто использует модели разных провайдеров через единый API. Ценовая политика — 0,042 доллара за миллион входных токенов, выходные токены бесплатно — показывает, что модель рассчитана именно на задачи обработки множества небольших запросов: в каждом запросе большой текст не генерируется, возвращается только оценка.

Скорость и точность

В своих тестах Microsoft оценивала модель по 36 бенчмаркам на основе почти 150 тысяч вопросов, не показанных в процессе обучения. По данным компании, Microsoft-Decision-1 показала лучшую точность среди всех моделей в тесте.

Примечательны и результаты по скорости: модель работала в 2,5 раза быстрее занявшей второе место H2O-Lightning-4B v1.1 и в 35 раз быстрее GPT-6 Sol по показателю задержки P50. P50 — медианный показатель, означающий, что более половины запросов получают ответ быстрее этого времени, то есть разница не случайна, а стабильна. Ценовая политика соответствует: 0,042 доллара за миллион входных токенов, выходные токены бесплатны. То есть модель позиционируется как недорогой сервис для задач, где в основном оцениваются входные запросы. Сочетание высокой точности и низкой задержки важно именно для агентных систем реального времени: агент отправляет десятки таких оценочных запросов на каждом шаге, и каждая миллисекунда добавляется к общему времени ответа.

Тесты безопасности и надёжности

Microsoft провела тестирование модели на безопасность на 5 250 запросах по 11 бенчмаркам, охватывающим вредоносный контент, попытки jailbreak и атаки prompt injection. В тестах стабильности при небольших изменениях входных данных решения менялись в среднем лишь в 1,3% случаев. Этот показатель говорит об устойчивости модели к шумным или намеренно искажённым входным данным.

Практический опыт Xbox Research

В качестве примера практического применения приводится опыт команды Xbox Research компании Microsoft. Команда протестировала Microsoft-Decision-1 для анализа более 10 тысяч отзывов пользователей об играх. В результате качество модели оказалось конкурентоспособным с GPT-6 Sol, при этом она работала более чем в 14 раз быстрее и в 200 раз дешевле. Это показывает преимущество специализированной компактной модели в задачах массового повторяющегося оценивания. Анализ отзывов об играх — именно такая задача: тысячи коротких текстов нужно быстро классифицировать или отсортировать по приоритету, и генерация полного ответа для каждого текста — избыточные затраты. То, что Microsoft приводит этот пример, означает, что целевая аудитория модели — команды, строящие крупномасштабные автоматизированные потоки оценки.