Microsoft 2026-yil 9-oktabrda qarorlarni tezkor baholashga moʻljallangan Microsoft-Decision-1 nomli yangi modelni taqdim etdi. Bu anʻanaviy katta til modellari (LLM) kabi matn yaratmaydi: model qatʻiy belgilangan variantlar toʻplamini qabul qilib, har bir variant uchun kalibrlangan ehtimollik bahosini strukturallangan API orqali qaytaradi. Yangi model Microsoft Foundry platformasida hamda OpenRouter xizmati orqali foydalanish uchun ochiq.

Model qanday ishlaydi

Microsoft-Decision-1 "qaror baholash" (decision-scoring) vazifasi uchun maxsus yaratilgan. U foydalanuvchidan erkin matn soʻrovi oʻrniga tayyor variantlar roʻyxatini oladi va har biriga ehtimollik koʻrsatkichi beradi — masalan, "ha/yoʻq" javoblari, koʻp tanlovli variantlar yoki reyting shkalasi boʻyicha baholash. Bundan tashqari, model SI javoblari va SI agentlarining harakatlarini oldindan belgilangan mezonlar (rubrika) asosida baholay oladi.

"Microsoft-Decision-1 matn yaratuvchi LLMʻlardan farqli oʻlaroq, qatʻiy belgilangan variantlar toʻplamini qabul qiladi va strukturallangan API orqali har bir variant uchun kalibrlangan ehtimollik bahosini qaytaradi; u ha/yoʻq, koʻp tanlovli va reyting variantlarini, shuningdek, SI javoblari va agent harakatlarini mezon asosida baholashni qoʻllab-quvvatlaydi." — Microsoft rasmiy eʻloni

Microsoft modelni aynan agentli tizimlar uchun moʻljallangan vazifalarga yoʻnaltirmoqda: yoʻnaltirish (routing), tasniflash, ustuvorlikni belgilash, tekshirish va ish oqimlarini boshqarish. Bularning barchasi zamonaviy SI agentlari har soniyada qabul qiladigan kichik, lekin muhim qarorlardir.

Qanday asosda qurilgan

Microsoft modelni Alibaba kompaniyasining ochiq vaznli Qwen3.5-9B modeli ustida qoʻshimcha oʻqitish (post-training) orqali yaratgan. Oʻqitish bir oʻtishda qaror baholash vazifasiga qaratilgan. Kompaniya kelajakda modelni Microsoft AI (MAI) va OpenAI modellari asosiga koʻchirishni rejalashtirayotganini bildirgan.

Bu yondashuv katta til modelini noldan oʻqitish oʻrniga mavjud ochiq modelni ixtisoslashtirish yoʻli ekanini koʻrsatadi. Bunday post-training kichikroq modelga tor vazifada katta modellarga teng natija berish imkonini beradi. Qwen3.5-9B tanlovi ham bejiz emas: ochiq vaznli asos modeli ustida ixtisoslashtirish Microsoftʻga modelni oʻz infratuzilmasi va Foundry ekotizimiga moslash uchun toʻliq nazorat beradi. Kelajakda asos modelini MAI va OpenAI modellariga koʻchirish rejasi esa kompaniyaning bu yoʻnalishni uzoq muddatli strategiya sifatida koʻrayotganini bildiradi.

Narx va mavjudlik

Model Microsoft Foundry platformasida hamda OpenRouter xizmati orqali taqdim etilgan. Bu ikki kanal ishlab chiquvchilarga modelni mavjud ish oqimlariga tez ulash imkonini beradi: Foundry Microsoft bulut ekotizimida ishlaydiganlar uchun, OpenRouter esa turli provayderlarning modellarini yagona API orqali ishlatadiganlar uchun qulay. Narx siyosati — bir million kirish tokeni uchun 0,042 dollar, chiqish tokenlari bepul — modelni aynan koʻp sonli kichik soʻrovlarni qayta ishlaydigan vazifalar uchun moʻljallanganini koʻrsatadi: har bir soʻrovda katta matn generatsiya qilinmaydi, faqat baho qaytariladi.

Tezlik va aniqlik koʻrsatkichlari

Microsoft oʻz sinovlarida modelni 36 ta benchmark boʻyicha, oʻqitish jarayonida koʻrsatilmagan qariyb 150 ming savol asosida baholagan. Kompaniya maʻlumotlariga koʻra, Microsoft-Decision-1 sinovdagi barcha modellar orasida eng yuqori aniqlikni qayd etgan.

Tezlik boʻyicha natijalar ham diqqatga sazovor: model ikkinchi oʻrindagi H2O-Lightning-4B v1.1ʻdan 2,5 baravar tez ishlagan, GPT-6 Solʻdan esa P50 kechikish koʻrsatkichida 35 baravar tez chiqqan. P50 — soʻrovlarning yarmidan koʻpi shu vaqtdan tezroq javob olganini bildiruvchi mediana koʻrsatkich, yaʻni farq tasodifiy emas, barqaror. Narx siyosati ham shunga mos: bir million kirish tokeni uchun 0,042 dollar, chiqish tokenlari esa bepul. Yaʻni model asosan kirish soʻrovlarini baholaydigan vazifalar uchun arzon xizmat sifatida pozitsiyalanmoqda. Yuqori aniqlik va past kechikish kombinatsiyasi aynan real vaqt rejimida ishlaydigan agent tizimlari uchun muhim: agent har bir qadamda oʻnlab bunday baholash soʻrovini yuboradi va har bir millisekund umumiy javob vaqtiga qoʻshiladi.

Xavfsizlik va ishonchlilik sinovlari

Microsoft modelni zararli kontent, jailbreak urinishlari va prompt injection hujumlarini qamrab olgan 11 ta benchmark boʻyicha 5 250 ta soʻrovda xavfsizlik sinovidan oʻtkazgan. Barqarorlik sinovlarida kirish maʻlumotlariga kichik oʻzgartirishlar kiritilganda qarorlar oʻrtacha atigi 1,3 foiz holatda oʻzgargan. Bu koʻrsatkich modelning shovqinli yoki ataylab buzilgan kirishlarga chidamliligini bildiradi.

Xbox Research amaliy tajribasi

Modelning amaliy qoʻllanilishiga misol sifatida Microsoftʻning Xbox Research jamoasi tajribasi keltirilgan. Jamoa oʻyinlar boʻyicha 10 mingdan ortiq foydalanuvchi fikr-mulohazasini tahlil qilishda Microsoft-Decision-1ʻni sinab koʻrgan. Natijada model sifati GPT-6 Sol bilan raqobatbardosh chiqqan, shu bilan birga 14 baravardan ortiq tez va 200 baravar arzon ishlagan. Bu katta hajmdagi takrorlanuvchi baholash vazifalarida ixtisoslashgan kichik modelning ustunligini koʻrsatadi. Oʻyin fikr-mulohazalarini tahlil qilish — aynan shunday vazifa: minglab qisqa matnlarni tezda tasniflash yoki ustuvorlik boʻyicha saralash kerak boʻladi, bunda har bir matn uchun toʻliq javob generatsiya qilish ortiqcha xarajat. Microsoftʻning bu misolni keltirishi modelning maqsadli auditoriyasi — katta hajmli avtomatlashtirilgan baholash oqimlarini qurayotgan jamoalar ekanini anglatadi.