Massachusets texnologiya instituti (MIT), Karnegi Mellon universiteti, Nyu-York universiteti va Stenford universiteti olimlari Stratego boʻyicha jahonning eng kuchli oʻyinchilarini ishonchli ustunlik bilan magʻlub etgan sunʻiy intellekt (SI) tizimini taqdim etdi. MIT News xabariga koʻra, Ataraxos deb nomlangan tizim jahon chempioni bilan oʻtkazilgan oʻyinlar seriyasida 15 gʻalaba, 1 magʻlubiyat va 4 durang natija qayd etdi hamda jahon chempionatidagi kuchli oʻyinchilarga qarshi 39-2 hisobida gʻalaba qozondi. Tadqiqot Nature jurnalida chop etildi. Bungacha hech bir SI tizimi bunday natijaga erishmagan edi. Stratego — ikki kishilik doska urush oʻyini boʻlib, oʻyin davomida raqib figuralarining kimligi yashirin qoladi.

Rekord natija

Tadqiqotchilar Ataraxosʻni amaliy sinov uchun jahon chempionatiga olib chiqdi. Tizim Stratego tarixidagi eng kuchli oʻyinchi bilan oʻtkazilgan seriyada 15-1-4 hisobini qayd etdi — bu bunday darajadagi raqibga qarshi erishilgan eng katta farqdir. Seriya jami 20 oʻyindan iborat boʻlib, tizim unda 15 gʻalaba, 1 magʻlubiyat va 4 durang qayd etdi. Chempionatning boshqa yetakchi ishtirokchilariga qarshi jami hisob 39-2 ni tashkil qildi — tizim 41 oʻyindan 39 tasida gʻalaba qozondi. MIT Newsʻning yozishicha, bungacha hech bir SI tizimi Stratego boʻyicha eng kuchli inson oʻyinchilarini bunday ishonchli farq bilan magʻlub eta olmagan edi.

Tadqiqot ustida toʻrt universitet — MIT, Karnegi Mellon, Nyu-York universiteti va Stenford olimlari birgalikda ishladi. Tizim nafaqat chempionni, balki chempionatning eng kuchli ishtirokchilari guruhini ham magʻlub etgani uning yutugʻi tasodif emasligini koʻrsatadi. Shunday qilib, Ataraxos tarixda ilk bor jahon chempionini ishonchli ustunlik bilan magʻlub etgan SI tizimi boʻldi.

Tizim qanday ishlaydi

Ataraxos mustahkamlovchi oʻrganish (reinforcement learning) usulida — oʻz-oʻziga qarshi oʻynash (self-play) orqali oʻrgatildi: tizim oʻzi bilan koʻp marta oʻynab, Strategoʻda ustunlik beradigan tayanch strategiyani shakllantirdi. Tadqiqotchilar oʻrgatishni sezilarli darajada samaraliroq qiladigan algoritmlarni ishlab chiqdi — natijada tizim nisbatan kichik oʻrgatish byudjeti bilan chempionlik darajasiga chiqdi. Ars Technicaʻning qayd etishicha, tizim nisbatan kichik oʻrgatish byudjeti bilan tarixdagi eng kuchli oʻyinchini magʻlub etdi.

Oʻyin davomida Ataraxos tayanch strategiyadan boshlangʻich nuqta sifatida foydalanadi, lekin har bir yurishdan oldin tanlovini joyida takomillashtiradi. Bunda qaror qabul qilish vaqtida rejalashtirish (decision-time planning) deb ataladigan usul qoʻllanadi: generativ SI raqibning yashirin figuralari kimligini ehtimollar orqali baholaydi, soʻng kelgusi yurishlarni tahlil qilib eng maqbulini tanlaydi. Tadqiqotchilarning yozishicha, aynan shu usul tizimga insondan ustun natijaga erishish imkonini bergan.

Tizimning oʻrgatish samaradorligi DeepMindʻning oldingi DeepNash tizimi bilan bevosita solishtirildi: Ataraxos qatʻiy yuqori oʻyin kuchiga erishdi — bunga esa yuzdan biridan kam oʻrgatish namunasi va oʻttizdan biridan kam oʻz-oʻziga qarshi oʻyin yetarli boʻldi. Boshqacha aytganda, tizim oldingi rekordchidan kuchliroq boʻlish bilan birga uni oʻrgatishga sezilarli darajada kam resurs sarfladi. Bu haqda tadqiqotning yetakchi muallifi Gabriele Farina shunday dedi:

«Tizim DeepMindʻning DeepNash tizimidan qatʻiy yuqori oʻyin kuchiga erishdi — bunga esa yuzdan biridan kam oʻrgatish namunasi va oʻttizdan biridan kam oʻz-oʻziga qarshi oʻyin yetarli boʻldi», — dedi Gabriele Farina.

Nature jurnalida chop etilgan tadqiqotda bu samaradorlik natijalari, chempionatdagi sinov shartlari va DeepNash bilan solishtirma tahlil batafsil bayon etilgan.

Boshqa oʻyinlarda ham ustunlik

Tadqiqot jamoasi usulning faqat Stratego uchun emas, umuman olganda ishlashini koʻrsatish uchun Ataraxosʻni uchta boshqa nomukammal maʻlumotli oʻyinga ham moslashtirdi: tez oʻtadigan Barrage Stratego, koʻp oʻyinchili hamkorlik karta oʻyini Hanabi va ikki oʻyinchi uchinchisiga qarshi oʻynaydigan Dou dizhu. Tizim ularning har birida insondan ustun natija koʻrsatdi. MIT Newsʻning yozishicha, bu natijalar usulning turli sharoitlarda qoʻllaniladigan universalligini tasdiqlaydi. Bu natijalar va tizimning oʻrgatish tafsilotlari Nature jurnalida chop etilgan ilmiy tadqiqotda batafsil bayon etilgan.

Nega bu yutuq muhim

Stratego — nomukammal maʻlumotli oʻyin: raqib figuralarining kimligi ular toʻqnashguncha yashirin qoladi. Oʻyinchilar figuralarni doskaning oʻz tomoniga joylashtiradi va raqib bayrogʻini egallashga harakat qiladi. Nomukammal maʻlumotli oʻyinlar SI uchun uzoq yillar yengib boʻlmas sinov boʻlib kelgan — Stratego aynan shunday oʻyin. Shu sababli u SI tizimlarining strategik fikrlash qobiliyatini sinashda muhim mezon (benchmark) hisoblanadi. Ars Technica taʻkidlaganidek, yashirin maʻlumotli bu oʻyin uzoq vaqt SI tizimlarini dovdiratib kelgan, Ataraxos esa uni nisbatan kichik oʻrgatish byudjeti bilan yengdi. Bu natija Ars Technicaʻning 1-oktabrdagi materialida ham yoritildi.