Google 2026-yil 8-oktabrda yangi flagman sunʻiy intellekt modeli — Gemini 3.0 Pro ni rasman taqdim etdi. Kompaniyaning bildirishicha, model 27 ta ommaviy benchmarkda yangi eng yuqori natijalarni qayd etdi va 1 million tokenli kontekst oynasini qoʻllab-quvvatlaydi. Bu — avvalgi flagman Gemini 2.5 Pro dan keyingi asosiy avlod yangilanishi.
Google bir paytda Gemini 3 oilasining uchala aʻzosini — Pro, Flash va Nano ni — eʻlon qildi. Model uchta asosiy kanal orqali ochiq: Gemini ilovasi, Google AI Pro va Ultra obunalari hamda dasturchilar uchun Gemini API va Vertex AI.
Benchmarklarda yangi rekordlar
Google eʻlon qilgan koʻrsatkichlarga koʻra, Gemini 3.0 Pro oʻlchangan 27 ta benchmarkning har birida avvalgi eng yaxshi natijalardan oʻzib ketdi. Barcha 27 ta testda yangi eng yuqori natija qayd etilgani kompaniyaning rasmiy bayonotida taʻkidlandi. Kompaniya alohida taʻkidlagan oʻnta koʻrsatkich quyidagicha oʻzgardi.
Sunʻiy intellekt modellarining umumiy reytingi hisoblangan LMArena da Gemini 3.0 Pro 1501 ball toʻpladi — bu avvalgi rekord boʻlgan 1458 balldan yuqori. Mantiqiy fikrlash va murakkab muammolarni yechish qobiliyatini oʻlchaydigan ARC-AGI-2 testida natija 31,1 foizdan 37,5 foizga koʻtarildi. Terminal muhitida ishlaydigan dasturiy agentlar uchun moʻljallangan Terminal-Bench 2.0 da koʻrsatkich 35,5 foizdan 43,8 foizga yetdi.
Ekspert darajasidagi savollar toʻplami Humanity's Last Exam da model 33,0 foiz oʻrniga 37,5 foiz natija koʻrsatdi. Ilmiy savollar boʻyicha GPQA Diamond testida 89,8 foizdan 93,8 foizga oʻsish qayd etildi. Dasturiy taʻminot muhandisligi vazifalarini baholaydigan SWE-Bench Verified da natija 89,8 foizdan 93,2 foizga koʻtarildi.
Telekommunikatsiya sohasidagi agentlik vazifalar uchun moʻljallangan Tau2-Bench Telecom da koʻrsatkich 82,6 foizdan 91,0 foizga yaxshilandi. Uzoq muddatli rejalashtirish va resurslarni boshqarishni sinovchi Vending Bench 2 da natija 51,5 foizdan 66,0 foizga oʻsdi. Javoblarning faktlarga asoslanganligi va ishonchliligini tekshiruvchi FACTS Grounding testida koʻrsatkich 75,1 foizdan 81,0 foizga koʻtarildi. Uzun kontekstda eslab qolish qobiliyatini oʻlchovchi MRCR v2 da natija 61,0 foizdan 73,0 foizga yetdi.
Eng katta sakrashlar uzoq muddatli rejalashtirish va xotira bilan bogʻliq testlarda kuzatildi: Vending Bench 2 da 14,5 foiz punkt, MRCR v2 da 12 foiz punkt, Tau2-Bench Telecom da 8,4 foiz punkt va Terminal-Bench 2.0 da 8,3 foiz punkt oʻsish qayd etildi. Bu raqamlar shuni anglatadiki, model bir yoʻla oʻnlab turli yoʻnalishlarda — mantiqiy fikrlashdan tortib dasturlash va agentlik vazifalarigacha — avvalgi eng yaxshi koʻrsatkichlardan oʻzib ketdi.
Oʻnta koʻrsatkich tahlili: har bir test nima oʻlchaydi
Yuqoridagi oʻnta testning har biri modelning alohida qobiliyatini oʻlchaydi. Ularning mazmuni va ahamiyati quyidagicha.
LMArena — umumiy reyting. Bu maydonda turli kompaniyalarning modellari koʻr-koʻrona solishtiriladi: foydalanuvchilar ikkita anonim javobni koʻrib, yaxshisini tanlaydi va shundan reyting shakllanadi. Gemini 3.0 Pro 1501 ball toʻpladi, avvalgi rekord 1458 edi. Bu koʻrsatkich real foydalanuvchilarning bahosi asosida shakllangani uchun modelning kundalik vazifalardagi sifatini aks ettiradi.
ARC-AGI-2 — mantiqiy fikrlash. Test modelning oldindan koʻrmagan, yangi turdagi muammolarni yechish qobiliyatini oʻlchaydi: bu yerda yod olingan javoblar yordam bermaydi, faqat umumlashtirish qobiliyati sinovdan oʻtadi. Natija 31,1 foizdan 37,5 foizga koʻtarildi. Bu koʻrsatkich modelning nostandart vaziyatlarda mustaqil fikrlash darajasini koʻrsatadi.
Terminal-Bench 2.0 — terminal agentlari. Bu test modelning terminal muhitida ishlaydigan dasturiy agent sifatidagi koʻnikmalarini baholaydi: buyruqlar bajarish, fayllar bilan ishlash, koʻp qadamli topshiriqlarni mustaqil yakunlash. Koʻrsatkich 35,5 foizdan 43,8 foizga yetdi — 8,3 foiz punktlik oʻsish. Terminaldagi agentlik qobiliyati dasturchilar uchun eng amaliy koʻrsatkichlardan biri hisoblanadi, chunki u modelni real ish jarayoniga ulash imkonini belgilaydi.
Humanity's Last Exam — ekspert bilim. Bu turli fan sohalaridagi ekspert darajasidagi savollar toʻplami boʻlib, uni tuzishda yuzlab olimlar ishtirok etgan. Model natijasi 33,0 foizdan 37,5 foizga koʻtarildi. Bu testda yuqori natija modelning chuqur ilmiy va kasbiy bilim talab qiladigan savollarga javob bera olishini koʻrsatadi.
GPQA Diamond — ilmiy savollar. Bu fizika, kimyo va biologiya boʻyicha yuqori darajadagi qiyin savollar toʻplami. Natija 89,8 foizdan 93,8 foizga oʻsdi. Bunday darajadagi natija modelning ilmiy tadqiqotlarda yordamchi sifatida ishlash salohiyatining koʻrsatkichi hisoblanadi.
SWE-Bench Verified — dasturlash. Bu test real loyihalardagi dasturiy taʻminot muhandisligi vazifalari asosida tuzilgan: model xatoliklarni topishi va ularni tuzatishi kerak. Natija 89,8 foizdan 93,2 foizga koʻtarildi. Bu koʻrsatkich kod yozish va muammolarni hal qilishdagi amaliy mahoratni oʻlchaydi.
Tau2-Bench Telecom — telekom agentlari. Bu test telekommunikatsiya sohasidagi agentlik vazifalarini — mijozlarga xizmat koʻrsatish va xizmatlarni boshqarish kabi koʻp qadamli jarayonlarni — baholaydi. Koʻrsatkich 82,6 foizdan 91,0 foizga yaxshilandi. Bu yoʻnalish korporativ xizmatlarda sunʻiy intellekt agentlarini qoʻllash uchun muhim.
Vending Bench 2 — uzoq muddatli rejalashtirish. Bu test modelni uzoq vaqt davom etadigan, resurslarni boshqarish talab qiladigan simulyatsiyada sinaydi: model uzoq muddat mustaqil qaror qabul qilib, belgilangan maqsadga erishishi kerak. Natija 51,5 foizdan 66,0 foizga oʻsdi — 14,5 foiz punktlik sakrash oʻnta koʻrsatkich ichida eng kattasi. Bu test agentlik tizimlarining eng murakkab joyi — uzoq muddatli izchillikni oʻlchaydi.
FACTS Grounding — faktlarga asoslanganlik. Bu test javoblarning berilgan manbalarga tayanishi va ishonchliligini tekshiradi: model uydirma maʻlumot bermasligi kerak. Koʻrsatkich 75,1 foizdan 81,0 foizga koʻtarildi. Ishonchli javoblar korporativ qoʻllanilishda hal qiluvchi ahamiyatga ega.
MRCR v2 — uzun kontekst xotirasi. Bu test modelning juda uzun matnlar ichidan kerakli maʻlumotni topib, eslab qolish qobiliyatini oʻlchaydi. Natija 61,0 foizdan 73,0 foizga yetdi — 12 foiz punktlik oʻsish. Uzun hujjatlar bilan ishlashda aynan shu qobiliyat amaliy farqni beradi va u 1 million tokenli kontekst oynasi bilan bevosita bogʻliq.
Umuman olganda, eng katta oʻsish surʻatlari agentlik va xotira yoʻnalishlarida kuzatildi: Vending Bench 2, MRCR v2, Tau2-Bench Telecom va Terminal-Bench 2.0 dagi sakrashlar modelning mustaqil ishlaydigan agent sifatidagi imkoniyatlari kuchayganini koʻrsatadi.
Qayerda va kimlar uchun ochiq
Modeldan foydalanish uchta asosiy kanal orqali tashkil etilgan.
Birinchi kanal — Gemini ilovasi. Oddiy foydalanuvchilar yangi model bilan aynan shu ilova orqali ishlaydi. Android Authorityʻning yozishicha, Gemini 3 Pro avvalo sinov rejimida ochiq.
«Android Authority»ning yozishicha, Gemini 3 Pro avvalo sinov rejimida Gemini ilovasi, Google AI Pro va Ultra obunalari hamda dasturchilar va korxonalar uchun vositalar — Gemini API va Vertex AI orqali ochiq.
Ikkinchi kanal — obuna tizimi. Google AI Pro va Google AI Ultra obunachilari modelning toʻliq imkoniyatlaridan foydalanadi. Yaʻni pulli obuna egalari flagman modelning barcha funksiyalaridan foydalanadi.
Uchinchi kanal — dasturchilar va korxonalar uchun moʻljallangan Gemini API va Vertex AI platformasi. Modelni shu kanallar orqali tashqi mahsulot va servislarga ulash mumkin: dasturchilar oʻz ilovalariga, korxonalar esa oʻz infratuzilmasiga Gemini 3.0 Pro ni integratsiya qiladi.
Google AI Studio da modelni bepul sinab koʻrish imkoniyati ham yaratildi — hozircha bu imkoniyat faqat AQSh dagi dasturchilar uchun ochiq. Sinov muddati yoki boshqa mamlakatlarda ochilish sanasi haqida qoʻshimcha maʻlumot berilmagan.
Alohida eʻtiborga loyiq texnik yangilik — 1 million tokenli kontekst oynasi. Kontekst oynasi — modelning bitta soʻrovda bir yoʻla qayta ishlay oladigan matn hajmi. 1 million tokenlik oyna bitta sessiyada juda katta hajmdagi matnlar bilan ishlash imkonini beradi: uzun hujjatlar toʻplami yoki katta kod bazalarini modelga bir yoʻla yuklash, uzoq suhbatlar tarixini saqlab qolish mumkin. Amaliyotda bu shuni anglatadiki, foydalanuvchi yuzlab sahifalik hujjatni boʻlaklarga boʻlmasdan tahlil qildirishi yoki butun loyiha kodini bir vaqtda koʻrsatib savol berishi mumkin.
Model oilasi kengaymoqda: Flash va Nano
Pro versiya bilan birga Gemini 3 oilasining yana ikki aʻzosi ham eʻlon qilindi.
Gemini 3.0 Flash yengilroq va arzonroq variant sifatida taqdim etildi — u kundalik tezkor vazifalar uchun moʻljallangan. Tezkor javob talab qiladigan oddiy soʻrovlarda ogʻir flagman model oʻrniga aynan shunday yengil variant ishlatiladi.
Gemini 3.0 Nano esa toʻgʻridan-toʻgʻri Chrome va Edge brauzerlarida ishlaydi, yaʻni uni brauzer ichida alohida ilovasiz ishlatish mumkin. Bu — modelni veb-brauzerning oʻzida ishlatish yoʻnalishi: foydalanuvchi alohida sayt yoki ilova ochmasdan brauzer ichida sunʻiy intellekt imkoniyatlaridan foydalanadi.
Shunday qilib, Google flagman modelni yangilash bilan birga uni uchta shaklda taqdim etmoqda: eng kuchli Pro, tezkor Flash va brauzer ichidagi Nano.
Eʻlonni kimlar yoritdi
Google yangi modelni 2026-yil 8-oktabrda rasman taqdim etdi. Eʻlonni texnologiya nashrlari keng yoritdi: Android Authority modelning chiqish tafsilotlarini, TechRadar uning asosiy yangiliklarini, 9to5Google esa qoʻshimcha texnik tafsilotlarni sharhladi. Uchala nashr ham 27 ta benchmarkdagi rekord natijalar va 1 million tokenli kontekst oynasini eʻlonning markaziy yangiliklari sifatida qayd etdi. Eʻlon qilingan maʻlumotlarga koʻra, oilaning uchala aʻzosi — Pro, Flash va Nano — bir vaqtda taqdim etildi.
Batafsil texnik maʻlumotlar Android Authority va TechRadar sharhlarida, qoʻshimcha tafsilotlar esa 9to5Google materialida keltirilgan.




