Įvaldęs „Space Invaders“, šachmatus ir „Go“, AI sprendžia vaizdo futbolą

Futbolo aikštė

Futbolo aikštė Vienna Reyes | Atskleiskite purslą





„Google“ pirmauja pasaulyje pagal mašininio intelekto tyrimus. Visų pirma, jos dukterinė įmonė „DeepMind“ turi įspūdingą laimėjimų sąrašą. „DeepMind“ neuroniniai tinklai pasiekė viršžmogišką našumą įvairiuose žaidimuose. Tai apima „Atari“ vaizdo žaidimus, tokius kaip „Pong“, „Breakout“ ir „Space Invaders“, ir sudėtingesnius iššūkius, tokius kaip internetinis kelių žaidėjų žaidimas „Starcraft“.

„DeepMind“ taip pat sulaukė nepaprastos sėkmės su tradiciniais žaidimais. 2016 m. jo „AlphaGo“ aparatas puikiai įveikė vieną stipriausių profesionalių „Go“ žaidėjų pasaulyje – pirmą kartą mašina triumfavo tokiu būdu. Proceso metu AlphaGo rado visiškai naujų žaidimo būdų, kurie pakeitė žmonių mąstymą apie žaidimą.

Nesitenkindama sėdėdama ant laurų, „Google“ dabar atkreipia dėmesį į atviresnius žaidimus, kuriuose svarbesnis vaidmuo tenka nenuspėjamumui. Kitas jo tikslas yra vaizdo futbolas.



Karolis Kurachas ir kolegos iš „Google Research's Brain Team“ sukūrė futbolo vaizdo žaidimą, pavadintą „Google Research Football Environment“, kad mokslininkai galėtų išbandyti savo algoritmus pasaulyje, kuris yra pagrįstas fizika, pritaikomas, lengvai naudojamas ir be galo atkuriamas. Jie padarė šį pasaulį prieinamą su atvirojo kodo licencija, kad tyrėjai bet kur galėtų ją naudoti kurdami geresnius futbolo žaidimo algoritmus.

Pirmiausia šiek tiek fono. Vienas iš iššūkių dirbtinio intelekto tyrėjams yra rasti užduočių, kurios pasiūlytų naujų mašininio mokymosi algoritmų problemų. Paprasti vaizdo žaidimai, tokie kaip „Pong“ ar „Breakout“, kartais yra per paprasti šiems algoritmams, kurie gali pasiekti neįtikėtiną našumą vos po kelių valandų treniruočių.

Tačiau kai kurie sudėtingesni vaizdo žaidimai, tokie kaip „Starcraft“, yra per daug sudėtingi. Starcraft yra realaus laiko strateginis žaidimas keliems žaidėjams ir vyksta didelėje internetinėje visatoje. Dirbtinio intelekto tyrinėtojai susidomėjo tuo, nes tai leidžia jiems žaisti prieš kitus žmones ir žaidimais pagrįstas AI sistemas sudėtingoje aplinkoje.



Tačiau žaidimas yra toks platus ir sudėtingas, kad norint surinkti reikiamus duomenis ir išmokyti mašininio mokymosi sistemą, reikia didžiulių skaičiavimo resursų. Ir šie ištekliai nėra prieinami daugumai tyrinėtojų.

Kita problema yra ta, kad daugelis perspektyvių internetinių aplinkų veikia naudojant patentuotą kodą, kurio tyrėjai negali pakeisti ar net matyti. Dėl to neįmanoma žinoti, kaip žaidime priimami svarbūs sprendimai, ar eksperimentuoti su skirtingais sprendimų priėmimo procesais.

Galiausiai, daugelis žaidimų yra visiškai deterministiniai: jie bus žaidžiami lygiai taip pat, jei naudojami tie patys įėjimai. Dėl to juos lengva įveikti mokymosi algoritmus.



Tačiau realiame pasaulyje viskas vyksta ne taip, nes gebėjimas susidoroti su netikėtais veiksmais yra svarbus įgūdis. Vienintelis būdas mašinoms išmokti šio įgūdžio yra treniruotis nenuspėjamoje aplinkoje. Tačiau nenuspėjamumas turi būti kontroliuojamas – per mažai, o žaidimas per lengvas, o per daug mokymasis tampa per sunkus. Sukurti tokią aplinką yra sudėtinga.

Čia atsiranda futbolo treniruokliai. Jie turi tam tikrą nuspėjamumo lygį, pagrįstą žaidimo fizika. Tačiau taip pat yra daug nenuspėjamumo, atsirandančio dėl priešininkų taktikos, žaidėjų nesutapimo tokiose situacijose kaip smūgis ir pan.

Taigi Kurachas su kolegomis sukūrė savo simuliatorių. Kaip pagrindą jie naudojo viešai prieinamą žaidimą Gameplay Football, kuris leidžia žaisti visas futbolo rungtynes ​​su įvarčiais, pražangomis, kampiniais, baudomis, nuošalėmis ir pan. „Google“ komanda teigia, kad „Futball Environment“ yra fizikos pagrindu sukurtas 3D futbolo modeliavimas, kuriame agentai turi valdyti savo žaidėjus, išmokti atlikti perdavimą tarp jų ir kaip įveikti varžovo gynybą, kad įmuštų įvarčius.



Tyrėjai tai pakeitė, kad būtų galima įvertinti mašinų sėkmę, atsižvelgiant į tai, kaip arti mašina gali manevruoti kamuolį iki varžovo vartų kontroliuojamu būdu. Tai būtina, nes standartinis sėkmės matas – tikslai – atspindi gana retą įvykį ir nesuteikia būdo mašinoms stebėti savo progresą akimirksniu.

Google prieš pasaulį

Komanda taip pat sukūrė keletą standartinių įvairaus sudėtingumo aplinkų, kuriose mokomi ir išbandomi dirbtinio intelekto įrenginiai. Užduotys, su kuriomis susiduria mašina, yra įmušimas į tuščius vartus, bėgimas ir įmušimas prieš vartininką, 3 prieš 1 scenarijaus naršymas siekiant įmušti, skatinant perduoti kamuolį ir pan. Bendras testas yra standartinis žaidimas su visomis įprastomis taisyklėmis, žaidžiamas prieš mašininį priešininką.

Mokymosi algoritmas gali veikti prieš kitas mašinas arba prieš žmones. Tai suteikia jai patirties dirbant su įvairiomis strategijomis. Ir išvengiama scenarijaus, kai mašina tiesiog išmoksta mašininio priešininko silpnąsias vietas, kurios apskritai gali būti nepritaikytos žaidimams. Tai yra sudėtinga mokymosi sustiprinimo problema, nes futbolas reikalauja natūralios pusiausvyros tarp trumpalaikės kontrolės, išmoktų sąvokų, tokių kaip perdavimai, ir aukšto lygio strategijos, sako Kurachas ir jo kolegos.

Tai įdomus darbas, galintis padėti mašininiam mokymuisi veikti tikroviškesnėje aplinkoje. Tačiau tai taip pat padidina galimybę, kad mašinos išmoks naujų futbolo strategijų, kurių žmonės niekada nesvarstė, kaip ir Go.

Tai yra taktika, kuri netgi gali būti naudojama robo futbolo turnyruose ar net žaidimuose tarp žmonių.

Įdomus klausimas, ar šios strategijos tinka tiek tikram futbolui, tiek imituojamoms atmainoms. Tai bus žavu ir AI tyrinėtojams, ir futbolo gerbėjams.

Nuoroda: arxiv.org/abs/1907.11180 : Google Research Football: A Novel Inforcement Learning Environment

paslėpti