211service.com
Kodėl pokeris yra didelis dalykas dirbtiniam intelektui?
Kaip kažkada sakė didysis Kenny Rogersas, geras lošėjas turi žinoti, kada juos laikyti ir kada juos numesti. Šią savaitę Pitsburgo „Rivers Casino“ kompiuterinė programa „Libratus“ pagaliau gali įrodyti, kad kompiuteriai gali tai padaryti geriau nei bet kuris žmogaus kortelių žaidėjas.
„Libratus“ žaidžia tūkstančius „heads-up“ arba dviejų žaidėjų beribio Texas hold’em žaidimų prieš kelis profesionalius pokerio žaidėjus. Dabar, šiek tiek daugiau nei įpusėjus 20 dienų trunkančiam konkursui, „Libratus“ prieš savo oponentus žmogumi yra daugiau nei 800 000 USD. Taigi pergalė, nors toli gražu nėra garantuota, gali būti kortos.
„Libratus“ laimėjimas būtų didžiulis pasiekimas dirbtinio intelekto srityje. Pokeris reikalauja protavimo ir sumanumo, kurį mašinoms buvo sunku imituoti. Tai iš esmės skiriasi nuo šaškių, šachmatų ar „Go“, nes priešininko ranka žaidimo metu lieka paslėpta. Netobulos informacijos žaidimuose nepaprastai sudėtinga išsiaiškinti idealią strategiją, atsižvelgiant į kiekvieną įmanomą požiūrį, kurio gali imtis jūsų priešininkas. O beribis Texas hold’em yra ypač sudėtingas, nes priešininkas iš esmės gali statyti bet kokią sumą.
Pokeris buvo vienas iš sunkiausių dirbtinio intelekto žaidimų, sakoma Andrius Ng , Baidu vyriausiasis mokslininkas. Nėra vieno optimalaus ėjimo, bet vietoj to AI žaidėjas turi atsitiktinai suskirstyti savo veiksmus, kad priešininkai netiktų, kada jis blefuoja.
Libratus sukūrė Tuomas Sandholmas , CMU kompiuterių mokslų katedros profesorius ir jo absolventas Noamas Brownas . Sandholmas, žaidimų teorijos ir dirbtinio intelekto ekspertas, emigravęs iš Suomijos doktorantūros studijoms, sako, kad nuostabu, kad žmonės taip ilgai sugebėjo aplenkti kompiuterius. Man tiesiog kyla mintis, kokie geri yra šie geriausi profesionalai“, – sako jis. „Iš visų šių žaidimų, kuriuos veikė AI, [pokeris] yra vienintelis žaidimas, kuriame AI nepasiekė viršžmogiško našumo.
AI tyrinėtojai naudoja žaidimų teoriją arba strateginių sprendimų priėmimo matematiką, kad surastų geriausią strategiją, atsižvelgiant į įvairius neapibrėžtumus, vadinamą pusiausvyra. Kadangi galimybės yra labai plačios, tai paprastai apima tam tikrą aproksimaciją.
Ar judėjimas yra geras, ar ne, priklauso nuo dalykų, kurių negalite stebėti, sako Vincentas Conitzeris , Duke universiteto profesorius, dėstantis AI ir žaidimų teoriją. Tai taip pat lemia poreikį būti nenuspėjamam. Jei niekada neblefuojate, nesate geras žaidėjas. Jei visada blefuojate, nesate geras žaidėjas. Žaidimo teorija pasakoja, kaip atsitiktinai suskirstyti žaidimą taip, kad jis tam tikra prasme būtų optimalus.
Praėjusiais metais Sandholmas vadovavo ankstesnės pokerio žaidimo programos „Claudico“ kūrimui, kuri buvo stipriai įveikta rungtynėse prieš kelis profesionalius pokerio žaidėjus. Jis paaiškina, kad Libratus naudoja keletą naujų pasiekimų, kad pasiektų tokį aukštą žaidimo lygį. Tai apima naują pusiausvyros aproksimavimo metodą, sako Sandholmas, taip pat keletą naujų galimų rezultatų analizės metodų, kai kortos atskleidžiamos vėlesniuose žaidimo etapuose. Ši žaidimo pabaigos analizė yra labai sudėtinga skaičiavimo prasme ir atliekama per kiekvieną žaidimą Pitsburgo superkompiuterių centre, CMU ir Pitsburgo universiteto valdomame objekte.
Dėl mašininio mokymosi ir AI pažangos pastaruoju metu atsirado daugybė antžmogiškų žaidimų programų. Praėjusiais metais „DeepMind“, „Alphabet“ dukterinės įmonės, mokslininkai sukūrė programą, galinčią įveikti vieną geriausių pasaulyje „Go“ žaidėjų. Šis pasiekimas buvo toks įspūdingas, nes „Go“ yra nepaprastai sudėtingas ir sunku išmatuoti žaidimo pažangą (žr. „Google“ AI Masters Go dešimtmečiu anksčiau, nei tikėtasi).
Keletas skirtingų tyrimų grupių yra sutelkusios dėmesį į pokerio problemą. Kita akademinė komanda iš Albertos universiteto Kanadoje ir Charleso universiteto bei Čekijos technikos universiteto Čekijoje neseniai sukūrė programą, vadinamą DeepStack , kuris jau įveikė keletą profesionalių žaidėjų „heads-up be limito Texas hold’em“ žaidime (žr. Pokeris yra naujausias žaidimas, skirtas nusimesti prieš AI). Tačiau Sandholmas teigia, kad rungtynėse su „Libratus“ dalyvaujantys žaidėjai yra daug stipresni ir žaidžia daug daugiau rankų prieš mašiną, o tai turėtų suteikti didesnę statistinę reikšmę rezultatui.
Metodai, naudojami kuriant išmanesnį pokerio robotą, gali turėti daugybę realaus pasaulio pritaikymų. Žaidimų teorija jau buvo pritaikyta tiriant trukdymo atakas ir kibernetinį saugumą, automatizuotas taksi paslaugų gaires ir robotų planavimą. Samas Ganzfriedas , kuris dalyvavo kuriant Claudico ir dabar yra Floridos tarptautinio universiteto Majamyje docentas.
Tačiau net jei Svarstyklės triumfuoja šią savaitę, tai nereiškia, kad žmonės nebėra verti vietos prie kortų stalo. Kelių žaidėjų beribio Texas hold'em versijos negalima įvaldyti naudojant Libratus naudojamus metodus.