211service.com
„DeepMind“ nori išmokyti dirbtinį intelektą žaisti kortų žaidimą, kuris yra sunkesnis nei „Go“.
Jei kada nors žaidėte kortų žaidimą Hanabi, suprasite, kai pasakysiu, kad jis nepanašus į kitus. Tai bendradarbiavimo žaidimas, kuriame galite matyti visų kitų rankas, bet ne savo.
Kad laimėtų žaidimą, kiekvienas žaidėjas turi duoti kitiems užuominų apie savo rankas per ribotą skaičių raundų, kad visas kortas būtų išdėstyta tam tikra tvarka. Tai intensyvus strategijos, išvadų ir bendradarbiavimo pratimas. Štai kodėl „Google Brain“ ir „DeepMind“ tyrėjai mano, kad tai yra tobulas žaidimas dirbtiniam intelektui.
Naujame dokumente jie teigia, kad skirtingai nuo kitų AI įvaldytų žaidimų, tokių kaip šachmatai, Go ir pokeris, „Hanabi“ reikalauja proto teorijos ir aukštesnio mąstymo lygio. Proto teorija yra susijusi su kitų psichinių būsenų supratimu ir supratimu, kad jos gali skirtis nuo jūsų. Tai yra pagrindinis įgūdis, kurį žmonės naudoja siekdami efektyviai veikti pasaulyje ir kurį dažniausiai įgyjame būdami labai jauni.
Informaciją Hanabi riboja ir žaidėjams kiekviename žaidime suteikiamų užuominų skaičius, ir tai, ką galima perduoti kiekvienoje užuominoje. Dėl to dirbtinio intelekto agentas taip pat turi surinkti netiesioginę informaciją iš kitų žaidėjų veiksmų, kad laimėtų žaidimą – tai iššūkis, su kuriuo jam anksčiau nebuvo tekę susidurti.
Be to, ji turi išmokti pateikti kuo daugiau informacijos savo užuominose ir veiksmuose, kad padėtų kitiems žaidėjams pasisekti. Jei dirbtinio intelekto agentas gali sėkmingai naršyti tokioje netobulos informacijos aplinkoje, tyrėjų nuomone, tai bus vienas žingsnis arčiau veiksmingo bendradarbiavimo su žmonėmis.
Visa tai yra nauji iššūkiai mokslinių tyrimų bendruomenei ir jiems reikės naujų algoritminių pažangų, kurios susieja kelių AI posričių darbą, įskaitant mokymąsi, žaidimų teoriją ir atsirandantį bendravimą – tyrimą, kaip bendravimas tarp kelių dirbtinio intelekto agentų kyla bendradarbiavimo sąlygomis. .
Siekdama patvirtinti šią hipotezę, „Google“ komanda išbandė visus dabartinius patobulinimo mokymosi algoritmus ir nustatė, kad jie prastai veikia. Atsakydami į tai, jie išleido atvirojo kodo Hanabi aplinką, kad paskatintų tolesnį darbą mokslinių tyrimų bendruomenėje.
Mane, kaip tyrėją, sužavėjo tai, kaip dirbtinio intelekto agentai gali išmokti bendrauti ir bendradarbiauti vieni su kitais, o galiausiai ir su žmonėmis, sako Jakobas Foersteris, vienas iš šio straipsnio bendraautorių. Hanabi suteikia unikalią galimybę didžiuliam iššūkiui šioje srityje.