211service.com
„DeepMind“ AI dabar gali žaisti visus 57 „Atari“ žaidimus, tačiau jis vis dar nėra pakankamai universalus
Kategorija: Dirbtinis intelektas Paskelbta Balandžio 01 d
Naujienos: Dirbtinis intelektas vadinamas Agent57 išmoko žaisti visus 57 Atari vaizdo žaidimus Arcade Learning aplinkoje – klasikinių žaidimų kolekcija, kurią tyrinėtojai naudoja norėdami išbandyti savo gilaus mokymosi modelių ribas. „DeepMind“ sukurtas „Agent57“ naudoja tą patį gilaus sustiprinimo mokymosi algoritmą, kad pasiektų viršžmogišką žaidimo lygį net žaidimuose, su kuriais kovojo ankstesni AI. Galimybė išmokti 57 skirtingas užduotis daro Agent57 universalesnį nei ankstesni žaidimo AI.
Kas yra žaidime? Žaidimai yra puikus būdas išbandyti AI. Jie pateikia įvairių iššūkių, kurie verčia dirbtinį intelektą sugalvoti įvairių strategijų ir vis tiek turi aiškų sėkmės matą – balą, su kuriuo reikia treniruotis. Tačiau ypač keturis „Atari“ žaidimus sunku įveikti. Filme Montezuma's Revenge and Pitfall dirbtinis intelektas turi išbandyti daugybę skirtingų strategijų, prieš pradėdamas laimėti. „Solaris“ ir „Skiing“ gali tekti ilgai laukti nuo veiksmo iki atlygio, todėl AI sunku išmokti, kurie judesiai atneša didžiausią atlygį.
Meta-protas: Siekdama įveikti šiuos iššūkius, „Agent57“ sujungia daugybę patobulinimų, kuriuos „DeepMind“ padarė savo „Deep-Q“ tinkle, AI, kuris pirmą kartą įveikė keletą „Atari“ žaidimų 2012 m., įskaitant atminties formą, leidžiančią priimti sprendimus pagal anksčiau turėtus dalykus. matomas žaidime ir atlygio sistemose, kurios skatina AI išsamiau išnagrinėti savo galimybes prieš priimant strategiją. Tada šiuos įvairius metodus valdo metavaldiklis, kuris subalansuoja kompromisus tarp konkrečios strategijos ir daugiau tyrinėjimo.
Kodėl tai svarbu: Nepaisant sėkmės, geriausi gilaus mokymosi modeliai, kuriuos šiandien turime, nėra labai universalūs. Dauguma linkę būti geri viename ir tik viename dalyke. Išmokyti dirbtinį intelektą, kad jis puikiai atliktų daugiau nei vieną užduotį, yra vienas didžiausių atvirų gilaus mokymosi iššūkių. Galimybė išmokti 57 skirtingas užduotis daro „Agent57“ universalesnį nei ankstesni žaidimo AI, tačiau – ir tai dažnai praleidžiama – ji vis tiek negali išmokti žaisti daugiau nei vieno žaidimo vienu metu. Agent57 gali išmokti žaisti 57 žaidimus, bet negali išmokti žaisti 57 žaidimus vienu metu. Jis turi būti perkvalifikuotas kiekvienam naujam žaidimui, net jei jis gali naudoti tą patį algoritmą. Tokiu būdu Agent57 yra panašus į AlphaZero, DeepMind giliai sustiprinantį mokymosi algoritmą, kuris gali išmokti žaisti šachmatais, Go ir Shogi, bet vėlgi, ne viską iš karto. Tikrasis universalumas, kuris taip lengvai pasiekiamas žmogaus kūdikiui, vis dar yra toli už AI.