„OpenAI“ kvaili sumo imtynių robotai yra protingesni, nei atrodo

Kategorija: Neįtraukta į kategorijas Paskelbta spalio 12 d

Tai gali būti virtualus kraujo sportas absurdiškoje techno-ateityje.





„OpenAI“, tyrimų institutas, remiamas Elono Musko ir kelių kitų Silicio slėnio iniciatyvų, atskleidė savo naujausius tyrimus, susijusius su galingesnių mašininio mokymosi formų kūrimu. Ir tai demonstruoja technologiją naudojant virtualias sumo imtynes.

Virtualūs imtynininkai gali atrodyti šiek tiek juokingai, tačiau jie taiko labai protingą mokymosi metodą greitai besikeičiančioje aplinkoje, kai susiduria su priešininku.

Agentai naudoja sustiprinimo mokymosi formą, techniką, įkvėptą gyvūnų mokymosi per grįžtamąjį ryšį. Jis pasirodė naudingas mokant kompiuterius žaisti žaidimus ir valdyti robotus (žr. 10 Breakthrough Technologies 2017: Inforcement Learning).



Vienas iš didelių iššūkių naudojant sustiprinimo mokymąsi yra tai, kad jis neveikia taip gerai tikroviškesnėse situacijose, kai viskas nuolat keičiasi. OpenAI jau sukūrė savo sustiprinimo algoritmą, vadinamą proksimalinės politikos optimizavimas (PPO) , kuri ypač tinka besikeičiančiai aplinkai.

Naujausias darbas, atliktas bendradarbiaujant su Carnegie Mellon universiteto ir UC Berkeley mokslininkais, demonstruoja būdas AI agentams pritaikyti tai, ką mokslininkai vadina meta-mokymosi sistema. Tai reiškia, kad agentai gali perimti tai, ką jau išmoko, ir pritaikyti tai naujoje situacijoje.

RoboSumo aplinkoje (žr. vaizdo įrašą aukščiau) agentai pradėjo elgtis atsitiktinai. Per tūkstančius bandymų ir klaidų kartojimų jie palaipsniui išsiugdė gebėjimą judėti ir galiausiai kovoti. Tolesniais kartojimais imtynininkai sugebėjo vengti vienas kito ir netgi suabejoti savo veiksmais. Šis mokymasis įvyko skrendant, agentams prisitaikant, net ir grūmėsi tarpusavyje.



Lankstus mokymasis yra labai svarbi žmogaus intelekto dalis ir bus labai svarbu, jei mašinos taps pajėgios atlikti bet ką, išskyrus labai siauras užduotis realiame pasaulyje. Tokį mokymąsi labai sunku įgyvendinti mašinose, o naujausias darbas yra mažas, bet reikšmingas žingsnis ta kryptimi.

Tyrėjai nustatė, kad naudojant meta-mokymąsi, jų sumo robotai galėtų greičiau išmokti efektyvių strategijų. Taigi, net jei jie atrodo šiek tiek nelaimingi, nenuvertinkite jų.