Robotai gauna anuliavimo mygtuką, kuris gali padėti jiems mokytis greičiau

Kategorija: Neįtraukta į kategorijas Paskelbta Lapkričio 27 d

Gilus mokymasis veikia panašiai kaip vaikas, mokantis įgūdžių: praktika daro tobulą. Tačiau autonominiam agentui, pavyzdžiui, robotui, jo aplinka turi būti iš naujo nustatyta į pradinę būseną tarp bandymų – tai darbas, kuris gali užtrukti kelias valandas, pavyzdžiui, žmonėms slankiojant aplink objektus.





Naujas arXiv popierius „Google Brain“, Kembridžo universiteto, Maxo Plancko intelektualiųjų sistemų instituto ir UC Berkeley mokslininkai pateikia metodą, kuris gali išmokyti agentą iš naujo nustatyti aplinką kitam bandymui, taip pat neleisti jam atlikti veiksmų, kurie būtų negrįžtamas.

Jų pažanga buvo suteikti agentams perkėlimo ir naujo nustatymo politiką, kuri veiktų kartu. Nors pirmaujančios politikos užduotis yra išmokti įgūdžių, paspaudus atstatymą agentas išmoksta nepalikti pėdsakų ir veiksmingai atsukti veiksmą. Veiksmai, kurie, roboto manymu, būtų negrįžtami, nutraukiami kuo greičiau.

Tyrėjai rašo, kad jie siekė suteikti savo agentams intuiciją klasifikuoti viską, kas yra grįžtama, kaip saugią, nes įmanoma grįžti į pradinę būseną. Per bandymus ir klaidas agentas atranda, kad vis daugiau veiksmų yra grįžtami, todėl jis gali saugiai tyrinėti.



Gilus sustiprinimas dažnai mokomasi modeliuojant, o ypač tada, kai tikroji aplinka bus mažiau atlaidi klaidai, pavyzdžiui, autonominis automobilis, važiuojantis per uolą. Netgi esant saugesnėms situacijoms, rankinio atstatymo laukimas gali tapti kliūtimi renkant duomenis. Dėl šios priežasties komandos darbas apsiribojo virtualiomis aplinkomis. Tačiau galiausiai reikia atlikti bandymus realiame pasaulyje, o šis tyrimas gali padaryti jį greitesnį ir saugesnį.

Kaip pažymi Jackas Clarkas savo Importuoti AI naujienlaiškis , šis dokumentas pakartoja šiame straipsnyje aprašytą darbą kitas popierius (PDF) iš Facebook AI tyrimų praėjusį mėnesį, kuriame vienas agentas turi du skirtingus režimus, pravarde Alisa ir Bobas, iš kurių vienas bando pakeisti užduotį, kurią bandė atlikti kitas. Toks darbas, skirtas dirbtinio intelekto planavimui į priekį, gali išgelbėti jį (ir mus) nuo pražūtingų klaidų ateityje.