211service.com
„OpenAI“ fantastiką skleidžiantis AI mokosi generuoti vaizdus
Benas Barry / OpenAI
Praėjusių metų vasarį San Franciske įsikūrusi tyrimų laboratorija OpenAI paskelbė kad jos AI sistema dabar gali rašyti įtikinamus anglų kalbos fragmentus. Įveskite sakinio ar pastraipos pradžią į GPT-2, kaip ji buvo vadinama, ir ji galėtų tęsti mintį tiek pat, kiek esė su beveik žmogaus nuoseklumu.
Dabar laboratorija tiria, kas nutiktų, jei tas pats algoritmas būtų įtrauktas į vaizdo dalį. Rezultatai , kurie šios savaitės tarptautinėje mašininio mokymosi konferencijoje buvo įvertinti kaip geriausias pranešimas, atveria naują kelią įvaizdžių kūrimui, pribrendusiam su galimybėmis ir pasekmėmis.
Iš esmės GPT-2 yra galingas numatymo variklis. Jis išmoko suvokti anglų kalbos struktūrą žiūrėdamas į milijardus žodžių, sakinių ir pastraipų pavyzdžių, iškrapštytų iš interneto kampelių. Naudodamas tokią struktūrą, jis galėtų manipuliuoti žodžiais į naujus sakinius, statistiškai numatydamas, kokia tvarka jie turėtų pasirodyti.
Taigi „OpenAI“ mokslininkai nusprendė pakeisti žodžius pikseliais ir išmokyti tą patį algoritmą vaizdams „ImageNet“, populiariausiame gilaus mokymosi vaizdų banke. Kadangi algoritmas buvo sukurtas dirbti su vienmačiais duomenimis (t. y. teksto eilutėmis), jie išskleidė vaizdus į vieną pikselių seką. Jie nustatė, kad naujasis modelis, pavadintas iGPT, vis dar sugebėjo suvokti dvimates vizualinio pasaulio struktūras. Atsižvelgiant į pikselių seką pirmoje vaizdo pusėje, ji galėtų numatyti antrąją pusę taip, kaip žmogus laikytų protingu.
Žemiau galite pamatyti keletą pavyzdžių. Kairysis stulpelis yra įvestis, dešinysis stulpelis yra originalas, o viduriniai stulpeliai yra numatomi iGPT užbaigimai. (Žr. daugiau pavyzdžių čia .)
OPENAIRezultatai yra stulbinančiai įspūdingi ir parodo naują būdą, kaip naudoti neprižiūrimą mokymąsi, kuris mokomasi naudojant nepažymėtus duomenis, kuriant kompiuterinės regos sistemas. Nors ankstyvosios kompiuterinės regos sistemos 2000-ųjų viduryje išbandė tokius metodus anksčiau, jos nukrito, nes prižiūrimas mokymasis, kuriame naudojami pažymėti duomenys, pasirodė esąs daug sėkmingesnis. Tačiau neprižiūrimo mokymosi privalumas yra tas, kad jis leidžia dirbtinio intelekto sistemai sužinoti apie pasaulį be žmogaus filtro ir žymiai sumažina rankų darbo ženklinant duomenis.
Tai, kad iGPT naudoja tą patį algoritmą kaip ir GPT-2, taip pat rodo daug žadantį jo pritaikomumą. Tai atitinka Didžiausias OpenAI siekis pasiekti labiau apibendrinamą mašinos intelektą.
Tuo pačiu metu šis metodas yra naujas būdas sukurti netikrus vaizdus. Generatyvūs varžovų tinklai , labiausiai paplitusi algoritmų kategorija, kuri praeityje buvo naudojama gilioms klastotėms kurti, turi būti apmokyta remiantis labai kuruojamais duomenimis. Pavyzdžiui, jei norite, kad GAN generuotų veidą, jo mokymo duomenys turėtų apimti tik veidus. Priešingai, iGPT tiesiog pakankamai išmoksta vizualinio pasaulio struktūrą iš milijonų ir milijardų pavyzdžių, kad galėtų išspjauti vaizdus, kurie gali egzistuoti jame. Nors modelio mokymas vis dar yra brangus skaičiuojant, tai yra natūrali kliūtis prieiti prie jo, tačiau tai gali tęstis neilgai.
OpenAI nepatenkino interviu prašymo, tačiau vidinės politikos komandos posėdyje, kuriame MIT Technology Review dalyvavo praėjusiais metais, jos politikos direktorius Jackas Clarkas svarstė būsimą GPT tipo generavimo riziką, įskaitant tai, kas atsitiktų, jei ji būtų pritaikyta vaizdai. Jis sakė, kad ateina vaizdo įrašas, nurodantis, kur jis matė lauko tyrimų trajektoriją. Tikriausiai po penkerių metų turėsite sąlyginį vaizdo įrašų generavimą per 5–10 sekundžių horizontą. Tada jis ėmė apibūdinti tai, ką jis įsivaizdavo: įterptumėte politiko nuotrauką ir šalia jų esantį sprogimą, ir tai sukeltų tikėtiną to politiko nužudymo rezultatą.
Atnaujinimas: Šis straipsnis buvo atnaujintas, kad būtų pašalintas politiko vardas pagal pabaigoje aprašytą hipotetinį scenarijų.