211service.com
Kulinarinės knygos, Vikipedija ir automatiškai sugeneruota „Spanglish“: neįprasti būdai, kaip dirbtinio intelekto tyrinėtojai renka duomenis
Joe Raedle / Getty Images
Duomenys yra alyva, kuri skatina dirbtinio intelekto vystymąsi, ir tai suteikia mums daug pažangos, kurią laikome savaime suprantamu dalyku: „YouTube“ antraštes, „Spotify“ muzikos rekomendacijas, tuos baisius skelbimus, kurie jus seka internete.
Tačiau kai reikia rinkti naudingus duomenis, AI ekspertai dažnai turi būti kūrybingi. Paimkite natūralios kalbos apdorojimą (NLP) – dirbtinio intelekto polaukį, kuriame daugiausia dėmesio skiriama kompiuterių mokymui, kaip analizuoti žmonių kalbą. Kasmetinėje NLP empirinių metodų konferencijoje ekspertai pristatė platų tyrimų spektrą, kuris buvo pagrįstas tam tikrais išradingais būdais surinkta informacija. Žemiau apibendriname keturis mėgstamiausius projektus.
ISPANLIJA
Tarp šių metų straipsnių apie daugiakalbį NLP „Microsoft“. pristatė vieną kurios buvo sutelktos į kodų mišrios kalbos apdorojimą – tekstą arba kalbą, kuri sklandžiai persijungia tarp dviejų kalbų. Atsižvelgiant į tai, kad daugiau nei pusė pasaulio gyventojų yra daugiakalbiai, ši nepakankamai ištirta sritis yra svarbi.
Tyrėjai pradėjo nuo spanglish (ispanų ir anglų kalbų), tačiau jiems trūko pakankamai spangliško teksto, kad galėtų išmokyti mašiną. Nors kodų maišymas yra įprastas daugiakalbiame pokalbyje, jis retai randamas tekste. Siekdami įveikti šį iššūkį, mokslininkai parašė programą, skirtą anglų kalbai įtraukti į „Microsoft Bing“ vertėją ir įvesti kai kurias frazes iš ispanų kalbos vertimo į originalų tekstą. Programa užtikrino, kad sukeisti žodžiai ir frazės turėtų tą pačią reikšmę. Tiesiog taip jie galėjo sukurti tiek „Spanglish“, kiek jiems reikėjo.
Gautas NLP modelis pranoko ankstesnius modelius, kurie buvo mokomi tik ispanų ir anglų kalbomis. Tyrėjai tikisi, kad jų darbas ilgainiui padės sukurti daugiakalbius pokalbių robotus, galinčius natūraliai kalbėti mišria kodo kalba.
VIRTINIMO KNYGOS
Receptai puikiai tinka gaminant maistą, tačiau jie taip pat gali pamaitinti mašinas. Jie visi laikosi panašaus žingsnis po žingsnio modelio ir dažnai juose yra tekstą atitinkančių paveikslėlių – puikus struktūrinių duomenų šaltinis, skirtas mokymo mašinoms suprasti tekstą ir vaizdus tuo pačiu metu. Štai kodėl Hacettepe universiteto Turkijoje mokslininkai sudarė milžinišką duomenų rinkinį apie 20 000 iliustruotų maisto gaminimo receptų. Jie tikisi, kad tai bus naujas šaltinis bendram vaizdo ir teksto suvokimo efektyvumui įvertinti.
Tai, ką jie vadina RecipeQA, bus paremta ankstesniais tyrimais, kuriuose daugiausia dėmesio buvo skirta mašininio skaitymo supratimui ir vaizdiniam supratimui atskirai. Pirmuoju atveju mašina turi suprasti klausimą ir susijusią ištrauką, kad rastų atsakymą; pastarojoje ji ieško atsakymo susijusioje nuotraukoje. Jei tekstas ir nuotraukos yra greta, užduotis tampa sudėtingesnė, nes nuotraukos ir tekstas gali dalytis papildoma arba pertekline informacija.
TRUMPESNI SAKINIAI
„Google“ nori, kad dirbtinis intelektas pagyvintų jūsų prozą. Šiuo tikslu mokslininkai sukūrė didžiausias visų laikų duomenų rinkinys už ilgų sakinių suskaidymą į mažesnius, turinčius lygiavertę reikšmę. Kur rasite daugybę redagavimo duomenų? Vikipedija, žinoma.
Iš turtingos Vikipedijos redagavimo istorijos tyrimo grupė išskyrė atvejus, kai žmonės dalija ilgus sakinius. Rezultatas: 60 kartų daugiau skirtingų sakinio dalių pavyzdžių ir 90 kartų daugiau žodyno žodžių, nei buvo rasta ankstesniame šios užduoties etalono duomenų rinkinyje. Duomenų rinkinys taip pat apima kelias kalbas.
Kai jie parengė mašininio mokymosi modelį pagal savo naujus duomenis, jis pasiekė 91% tikslumą. (Čia procentas atspindi sakinių, kurie išlaikė prasmę ir gramatinį taisyklingumą po perrašymo, dalį.) Palyginimui, modelis, parengtas remiantis ankstesniais duomenimis, pasiekė tik 32 % tikslumą. Kai jie sujungė abu duomenų rinkinius ir parengė kitą modelį, jis pasiekė 95% tikslumą. Tyrėjai padarė išvadą, kad ateityje būtų galima patobulinti radus dar daugiau duomenų šaltinių.
SOCIALINĖS MEDŽIAGOS POŽIŪRIS
Tyrimai parodė, kad mūsų sukurta kalba gali puikiai nuspėti mūsų rasę, lytį ir amžių, net jei ši informacija niekada nėra aiškiai nurodyta. Turėdami tai omenyje, Izraelio Bar-Ilan universiteto ir Alleno dirbtinio intelekto instituto mokslininkai bandė naudoti AI, kad pašalintų teksto šališkumą. pašalinti tuos įterptus indikatorius .
Norėdami gauti pakankamai duomenų, kurie galėtų atspindėti skirtingų demografinių rodiklių kalbų modelius, jie kreipėsi į „Twitter“. Jie surinko daugybę vartotojų tviterinių žinučių, kurios buvo tolygiai paskirstytos tarp ne ispanų baltųjų ir ne ispanų juodaodžių; tarp vyrų ir moterų; ir tarp 18–34 metų ir vyresnių nei 35 metų amžiaus žmonių.
Tada jie naudojo priešpriešinį metodą – supriešino du neuroninius tinklus – norėdami išsiaiškinti, ar jie galėtų automatiškai pašalinti būdingus demografinius rodiklius iš tviterių. Vienas neuroninis tinklas bandė nuspėti demografinius rodiklius, o kitas bandė pakoreguoti tekstą, kad jis būtų visiškai neutralus, siekdamas sumažinti pirmojo modelio numatymo tikslumą iki 50% (arba tikimybės). Šis metodas galiausiai žymiai sumažino rasės, lyties ir amžiaus rodiklius, bet ne visiškai.