Naujasis „Facebook“ poliglotinis AI gali išversti iš 100 kalbų

Anglų-baskų žodynas

Edurne Chopeitia / Unsplash





Naujienos: Facebook yra atviro šaltinio naujas AI kalbos modelis, vadinamas M2M-100, kuris gali versti bet kurią porą iš 100 kalbų. Iš 4450 galimų kalbų derinių 1100 iš jų verčiama tiesiogiai. Tai skiriasi nuo ankstesnių daugiakalbių modelių, kuriuose kaip tarpinė kalba labai priklausoma nuo anglų kalbos. Pavyzdžiui, vertimas iš kinų į prancūzų kalbą paprastai pereina iš kinų į anglų, o po to iš anglų į prancūzų kalbą, o tai padidina klaidų tikimybę.

Duomenų tvarkymas: Modelis buvo apmokytas 7,5 milijardo sakinių porų. Siekdami sudaryti tokį didelį duomenų rinkinį, mokslininkai labai pasikliovė automatizuotu kuravimu. Jie naudojo žiniatinklio tikrinimo programas, kad išbrauktų milijardus sakinių iš žiniatinklio, ir turėjo kitą kalbos modelį, vadinamą FastText, identifikuoti kalbą. (Jie nenaudojo jokių „Facebook“ duomenų.) Tada jie panaudojo programą, pavadintą LASER 2.0, kurią anksčiau sukūrė Facebook AI tyrimų laboratorija, kuri naudoja neprižiūrimą mokymąsi – mašininį mokymąsi, kuriam nereikia rankiniu būdu žymimų duomenų, kad sakinių atitiktų skirtingomis kalbomis. jų prasmė.

LASER 2.0 sukuria vadinamuosius įterpimus iš didelių, nestruktūrizuotų sakinių duomenų rinkinių. Jame mokomasi pagal galimus sakinių pavyzdžius kiekvienoje kalboje ir nustatomi jų tarpusavio santykiai pagal tai, kaip dažnai ir kaip arti jie vartojami. Šie įterpimai padeda mašininio mokymosi modeliui apytiksliai nustatyti kiekvieno sakinio reikšmę, o tai leidžia LASER 2.0 automatiškai susieti sakinius, turinčius tą pačią reikšmę skirtingomis kalbomis.



Kalbų poravimas: Tyrėjai sutelkė dėmesį į kalbų derinius, kurių, jų nuomone, bus dažniausiai prašoma. Jie sugrupavo kalbas pagal kalbinius, geografinius ir kultūrinius panašumus, darydami prielaidą, kad žmonės, gyvenantys tame pačiame regione, bendraus dažniau. Pavyzdžiui, viena kalbų grupė apėmė dažniausiai Indijoje vartojamas kalbas, įskaitant bengalų, hindi, tamilų ir urdu. Tada LASER 2.0 nukreipė sakinių porų paiešką visose galimose kalbų porose kiekvienoje grupėje.

Nuolatiniai iššūkiai: Kalbos, kuriomis kalbama tokiose vietose kaip Afrika ir Pietryčių Azija, vis dar kenčia nuo vertimo kokybės problemų, nes prieinama per mažai kalbos duomenų, kad juos būtų galima iškrapštyti iš interneto, sako Angela Fan, vadovaujanti projekto tyrėja. Atsižvelgiant į priklausomybę nuo žiniatinklio duomenų, tyrėjai taip pat turi išsiaiškinti būdus, kaip nustatyti ir panaikinti bet kokį įterptą seksizmą, rasizmą ir kitas diskriminacines tendencijas. Šiuo metu mokslininkai naudojo nešvankybių filtrą, kad išvalytų kai kurias ypač žiaurias kalbas, tačiau dažniausiai tai apsiriboja anglų kalba.

Tik tyrimas: „Facebook“ šiuo metu neketina naudoti šio modelio savo produktuose. M2M-100 skirtas tik tyrimų tikslams, sako Fanas. Tačiau galiausiai siekiama, kad modelis patobulintų ir išplėstų esamas „Facebook“ vertimo galimybes. Programos gali apimti vartotojų bendravimą (pavyzdžiui, funkciją, leidžiančią žmonėms išversti įrašus į savo gimtąją kalbą) ir galbūt turinio moderavimą.



paslėpti