211service.com
Pakartokite, prašau angliškai
Nors kompiuteriu pateiktų vertimų kokybė per pastaruosius 20 metų labai pagerėjo, kai kurie rezultatai gramatiškai vis dar yra tokie pat kvaili, kaip ir instrukcijos ant lazdelės įvynioklio. Paimkite, pavyzdžiui, svetainę, skirtą a Japonijos obuolių ūkis kuri buvo konvertuota į anglų kalbą naudojant „Google“. automatinio vertimo paslauga :
Someya obelų sodas tai praeis labai! Jis pasodintas 1954 m., be to, ir dabar viršija medžio amžių 50 metų klesti, didelis - atėjus medžiui nenormalus žaisti aligatorius obuolys apvaisinamas. Skanus obuolys, kuriame dienos ir nakties temperatūrų skirtumas sugriežtėjo iki ekstremalios Gunmos prefektūros Numatos miestas, kuriame keturi metų laikai aiškūs dideli gamta, kieti. *
Taip, bendras vaizdas matomas, bet daug ką praranda „Google“ vertimo iš japonų į anglų kalbą algoritmas. „Google“ jau keletą metų siūlo savo vertimo funkciją, kaip ir Kanadoje įsikūrusi interneto įmonė Babelio žuvis . Tačiau visai neseniai komercinės programinės įrangos kūrėjai pradėjo tyrinėti vertimą ne tik statiniame tinklalapyje ar elektroniniame dokumente, bet ir taiko technologiją realiojo laiko interneto momentinių pranešimų pokalbiams. Anksčiau šį mėnesį „AvMedia“ išleido momentinius pranešimus vertėjas sukurtas tam, kad anglakalbiams būtų lengviau bendrauti su draugais, kalbančiais vokiškai, ispaniškai, prancūziškai, itališkai ir portugališkai, ir atvirkščiai (prancūzų kalba taip pat gali būti išversta į vokiečių kalbą, o iš vokiečių – į prancūzų kalbą).
Tačiau visai šiai programinei įrangai vis dar trūksta pakankamai tikslumo, kad ji būtų naudinga sudėtingose situacijose, pavyzdžiui, verslo derybose ar karinio planavimo metu. Taip yra tikriausiai todėl, kad dauguma komercinės programinės įrangos naudoja tradicinį mašininio vertimo metodą, sako Kevinas Knightas, Pietų Kalifornijos universiteto kompiuterių mokslininkas. Informacijos mokslų institutas (ISI) ir Kalifornijoje įsikūrusios įmonės įkūrėjas Kalbų audėjas .
Tradiciškai mašininio vertimo programinė įranga priklausė nuo algoritmų, kurie rūšiuoja tūkstančius gramatikos taisyklių dviem verčiamoms kalboms, sako Knight. Jis aiškina, kad problema yra ta, kad tiek daug taisyklių, kaip ir šių taisyklių išimčių, reikia parašyti rankiniu būdu, o kai sudėtingi taisyklių rinkiniai prieštarauja vienas kitam, atsiranda netikslumų. Jei parašysite 5000-ąją taisyklę, kartais sulaužysite dalykus, sako Knight.
Su Language Weaver ir jo tyrimais USC, Knight, kaip ir keletas kitų tyrinėtojų visame pasaulyje, šią problemą sprendžia skirtingai. Užuot laikęsi griežtų gramatinių taisyklių, „Language Weaver“ suderina teisingus žodžius ir frazes įvairiose kalbose, atsižvelgdama į tikimybę, kad tokie žodžiai ir frazės yra teisingi tam tikrame kontekste.
Šis statistinis metodas remiasi daugybe jau išverstų dokumentų pavyzdžių, sako Michaelas Collinsas, MIT kompiuterių inžinierius, kuris naudoja tą patį metodą savo kuriamai programinei įrangai, kad atliktų vertimus iš vokiečių į anglų kalbą. IBM pradėjo šį metodą 1990-aisiais, sako jis, iš dalies pasinaudodamas didžiule Kanados parlamento posėdžių duomenų baze, paskelbta prancūzų ir anglų kalbomis.
Knight teigia, kad statistinė mašininio vertimo įvairovė ne tik duoda geresnių rezultatų nei tradicinis metodas, bet ir programinė įranga sukurta taip, kad būtų toliau tobulinama pati. Kuo daugiau išverstų dokumentų susidurs programinė įranga, tuo didesnė tikimybė, kad ji teisingai atitiks frazes. Prieš keletą metų mūsų kinų ir arabų kalbomis galėjome gauti tik pagrindinę straipsnio temą, sako Knight. Dabar rezoliucija yra sakinio lygyje. [Tęsinys kitame puslapyje ]
-
* Pataisa, 2006 m. sausio 18 d., 10:00 EST: Originalioje šios istorijos versijoje citavome tokį Someya Apple Farm svetainės vertimą: Obuolių sodas su dideliais medžiais, vyresniems nei 50 metų. Natūrali aplinka aplink Numata su didžiuliu temperatūrų skirtumu tarp dienos ir nakties sukuria unikaliai skanų obuolį. Tiesą sakant, tai buvo ištrauka iš „Google“ vertimo iš „Apple Farm“ svetainės angliškos versijos, o ne iš „Google“ vertimo iš originalaus japoniško puslapio. Todėl tai nebuvo tinkamas kai kurių mašininio vertimo algoritmų prastos kokybės pavyzdys. Istorijoje dabar pakeitėme „Google“ originalios japoniškos svetainės vertimą. Dėkojame mūsų skaitytojams, kad atkreipė dėmesį į klaidą. - Red.
JAV gynybos pažangių tyrimų projektų agentūra (DARPA) yra viena iš pagrindinių statistinio mašininio vertimo finansuotojų. Praėjusį rugpjūtį DARPA rėmė kinų ir arabų kalbų dokumentų automatinio vertimo testus; „Google“ tyrimų grupė surinko aukščiausią balą, išstumdama USC Informacijos mokslų institutą ir IBM mašininio vertimo grupę. Knight pažymi, kad „Google“, kuri taip pat naudoja statistinį metodą, galėjo turėti pranašumą, nes ji galėjo naudoti daugybę kompiuterių, kad galėtų laužyti žodžius, ir iš viso interneto galėjo gauti iš anksto išverstų dokumentų duomenų bazę.
2005 m. DARPA taip pat paskelbė apie Global Autonomous Language Exploitation (GALE) programą, skirtą pagreitinti didžiulio išverstų dokumentų, gautų naudojant pagrindinę programą, Filadelfijoje, kompiuterinį apdorojimą. Lingvistinių duomenų konsorciumas .** GALE šiuo metu veikia pirmaisiais metais ir transkribuos kalbą iš transliuojamų naujienų šaltinių ir pokalbių laidas arabų, kinų ir anglų kalbomis, taip pat kataloguos tekstinius naujienų kanalus, žiniatinklio naujienų diskusijų grupes ir tinklaraščius tomis kalbomis. Šiuo metu projektas daugiausia orientuotas į šių žanrų duomenų rinkimą, o didžiąją darbo dalį atlieka Pensilvanijos universiteto kompiuterių ir inžinerijos mokslų skyriaus mokslininkai.
Tačiau net ir turint didelę išverstos medžiagos kolekciją, vis tiek teks išspręsti kalbos problemų. Kitas mašininio vertimo tyrimo žingsnis, be žodžių ir frazių derinimo, sako Knight, yra išlyginti gramatinius neatitikimus, atsirandančius sujungiant žodžius ir frazes. Šį išlyginimą galima atlikti indeksuojant milijonus sakinių, kurių struktūra buvo sudaryta Pensilvanijos universitete 1990-aisiais (duomenys gauti iš 50 000 sakinių „Wall Street Journal“. ). Panašiai kaip duomenų ir frazių pilna duomenų bazė leidžia vertimo programinei įrangai pasirinkti statistiškai labiausiai tikėtiną žodžių derinį, šie konkretūs gramatikos pavyzdžiai iš diagramų sakinių padeda programinei įrangai priskirti žodžių tvarkos tikimybę, sako MIT Collinsas.
Tai yra pažanga, palyginti su tradiciniu metodu, kai gramatikos taisyklės buvo nustatytos algoritme, sako jis. Užuot paklusus užkoduotoms gramatikos taisyklėms algoritme, kaip taikant tradicinį mašininį vertimą, diagraminė sakinių duomenų bazė leidžia programinei įrangai priskirti tikimybes ir svorį šioms taisyklėms, sako Collinsas. Jis sako, kad [programinė įranga] labiau išmoks kontekstą.
Tačiau kai kuriais atžvilgiais statistinis metodas bus toks geras, kaip įprastas momentinių pranešimų vertėjas. Pavyzdžiui, tinkami pavadinimai vis tiek užklumpa net geriausiai skaitomus mašininius vertėjus ir dažnai tiesiog išverčiami kartu su likusiu tekstu. Pagal savo sistemą Knight pripažįsta, kad ispaniška jo pavardė vis dar yra Kevinas Caballero.
** Pataisa, 2006 m. sausio 20 d.: pradinėje šios istorijos versijoje, paskelbtoje sausio 18 d., buvo teigiama, kad kalbinių duomenų konsorciumas buvo įkurtas 2005 m. Tiesą sakant, konsorciumas buvo įkurtas 1992 m., o jo pasaulinio autonominio kalbų naudojimo projektas buvo pradėtas. 2005 m. – Red.