211service.com
Prasmės ištraukimas iš milijonų puslapių
Vašingtono universiteto mokslininkai sukūrė programinės įrangos variklį, kuris sujungia faktus perjungdamas daugiau nei 500 milijonų tinklalapių. Įrankis ištraukia informaciją iš milijardų teksto eilučių, analizuodamas pagrindinius žodžių ryšius.

Žodžio paieška : „TextRunner“ automatiškai peržiūri 500 milijonų tinklalapių, kad gautų prasmę iš žodžių santykių.
Kai kurie ekspertai teigia, kad toks automatizuotas informacijos išgavimas greičiausiai sudarys pagrindą daug protingesnei naujos kartos žiniatinklio paieškai, kai iš pradžių surenkami informacijos grynuoliai, o paskui sumaniai sujungiami.
Vašingtono universiteto projektas parodo esamos technologijos, vadinamos TextRunner, padidinimą tiek puslapių skaičiaus, tiek temų, kurias jis gali analizuoti, apimtį.
„TextRunner“ reikšmė yra ta, kad ją galima keisti, nes ji neprižiūrima, sako Peteris Norvigas, „Google“, padovanojusios „TextRunner“ analizuojamų tinklalapių duomenų bazę, tyrimų direktorius. Jis gali atrasti ir išmokti milijonus ryšių, o ne tik po vieną. Su „TextRunner“ nėra žmogaus: jis tiesiog randa ryšius pats.
Norvig paaiškina, kad ankstesnės technologijos reikalavo daugiau programuotojo nurodymų. Pavyzdžiui, norėdami rasti žmonių, kurie yra generaliniai direktoriai, vardus milijonuose dokumentų, pirmiausia turite išmokyti programinę įrangą su kitais pavyzdžiais, pvz., Steve'as Jobsas yra „Apple“ generalinis direktorius, o Sheryl Sandberg yra „Facebook“ generalinė direktorė. Norvigas priduria, kad „Google“ tai daro panašus darbas ir jau naudoja tokią technologiją ribotuose kontekstuose.
TextRunner atsikrato to rankų darbo. Naudotojas gali įvesti, pavyzdžiui, naikina bakterijas, o variklis pateiks puslapių, kuriuose pateikiama įžvalgų, kad chloras naikina bakterijas, o ultravioletinė šviesa naikina bakterijas, o šiluma naikina bakterijas – rezultatai vadinami trigubai – ir pateikia būdų, kaip peržiūrėti tekstą ir tada apsilankykite tinklalapyje, iš kurio jis ateina.
Prototipas vis dar turi a gana paprasta sąsaja ir nėra skirta viešai paieškai, o tik automatizuotai informacijos gavimui iš 500 milijonų interneto puslapių, sakoma. Oren Etzioni , Vašingtono universiteto kompiuterių mokslininkas, vadovaujantis projektui. Tai, ką mes parodome, yra programinės įrangos gebėjimas pasiekti elementarų teksto supratimą precedento neturinčiu mastu ir apimtimi, sako jis.
Etizioni sako, kad „TextRunner“ sugebėjimas greitai ir didžiuliu mastu išgauti prasmę atsirado dėl jo grupės atradimo bendro santykių išreiškimo anglų kalba modelio, kuris galioja nepaisant temos. Pavyzdžiui, paprastas modelis „entity1, verb, entity2“ apima ryšį „Edisonas išrado lemputę“, taip pat „Microsoft įsigijo Farecast“ ir daugelį kitų, sako jis. „TextRunner“ remiasi šiuo modeliu, kuris automatiškai išmokstamas iš teksto, kad galėtų analizuoti sakinius ir labai tiksliai išgauti trigubus.
„TextRunner“ taip pat yra atspirties taškas, leidžiantis daryti išvadas iš natūralios kalbos užklausų, prie kurios dabar dirba grupė. Pateikiame paprastą pavyzdį: jei „TextRunner“ randa tinklalapį, kuriame rašoma, kad žinduoliai yra šiltakraujai, ir kitą tinklalapį, kuriame sakoma, kad šunys yra žinduoliai, išvadų variklis pateiks informaciją, kad šunys tikriausiai yra šiltakraujai.
Tai analogiška „Powerset“ sukurtai technologijai, kurią pernai įsigijo „Microsoft“. Prieš pat šį įsigijimą Powerset pristatė įrankį, kuris apsiribojo faktų ištraukimu iš maždaug dviejų milijonų Vikipedija puslapių. „TextRunner“ technologija tvarko Vikipedijos puslapius ir savavališką tekstą bet kuriame puslapyje, įskaitant tinklaraščio įrašus, produktų katalogus, laikraščių straipsnius ir kt.
Ši darbo kryptis padarė didelę pažangą sprendžiant šias užduotis, sako Jonas Kleinbergas, Kornelio universiteto kompiuterių mokslininkas, stebėjęs Vašingtono universiteto paieškos tyrimus. Jis pridūrė, kad šis darbas atspindi augančią tendenciją kurti paieškos įrankius, kurie aktyviai sujungia žiniatinklyje rastą informaciją į didesnę sintezę.