211service.com
Interneto įdėjimas į skaičiuoklę
Žiniatinklyje yra laisvai prieinamas didžiulis duomenų kiekis, todėl daugeliui įmonių tai gali būti potencialus lobis, jei jie supras, kaip juos efektyviai panaudoti.

Rūšiavimas ir filtravimas: „BigSheets“ leidžia vartotojams analizuoti nestruktūrizuotus duomenis iš žiniatinklio naudojant įrankius, panašius į tuos, kurie yra darbalaukio skaičiuoklių programinėje įrangoje.
Pavyzdžiui, prieš įsigydama kitą įmonę bendrovė gali peržiūrėti duomenis iš JAV patentų ir prekių ženklų tarnybos ir teismo įrašus, kad sužinotų, ar jos intelektinė nuosavybė nėra susijusi su teisiniais veiksmais. Tačiau praktiškai norint gauti tiek informacijos, reikia laiko ir pastangų.
IBM tikisi, kad naujas įrankis, vadinamas BigSheets , padės vartotojams lengviau analizuoti žiniatinklio duomenis. Bendrovė sukūrė bandomąją programinės įrangos versiją Britų bibliotekai.
Bet kuris vartotojas gali atlikti savo įdomias analizes, sako Rodas Smithas, IBM naujų interneto technologijų viceprezidentas.
„BigSheets“ yra sukurta ant kitos programinės įrangos, vadinamos „Hadoop“. Tai atvirojo kodo platforma, skirta apdoroti labai didelius žiniatinklio duomenų kiekius, padalijant užduotis ir perduodant jas į skirtingų kompiuterių grupę. „Hadoop“ dažnai naudojama dideliems nestruktūrizuotų žiniatinklio duomenų kiekiams analizuoti.
„BigSheets“ naudoja „Hadoop“, kad galėtų naršyti tinklalapiuose, analizuoti juos, kad išgautų pagrindinius terminus ir kitus naudingus duomenis. „BigSheets“ sutvarko šią informaciją į labai didelę skaičiuoklę, kurioje vartotojai gali ją analizuoti naudodami tokius įrankius ir makrokomandas, kurie yra darbalaukio skaičiuoklių programinėje įrangoje. Tačiau skirtingai nuo įprastos skaičiuoklių programinės įrangos, naudojant BigSheets sukurtos skaičiuoklės dydis neribojamas.
Norėdamas naudoti BigSheets, vartotojas nukreipia įrankį į URL rinkinį arba duomenų saugyklą. Terminų sąrašai gali būti naudojami duomenims suskirstyti į eilutes ir lenteles, o vėliau juos galima koreguoti.
Smithas teigia, kad IBM pasirinko skaičiuoklę kaip duomenų tvarkymo modelį, nes dauguma vartotojų jau yra susipažinę su tokia programine įranga. Jei vartotojai nori pateikti duomenis sudėtingesniais būdais, įrankis veiks su IBM vizualizacijos įrankiu, vadinamu Daug akių , taip pat kita vizualizavimo programinė įranga.

Pažymėti komandą: Vizualizacijos įrankius galima naudoti su BigSheets, kad būtų galima rasti nestruktūrizuotų duomenų šablonus.
„BigSheets“ turi tokį integracijos lygį, kokio aš nemačiau, sako Aš esu Lorica , techninės leidybos bendrovės „O'Reilly Media“ tyrimų grupės vyresnioji analitikė. Tradiciškai, pasak Lorica, įmonės padalino funkcijas, kurias atlieka BigSheets, į tris atskiras užduotis – žiniatinklio tikrinimą, duomenų analizę ir vizualizavimą. Kadangi „BigSheets“ sukurta remiantis „Hadoop“, kuri iš esmės sukurta dirbti su didžiuliu duomenų kiekiu, Lorica teigia, kad „BigSheets“ nėra problema.
Tačiau jis įspėja, kad BigSheets yra ankstyvoje stadijoje ir turi būti išbandytas su kitais duomenimis. Kadangi technologija kuriama kartu su tam tikrais IBM partneriais, neaišku, kaip lengva įmonei būtų pradėti ją naudoti, sako jis. „Hadoop“ klasterio nustatymas gali būti sudėtinga užduotis, sako jis, ir jei „BigSheets“ nėra tinkamai supakuotas, įmonėms gali prireikti konsultantų, kurie paruoštų kelią įrankiui.
Pirmasis BigSheets bandymas buvo atliktas Britų bibliotekoje, kuri nuo 2004 m. dirbo kurdama maždaug aštuonių milijonų JK svetainių archyvą. Reguliariai biblioteka daro tinklalapių momentines nuotraukas, konvertuoja jas į archyvinio failo formatą ir išsaugo. Tačiau šių duomenų paieška ir analizavimas yra dar vienas iššūkis, ir čia atsirado „BigSheets“.
Smithas teigia, kad per mažiau nei aštuonias valandas jo komanda paėmė 4,5 terabaito archyvo failų ir apdorojo juos naudodama keturių įrenginių Hadoop klasterį. Vadovaudamasi Britų bibliotekos tyrėjams, komanda naudojo „BigSheets“, kad iš šių nestruktūrizuotų tinklalapių ištrauktų raktinius žodžius, informaciją apie autorius ir kitus metaduomenis. Jie eksperimentavo su terminų dažnio analize ir paleido žymų debesis bei kitas vizualizacijas.
Britų bibliotekos tyrėjai per pirmąją dieną sugebėjo pakoreguoti jiems įdomių metaduomenų tipus, daugiau dėmesio skirdami puslapių autoriams, nei jie iš pradžių ketino. Vizualizacijos suteikė naujų įžvalgų. Pavyzdžiui, naudodami žymų debesį, mokslininkai atrado, kad britų politinio veikėjo ir rašytojo vardas Alastairas Kempbelas dažnai buvo klaidingai rašomas kaip Alistair, todėl atsirado daug svarbių įrašų, kurie galėjo būti lengvai nepastebėti.
Eitanas Adaras , Mičigano universiteto informacijos ir kompiuterių mokslo docentas, tyrinėjantis interneto masto sistemas, teksto gavybą ir vizualizaciją, teigia, kad įrankis gali turėti didelį poveikį. Nors atrodo, kad Britų bibliotekos turinys apsiriboja keliomis kiekvieno puslapio momentinėmis nuotraukomis, tai vis tiek reiškia daugybę duomenų, o paprasčiausiai pateikti paieškos rezultatus atsakant į užklausą nėra naudinga, sako Adaras.
Adaras sukūrė savo įrankį, vadinamą Zoetropas , skirtą analizuoti, kaip tinklalapiai keitėsi laikui bėgant. Jis sako, kad „BigSheets“ suteikia naujų įžvalgų, lygindama duomenis iš daugelio skirtingų puslapių ir laikui bėgant. Adaras teigia, kad veiksmingos vizualizacijos yra labai svarbios, kad vartotojai galėtų greitai suprasti didelius duomenų rinkinius.
Po tolesnių bandymų IBM tikisi įtraukti BigSheets į esamas paslaugas ir produktus.