211service.com
Programinė įranga išmoksta pažymėti nuotraukas
JAV mokslininkai išleido naują internetinę programą, skirtą automatiškai pažymėti vaizdus pagal jų turinį. Atlikdama pirmąjį realaus pasaulio testą, programa apdorojo tūkstančius viešai prieinamų vaizdų, esančių nuotraukų bendrinimo svetainėje. Flickr . 98 procentams visų analizuotų nuotraukų buvo sukurta bent viena tiksli žyma.
Nauja programinė įranga, vadinama ALIPRAS (Automatinis kalbinis paveikslėlių indeksavimas) naudoja statistinių metodų derinį, kad apdorotų vaizdą ir priskirtų jam 15 žodžių paketą, išdėstytą suvokimo svarbos tvarka. Šie žodžiai gali reikšti konkretų objektą paveikslėlyje, pvz., asmenį ar automobilį, arba bendresnę temą, pvz., lauką arba žmogaus sukurtą.
Žmonėms vaizdą iššifruoti yra apgaulingai paprasta. Tačiau kompiuteriams, kurie gali nepaprastai greitai ir tiksliai rūšiuoti milijonus tekstinių dokumentų, atpažinti vaizdo turinį tebėra velniškai sudėtinga užduotis.
Atpažinti, ką vaizdas reiškia semantiškai, yra viena iš sunkiausių dirbtinio intelekto problemų, sako Jia Li, matematikas iš Pensilvanijos valstijos universiteto State College, sukūręs programinę įrangą kartu su kolega James Wang, Informacijos mokslų kolegijos nariu. Technologijos. Objektai realiame pasaulyje yra 3-D, aiškina Li. Kai jie rodomi vaizde, jie gali labai skirtis spalva, forma, gestu, dydžiu ir padėtimi, o kompiuteris paprastai neturi išankstinių žinių apie variantus.
Kadangi sudėtingas pasaulio supratimas tebėra nepajėgus kompiuteriams, reikalingi veiksmingesni regėjimo apdorojimo algoritmai, kurie padėtų jiems imituoti žmogaus regėjimą ir intelektą.
ALIPR analizuoja vaizdo pikselį po pikselio ir taiko naują statistinį metodą, kad apskaičiuotų tikimybę, kad konkretus žodis gali apibūdinti jo turinį. Tai apima spalvų ir tekstūros pasiskirstymą vaizde ir šių savybių palyginimą su saugoma žodžių ir vaizdų duomenų baze. Li ir Wang apmokė savo programą naudodami komercinę duomenų bazę, kurioje buvo apie 50 000 vaizdų, kurie jau buvo pažymėti.
Neseniai jie išbandė ALIPR su 5 411 anksčiau nematytų vaizdų, kuriuos galima rasti populiarioje nuotraukų dalijimosi svetainėje „Flickr“. 51 procento šių vaizdų pirmasis ALIPR sugeneruotas žodis pasirodė vartotojų žymose. Programa taip pat pagamino bent vieną tikslų žodį 98 procentus laiko. Tyrėjai naudojo „Flickr“ vartotojų viešai prieinamus vaizdus, kurie taip pat buvo atvirai prieinami per „Flickr“ programų programavimo sąsają.
Li sako, kad geresnė vaizdo atpažinimo programinė įranga galėtų turėti daugybę programų. Tai galėtų, pavyzdžiui, patobulinti interneto paieškos variklius arba automatiškai pažymėti skaitmeninių vaizdų kolekcijas. Li mano, kad tai taip pat gali padėti mokslininkams rūšiuoti didelius vaizdinės informacijos kiekius: vaizdų klasifikavimas kartais yra būtinas moksliniams tyrimams. Be kompiuterio pagalbos tyrėjai turi rankiniu būdu klasifikuoti vaizdus, o šis procesas gali būti lėtas ir atsilikti nuo didelio naujų vaizdų pralaidumo.
Pagrindiniai algoritmai gali būti pritaikyti įvairioms kitoms sudėtingoms skaičiavimo užduotims. Panašūs metodai gali būti taikomi vaizdo analizei ir galbūt kitoms problemoms, priduria Li.
Luisas fon Ahnas , Carnegie Mellon universiteto, Pitsburge, PA, kompiuterių mokslų docentas teigia, kad tyrimas yra žingsnis teisinga kryptimi, tačiau reikia pagerinti programinės įrangos tikslumą. Jis pažymi, kad tokiose svetainėse kaip „Flickr“ pateiktuose vaizduose dažnai yra labai panašios medžiagos. Tiesa ta, kad šie vaizdai iš esmės yra apie tą patį – žmonės dažniausiai fotografuoja kitus žmones, sako jis. Taigi vien naudojant žodį „žmonės“ jau teisingai pažymima didelė dalis vaizdų.
Von Ahn taip pat mano, kad žmonės galėtų atlikti didesnį vaidmenį mokydami regėjimo atpažinimo algoritmus. Jis valdo svetainę pavadinimu Peekaboom kuri paverčia vaizdų žymėjimą žaidimu dviems prisijungusiems žaidėjams. Kai vaizdas lėtai atskleidžiamas, kiekvienas žaidėjas turi lenktyniauti, kad surastų jam tinkamą žymą. Tai padeda išmokyti von Ahn programinę įrangą atpažinti vaizdus sutelkiant dėmesį į pagrindines dalis. Iki šiol maždaug 100 000 atskirų vaizdų buvo klasifikuojami naudojant Peekaboom, sako von Ahn.
Aleksandras Bergas Kompiuterinės regos ekspertas iš Kalifornijos universiteto Berkliuje sutinka, kad žmonės galėtų padėti kompiuteriams geriau suprasti sudėtingus duomenis. Jis teigia, kad žymos, rodomos tokiose svetainėse kaip „Flickr“ ir „YouTube“, taip pat daugelyje tinklaraščių ir naujienų svetainių, ateityje gali būti labai svarbios šiam darbui. Apskritai, vaizdų ir vaizdo įrašų paieška yra sritis, kurioje reikia didelių žingsnių, sako Bergas. Vis daugiau ir daugiau duomenų yra internete su tam tikru žmonių ženklinimu.
Tai idėja, kurią sveikina Li: kuo patikimesnius duomenis galime pasiekti ir naudoti, tuo geriau.