Andrew Ng: Pamirškite apie DI verslo kūrimą. Pradėkite nuo misijos.

Jeremy Portje





Andrew Ng per savo gyvenimą nešiojo daugybę skrybėlių. Galbūt žinote jį kaip įkūrėją Google Brain komanda arba buvęs vyriausiasis mokslininkas adresu Baidu . Taip pat galite pažinti jį kaip savo instruktorių. Savo nepaprastai populiariuose internetiniuose kursuose jis išmokė daugybę studentų, smalsių klausytojų ir verslo lyderių mašininio mokymosi principų.

Dabar savo naujausioje įmonėje AI nusileidimas , kurį jis pradėjo 2017 m., jis tiria, kaip įmonės, neturinčios milžiniškų duomenų rinkinių, kuriais būtų galima pasinaudoti, vis dar gali prisijungti prie AI revoliucijos.

Kovo 23 d. Ng prisijungė prie „MIT Technology Review“ virtualaus „EmTech Digital“ – kasmetinio AI renginio, kad pasidalintų pamokomis, kurias išmoko.



Šis interviu buvo sutrumpintas ir šiek tiek redaguotas siekiant aiškumo.

MIT technologijų apžvalga: Esu tikras, kad žmonės dažnai jūsų klausia: „Kaip sukurti verslą, kuriam pirmiausia reikia dirbtinio intelekto? Ką dažniausiai į tai sakai?

Andrew Ng: Aš paprastai sakau: nedaryk to. Jei einu į komandą ir sakau: „Ei, visi, pirmiausia būkite dirbtinis intelektas“, tai dažniausiai sutelkia komandą į technologijas, kurios gali būti puikios mokslinių tyrimų laboratorijoje. Tačiau kalbant apie tai, kaip vykdau verslą, esu linkęs būti klientų ar misijos vadovaujamas, beveik niekada nesivadovaudamas technologijomis.

Dabar turite šią naują įmonę, pavadintą „Landing AI“. Ar galite šiek tiek papasakoti, kas tai yra ir kodėl pasirinkote tai dirbti?

Vadovaudamas „Google“ ir „Baidu“ AI komandoms, supratau, kad AI pakeitė programinės įrangos vartotojų internetą, pvz., žiniatinklio paiešką ir internetinę reklamą. Bet aš norėjau pritaikyti AI į visas kitas pramonės šakas, kurios yra dar didesnė ekonomikos dalis. Taigi, pažvelgęs į daugybę skirtingų pramonės šakų, nusprendžiau sutelkti dėmesį į gamybą. Manau, kad kelios pramonės šakos yra paruoštos dirbtiniam intelektui, tačiau vienas iš modelių, kai pramonė yra labiau pasirengusi dirbtiniam intelektui, yra tai, kad ji yra šiek tiek pakeista skaitmenine forma, kad būtų tam tikrų duomenų. Tai sukuria galimybę dirbtinio intelekto komandoms naudoti duomenis vertei kurti.



Taigi vienas iš projektų, kuriuo pastaruoju metu jaudinuosi, yra gamybos vizualinė apžiūra. Ar galite pažvelgti į išmaniojo telefono nuotrauką, išeinančią iš gamybos linijos, ir pamatyti, ar jame nėra defektų? Arba pažiūrėkite į automobilio komponentą ir pažiūrėkite, ar jame nėra įlenkimo? Vienas didžiulis skirtumas yra vartotojų programinės įrangos internete, galbūt jūs turite milijardą vartotojų ir didžiulį duomenų kiekį. Tačiau gamyboje jokia gamykla nepagamino milijardo ar net milijono subraižytų išmaniųjų telefonų. Ačiū Dievui už tai. Taigi iššūkis yra toks: ar galite priversti dirbtinį intelektą dirbti su šimtu vaizdų? Pasirodo, dažnai galite. Tiesą sakant, ne kartą buvau nustebęs, kiek daug galite nuveikti su net nedideliais duomenų kiekiais. Taigi, nors visas ažiotažas, jaudulys ir viešasis ryšys, susijęs su AI, susiję su milžiniškais duomenų rinkiniais, manau, kad turime daug erdvės augti, kad galėtume atidaryti šias kitas programas, kuriose iššūkiai yra gana skirtingi.

Kaip tu tai padarai?

Labai dažna klaida, kurią matau daromą generalinių direktorių ir CIO: jie man sako kažką panašaus į Ei, Andrew, mes neturime tiek daug duomenų – mano duomenys yra netvarka. Taigi duokite man dvejus metus sukurti puikią IT infrastruktūrą. Tada turėsime visus šiuos puikius duomenis, kuriais remdamiesi galėsime kurti AI. Aš visada sakau: tai klaida. Nedarykite to. Pirma, nemanau, kad nė viena šiandieninė planetos įmonė – gal net ne technologijų milžinai – nemano, kad jų duomenys yra visiškai švarūs ir tobuli. Tai kelionė. Praleidę dvejus ar trejus metus gražiai duomenų infrastruktūrai sukurti reiškia, kad jums trūksta AI komandos atsiliepimų, kurie padėtų nustatyti IT infrastruktūros kūrimo prioritetą.

Pavyzdžiui, jei turite daug vartotojų, ar turėtumėte teikti pirmenybę klausimų jiems apklausoje, kad gautumėte šiek tiek daugiau duomenų? Ar gamykloje pirmenybė turėtų būti teikiama jutiklio atnaujinimui iš to, kas fiksuoja vibracijas 10 kartų per sekundę, galbūt 100 kartų per sekundę? Dažnai pradedamas vykdyti dirbtinio intelekto projektas su jau turimais duomenimis, todėl AI komanda gali pateikti jums grįžtamąjį ryšį, kad padėtų nustatyti, kokių papildomų duomenų rinkti pirmenybę.



Pramonės šakose, kuriose tiesiog neturime vartotojų programinės įrangos interneto masto, manau, kad turime pakeisti mąstymą didelis duomenis į Gerai duomenis. Jei turite milijoną vaizdų, pirmyn, naudokite jį – tai puiku. Tačiau yra daug problemų, dėl kurių gali būti naudojami daug mažesni duomenų rinkiniai, kurie yra aiškiai pažymėti ir kruopščiai kuruojami.

Ar galėtumėte pateikti pavyzdį? Ką reiškia geri duomenys?

Pirmiausia pateiksiu pavyzdį iš kalbos atpažinimo. Kai dirbau su paieška balsu, gaudavote garso klipus, kuriuose išgirstumėte ką nors sakant: Hm, šiandienos oras. Kyla klausimas, kokia yra tinkama to garso klipo transkripcija? Ar tai Um (kablelis) šiandienos oras, ar tai Um (taškas, taškas, taškas) šiandienos oras, ar Um yra kažkas, ko mes tiesiog netranskribuojame? Pasirodo, bet kuris iš jų yra tinkamas, bet negerai, jei skirtingi transkribuotojai naudoja kiekvieną iš trijų ženklinimo konvencijų. Tada jūsų duomenys yra triukšmingi ir kenkia kalbos atpažinimo sistemai. Dabar, kai turite milijonus ar milijardą vartotojų, galite turėti tuos triukšmingus duomenis ir tiesiog apskaičiuoti jų vidurkį – mokymosi algoritmas veiks gerai. Bet jei esate aplinkoje, kurioje turite mažesnį duomenų rinkinį, tarkime, šimtą pavyzdžių, tada tokio tipo triukšmingi duomenys turi didžiulį poveikį našumui.

Kitas pavyzdys iš gamybos: daug dirbome su plieno tikrinimu. Jei vairuojate automobilį, jūsų automobilio šonas kadaise buvo pagamintas iš plieno lakšto. Kartais pliene yra smulkių raukšlelių arba mažų įlenkimų ar dėmių. Taigi galite naudoti fotoaparatą ir kompiuterinį vaizdą, kad pamatytumėte, ar yra defektų, ar ne. Tačiau skirtingos etiketės ženklins duomenis skirtingai. Kai kurie aplink visą regioną pastatys milžinišką ribojančią dėžę. Kai kurie aplink mažas daleles uždės mažus ribojančius langelius. Kai turite nedidelį duomenų rinkinį, įsitikinkite, kad skirtingi kokybės inspektoriai nuosekliai pažymi duomenis – tai vienas svarbiausių dalykų.



Daugeliui AI projektų atvirojo kodo modelis, kurį atsisiunčiate iš GitHub – neuroninio tinklo, kurį galite gauti iš literatūros – yra pakankamai geras. Ne visoms problemoms, bet pagrindinėms problemoms. Taigi aš nuėjau į daugelį savo komandų ir sakiau: Sveiki, visi, neuroninis tinklas yra pakankamai geras. Nebesimaišykime su kodu. Vienintelis dalykas, kurį dabar ketinate daryti, yra kurti procesus, kad pagerintumėte duomenų kokybę. Ir pasirodo, kad tai dažnai lemia greitesnius algoritmo našumo patobulinimus.

Apie kokį duomenų dydį galvojate sakydami mažesnius duomenų rinkinius? Kalbate apie šimtą pavyzdžių? Dešimt pavyzdžių?

Mašininis mokymasis yra toks įvairus, kad tapo labai sunku pateikti visiems tinkančius atsakymus. Aš dirbau su problemomis, kai turėjau apie 200–300 milijonų vaizdų. Taip pat dirbau su problemomis, kai turėjau 10 vaizdų ir viską, kas yra tarp jų. Kai žiūriu į gamybos programas, manau, kad kažkas panašaus į dešimtis, o gal ir šimtą defektų klasės vaizdų nėra neįprasta, tačiau net gamykloje yra labai didelių skirtumų.

Manau, kad dirbtinio intelekto praktika keičiasi, kai mokymo rinkinių dydžiai nesiekia, tarkime, 10 000 pavyzdžių, nes tai yra tarsi riba, kai inžinierius iš esmės gali peržiūrėti kiekvieną pavyzdį ir pats jį sukurti, o tada priimti sprendimą.

Neseniai kalbėjausi su labai geru inžinieriumi vienoje iš didelių technologijų įmonių. Ir aš paklausiau: Ei, ką daryti, jei etiketės nenuoseklios? Ir jis pasakė: „Na, mes turime šią kelių šimtų žmonių komandą užsienyje, kuri ženklina etiketes. Taigi parašysiu ženklinimo instrukcijas, priversiu tris žmones pažymėti kiekvieną vaizdą, o tada imsiu vidurkį. Ir aš pasakiau: Taip, tai yra teisingas dalykas, kai turite milžinišką duomenų rinkinį. Tačiau kai dirbu su mažesne komanda ir etiketės nenuoseklios, aš tiesiog suseku du žmones, kurie nesutinka vienas su kitu, abiem sulaukiu „Zoom“ skambučio ir liepiu jiems pasikalbėti, kad būtų pasiektas sprendimas.

Dabar noriu atkreipti mūsų dėmesį ir pakalbėti apie jūsų mintis apie bendrą AI pramonę. Algoritmas yra mūsų AI informacinis biuletenis, todėl mūsų skaitytojams suteikiau galimybę iš anksto pateikti jums keletą klausimų. Vienas skaitytojas klausia: atrodo, kad dirbtinio intelekto kūrimas dažniausiai atsiskyrė į akademinius tyrimus arba didelio masto, daug išteklių reikalaujančias, didelių įmonių programas, tokias kaip OpenAI ir DeepMind. Tai tikrai nepalieka daug vietos mažiems startuoliams prisidėti. Kaip manote, į kokias praktines problemas mažesnės įmonės gali iš tikrųjų sutelkti dėmesį, kad padėtų realiai komerciškai pritaikyti dirbtinį intelektą?

Manau, kad daug žiniasklaidos dėmesio yra linkusi didelėms korporacijoms, o kartais ir didelėms akademinėms institucijoms. Bet jei einate į akademines konferencijas, daug darbo atlieka mažesnės tyrimų grupės ir tyrimų laboratorijos. Kai kalbu su įvairiais žmonėmis iš skirtingų įmonių ir pramonės šakų, jaučiu, kad yra tiek daug verslo programų, kurias galėtų panaudoti dirbtinis intelektas. Dažniausiai einu pas verslo vadovus ir klausiu: kokios yra didžiausios jūsų verslo problemos? Kokie dalykai tau kelia didžiausią nerimą? kad galėčiau geriau suprasti verslo tikslus ir tada galvoti, ar yra AI sprendimas, ar ne. O kartais jo nėra, ir tai gerai.

Galbūt tik paminėsiu porą spragų, kurios man įdomios. Manau, kad šiandien dirbtinio intelekto sistemų kūrimas vis dar yra labai rankinis. Turite keletą puikių mašininio mokymosi inžinierių ir duomenų mokslininkų, kurie viską atlieka kompiuteriu, o tada perkelia juos į gamybą. Procese yra daug rankinių veiksmų. Taigi aš džiaugiuosi, kad ML operacijos [mašininio mokymosi operacijos] yra nauja disciplina, padedanti dirbtinio intelekto sistemų kūrimo ir diegimo procesą sistemingiau.

Be to, jei pažvelgsite į daugelį tipiškų verslo problemų – visas funkcijas nuo rinkodaros iki talentų – yra daug galimybių automatizuoti ir pagerinti efektyvumą.

Taip pat tikiuosi, kad dirbtinio intelekto bendruomenė galės pažvelgti į didžiausias socialines problemas – pamatyti, ką galime padaryti dėl klimato kaitos, benamystės ar skurdo. Be kartais labai vertingų verslo problemų, turėtume spręsti ir didžiausias socialines problemas.

Kaip iš tikrųjų vykstate nustatydami, ar yra galimybė ko nors siekti naudojant mašininį mokymąsi jūsų verslui?

Pabandysiu pati šiek tiek sužinoti apie verslą ir padėti verslo lyderiams šiek tiek sužinoti apie AI. Tada dažniausiai sugalvojame keletą projektų ir kiekvienai idėjai atliksiu ir techninį, ir verslo kruopštumą. Pažiūrėsime: ar turite pakankamai duomenų? Koks tikslumas? Ar yra ilga uodega, kai naudojate gamybą? Kaip užpildyti duomenis ir uždaryti nuolatinio mokymosi ciklą? Taigi – įsitikinkite, kad problema yra techniškai įmanoma. Ir tada verslo kruopštumas: mes užtikriname, kad tai pasieks tokią IG, kokios tikimės. Po šio proceso turėsite įprastą darbą, pvz., įvertinti išteklius, etapus ir, tikiuosi, pradėti vykdyti.

Dar vienas patarimas: svarbiau pradėti greitai, o pradėti nuo mažų dalykų yra gerai. Mano pirmoji prasminga verslo programa „Google“ buvo kalbos atpažinimas, o ne žiniatinklio paieška ar reklama. Tačiau padėjus „Google“ kalbos komandai kalbos atpažinimą padaryti tikslesnį, „Brain“ komandai suteikė patikimumo ir galimybių siekti vis didesnės partnerystės. Taigi „Google“ žemėlapiai buvo antroji didelė partnerystė, kurioje naudojome kompiuterinę viziją – namų numeriams nuskaityti, norėdami nustatyti namų geografinę vietą „Google“ žemėlapiuose. Ir tik po tų pirmųjų dviejų sėkmingų projektų užmezgiau rimtesnį pokalbį su reklamos komanda. Taigi manau, kad daugiau įmonių žlunga pradėdamos per daug, nei žlunga pradėdamos per mažas. Puiku atlikti mažesnį projektą, kad pradėtumėte kaip organizaciją, kad sužinotumėte, ką reiškia naudoti AI, o tada tęsite didesnę sėkmę.

Koks yra vienas dalykas, kurį mūsų auditorija turėtų pradėti daryti rytoj, kad įdiegtų dirbtinį intelektą savo įmonėse?

Įsijunk. AI sukelia daugelio pramonės šakų dinamikos pokyčius. Taigi, jei jūsų įmonė dar neinvestuoja gana agresyviai ir protingai, tai tinkamas metas.

paslėpti