211service.com
Šie baisūs netikri žmonės skelbia naują AI amžių
„Datagen“ sutikimu
Matote, kad ant jo viršutinės lūpos atsiranda neryškių ražienų, kaktos raukšlės, odos dėmės. Jis nėra tikras asmuo, bet turi jį imituoti – kaip ir šimtai tūkstančių kitų, kuriuos pagamino „Datagen“, įmonė, prekiaujanti netikrus, imituotus žmones.
Šie žmonės nėra žaidimų avatarai ar animaciniai filmų personažai. Tai yra sintetiniai duomenys, skirti pamaitinti didėjantį gilaus mokymosi algoritmų apetitą. Tokios įmonės kaip „Datagen“ siūlo patrauklią alternatyvą brangiam ir daug laiko reikalaujančiam realaus pasaulio duomenų rinkimo procesui. Jie tai padarys už jus: kaip norite, kada norite ir palyginti pigiai.
Norėdami sukurti sintetinius žmones, Datagen pirmiausia nuskaito tikrus žmones. Ji bendradarbiauja su pardavėjais, kurie moka žmonėms, kad jie įeitų į milžiniškus viso kūno skaitytuvus, fiksuojančius kiekvieną detalę nuo rainelės iki odos tekstūros iki pirštų išlinkimo. Tada paleistis paima neapdorotus duomenis ir perkelia juos per algoritmus, kurie sukuria 3D asmens kūno, veido, akių ir rankų vaizdus.
Izraelyje įsikūrusi bendrovė teigia, kad jau bendradarbiauja su keturiais pagrindiniais JAV technologijų milžinais, tačiau neatskleis, kurie iš jų. Artimiausias jos konkurentas, AI sintezė , taip pat siūlo skaitmeninius žmones pagal pareikalavimą. Kitos įmonės generuoja duomenis, kurie bus naudojami finansų , draudimas , ir sveikatos apsauga . Jų yra maždaug tiek pat sintetinių duomenų įmonės nes yra duomenų tipų.
Kai kurie sintetiniai duomenys anksčiau buvo laikomi mažiau pageidaujamais nei tikri duomenys, o dabar kai kurie juos laiko panacėja. Tikri duomenys yra netvarkingi ir kupini šališkumo. Dėl naujų duomenų privatumo taisyklių sunku rinkti. Priešingai, sintetiniai duomenys yra nesugadinti ir gali būti naudojami kuriant įvairesnius duomenų rinkinius. Galite sukurti puikiai paženklintus veidus, tarkime, įvairaus amžiaus, formų ir etninių grupių, kad sukurtumėte veido aptikimo sistemą, kuri veiktų įvairiose populiacijose.
Tačiau sintetiniai duomenys turi savo apribojimų. Jei jis neatspindės tikrovės, jis gali sukurti dar blogesnį AI nei netvarkingi, neobjektyvūs realaus pasaulio duomenys, arba gali tiesiog paveldėti tas pačias problemas. Nenoriu žiūrėti į šią paradigmą ir pasakyti: „O, tai išspręs tiek daug problemų“, – sako Cathy O'Neil, duomenų mokslininkė ir algoritminio audito įmonės ORCAA įkūrėja. Nes jis taip pat daug ką ignoruos.
Realistiškas, ne tikras
Gilus mokymasis visada buvo susijęs su duomenimis. Tačiau per pastaruosius kelerius metus AI bendruomenė to išmoko Gerai duomenys yra svarbesni nei didelis duomenis . Net nedideli tinkamų, aiškiai paženklintų duomenų kiekiai gali labiau pagerinti AI sistemos našumą nei 10 kartų daugiau nei nekuruoti duomenys ar net pažangesnis algoritmas.
Tai keičia būdą, kaip įmonės turėtų kurti savo AI modelius, sako „Datagen“ generalinis direktorius ir vienas iš įkūrėjų Ofiras Chakonas. Šiandien jie pradeda sukaupdami kuo daugiau duomenų, o tada patobulina ir suderina savo algoritmus, kad pagerintų našumą. Vietoj to, jie turėtų elgtis priešingai: naudoti tą patį algoritmą ir tobulinti savo duomenų sudėtį.

„Datagen“ taip pat sukuria netikrus baldus ir patalpų aplinką, kad galėtų į kontekstą įtraukti netikrus žmones.
DUOMENYS
Tačiau realaus pasaulio duomenų rinkimas tokiam kartotiniam eksperimentavimui yra per brangus ir reikalauja daug laiko. Čia atsiranda Datagen. Naudodamos sintetinių duomenų generatorių komandos gali sukurti ir išbandyti daugybę naujų duomenų rinkinių per dieną, kad nustatytų, kuris iš jų padidina modelio našumą.
Siekdama užtikrinti duomenų tikroviškumą, „Datagen“ savo pardavėjams pateikia išsamias instrukcijas, kiek asmenų reikia nuskaityti kiekvienoje amžiaus grupėje, KMI diapazone ir etninėje priklausomybėje, taip pat sąrašą veiksmų, kuriuos jie turi atlikti, pavyzdžiui, vaikščioti po kambarį ar gerdamas sodą. Pardavėjai siunčia tiek didelio tikslumo statinius vaizdus, tiek tų veiksmų judesio fiksavimo duomenis. Tada Datagen algoritmai išplečia šiuos duomenis į šimtus tūkstančių derinių. Susintetinti duomenys kartais vėl tikrinami. Pavyzdžiui, netikri veidai piešiami prieš tikrus veidus, kad būtų galima pamatyti, ar jie atrodo tikroviški.
Dabar „Datagen“ generuoja veido išraiškas, skirtas stebėti vairuotojo budrumą išmaniuosiuose automobiliuose, kūno judesius, kad būtų galima sekti pirkėjus parduotuvėse, kuriose nėra kasų, ir raineles bei rankų judesius, kad pagerintų VR ausinių akių ir rankų sekimo galimybes. Bendrovė teigia, kad jos duomenys jau buvo panaudoti kuriant kompiuterinio matymo sistemas, aptarnaujančias dešimtis milijonų vartotojų.
Masiškai gaminami ne tik sintetiniai žmonės. Paspaudimai yra startuolis, kuris naudoja sintetinį AI automatinėms transporto priemonių patikroms atlikti. Naudodamas projektavimo programinę įrangą, jis iš naujo sukuria visas automobilių markes ir modelius, kuriuos AI turi atpažinti, o tada pateikia juos su skirtingomis spalvomis, pažeidimais ir deformacijomis, esant skirtingoms apšvietimo sąlygoms, skirtinguose fonuose. Tai leidžia įmonei atnaujinti savo dirbtinį intelektą, kai automobilių gamintojai išleidžia naujus modelius, ir padeda išvengti duomenų privatumo pažeidimų šalyse, kuriose valstybiniai numeriai laikomi privačia informacija ir todėl negali būti nuotraukose, naudojamose dirbtinio intelekto mokymui.

„Click-In“ perteikia skirtingų markių ir modelių automobilius įvairiomis aplinkybėmis.
PASPUSTELĖJIMAIDažniausiai.ai bendradarbiauja su finansų, telekomunikacijų ir draudimo bendrovėmis, kad pateiktų suklastotų klientų duomenų skaičiuokles, leidžiančias įmonėms teisiškai suderintu būdu dalytis savo klientų duomenų baze su išorės pardavėjais. Anonimizavimas gali sumažinti duomenų rinkinio turtingumą, tačiau vis tiek negali tinkamai apsaugoti žmonių privatumo. Tačiau sintetiniai duomenys gali būti naudojami norint sukurti išsamius netikrų duomenų rinkinius, kurie turi tas pačias statistines savybes kaip ir tikrieji įmonės duomenys. Jis taip pat gali būti naudojamas imituojant duomenis, kurių įmonė dar neturi, įskaitant įvairesnę klientų grupę arba tokius scenarijus kaip nesąžininga veikla.
Sintetinių duomenų šalininkai teigia, kad tai gali padėti įvertinti ir DI. Į naujausias popierius AI konferencijoje paskelbta, Johnso Hopkinso universiteto mašininio mokymosi ir sveikatos priežiūros docentė Suchi Saria ir jos bendraautoriai pademonstravo, kaip duomenų generavimo metodai gali būti naudojami ekstrapoliuojant skirtingas pacientų populiacijas iš vieno duomenų rinkinio. Tai gali būti naudinga, jei, pavyzdžiui, įmonė turėtų duomenis tik iš jaunesnio Niujorko miesto gyventojų, bet norėtų suprasti, kaip jos AI veikia senėjančiai visuomenei, kurioje dažniau serga diabetu. Dabar ji kuria savo įmonę Bayesian Health, kuri naudos šią techniką, kad padėtų išbandyti medicinines AI sistemas.
Padirbimo ribos
Bet ar sintetiniai duomenys yra per daug populiarūs?
Kalbant apie privatumą, vien todėl, kad duomenys yra „sintetiniai“ ir tiesiogiai neatitinka tikrų vartotojo duomenų, dar nereiškia, kad juose nėra užkoduota slaptos informacijos apie tikrus žmones, sako Aaronas Rothas, kompiuterių ir informacijos mokslų profesorius. Pensilvanijos universitetas. Buvo įrodyta, kad kai kurie duomenų generavimo būdai tiksliai atkuria vaizdus ar tekstą, randamą treniruočių duomenyse, pavyzdžiui, o kiti yra pažeidžiami atakų, dėl kurių jie visiškai sugrąžina tuos duomenis.
Tai gali būti tinkama tokiai įmonei kaip „Datagen“, kurios sintetiniai duomenys nėra skirti nuslėpti asmenų, kurie sutiko būti nuskaitomi, tapatybės. Tačiau tai būtų bloga žinia įmonėms, kurios siūlo savo sprendimą kaip būdą apsaugoti jautrią finansinę ar pacientų informaciją.
Susijusi istorija
Metų „deepfakes“ tapo populiariu 2020 m. dirbtinio intelekto sintetinė žiniasklaida pradėjo tolti nuo tamsesnių interneto kampelių.Tyrimai rodo, kad visų pirma dviejų sintetinių duomenų metodų derinys – diferencijuotas privatumas ir generatyvūs varžovų tinklai – gali užtikrinti stipriausią privatumo apsaugą, sako Bernease'as Hermanas, Vašingtono universiteto eScience instituto duomenų mokslininkas. Tačiau skeptikai nerimauja, kad šis niuansas gali būti prarastas sintetinių duomenų pardavėjų rinkodaros kalboje, kuri ne visada sužinos, kokias technikas jie naudoja.
Tuo tarpu mažai įrodymų rodo, kad sintetiniai duomenys gali veiksmingai sumažinti AI sistemų šališkumą. Viena vertus, ekstrapoliuojant naujus duomenis iš esamo duomenų rinkinio, kuris yra iškreiptas, nebūtinai gaunami reprezentatyvesni duomenys. Pavyzdžiui, neapdorotuose Datagen duomenyse yra proporcingai mažiau etninių mažumų, o tai reiškia, kad ji naudoja mažiau tikrų duomenų taškų, kad sukurtų netikrus žmones iš tų grupių. Nors generavimo procesas nėra tik spėlionės, tie netikri žmonės vis tiek gali skirtis nuo tikrovės. Jei jūsų tamsesnio odos atspalvio veidai nėra itin tinkami veidams, vadinasi, problemos iš tikrųjų neišsprendžiate, sako O'Neilas.
Kita vertus, puikiai subalansuoti duomenų rinkiniai automatiškai nevirsta į tobulai teisingas AI sistemas, sako Christo Wilsonas, Šiaurės rytų universiteto kompiuterių mokslų docentas. Jei kredito kortelių skolintojas bandytų sukurti AI algoritmą potencialiems skolininkams įvertinti, jis nepanaikintų visos galimos diskriminacijos, tiesiog savo duomenyse pateikdamas baltuosius ir juodaodžius. Diskriminacija vis tiek gali prasiskverbti dėl baltųjų ir juodaodžių kandidatų skirtumų.
Dar labiau apsunkina tai, kad ankstyvieji tyrimai rodo, kad kai kuriais atvejais gali būti net neįmanoma pasiekti abiejų privataus ir sąžiningas AI su sintetiniais duomenimis. Į naujausias popierius paskelbtus AI konferencijoje, Toronto universiteto ir Vektorių instituto mokslininkai bandė tai padaryti su krūtinės ląstos rentgeno spinduliais. Jie išsiaiškino, kad nesugebėjo sukurti tikslios medicininės AI sistemos, kai bandė sukurti įvairų sintetinių duomenų rinkinį, derindami skirtingą privatumą ir generuojančius priešininkų tinklus.
Visa tai nereiškia, kad sintetiniai duomenys neturėtų būti naudojami. Tiesą sakant, tai gali tapti būtinybe. Reguliavimo institucijoms susidūrus su būtinybe išbandyti dirbtinio intelekto sistemas, kad jos atitiktų teisinius reikalavimus, tai gali būti vienintelis būdas, suteikiantis jiems lankstumo, reikalingo generuoti tikslinius testavimo duomenis pagal pareikalavimą, sako O'Neilas. Tačiau dėl to klausimus apie jo apribojimus dar svarbesni yra ištirti ir atsakyti dabar.
Tikėtina, kad sintetiniai duomenys laikui bėgant gerės, sako ji, bet neatsitiktinai.