Mašininis matymas gali sukurti Hario Poterio stiliaus nuotraukas, skirtas mugliams

Chung-Yi Weng | youtube





J.K. Rowling Hario Poterio romanai, magiškos fotografijos panašios į įprastas, išskyrus tai, kad jose veikėjai yra animuoti; jie mojuoja, šypsosi arba kartais visai dingsta, kad užsiimtų kitais reikalais.

Stebuklingos nuotraukos yra nepaprastos Rowling vaizduotės kūrinys. Tačiau kažkas panašaus į juos netrukus gali būti prieinama paprastiems mugliams, nes Chung-Yi Weng dirbo Vašingtono universitete Sietle ir pora draugų. Šie žmonės sukūrė programinę įrangą, pavadintą „Photo Wake-Up“, kuri gali pagyvinti pagrindinį nuotraukos veikėją, o likusią vaizdo dalį nepaliestą.

Šią užduotį lengviau pasakyti nei atlikti dėl svarbios neišspręstos kompiuterių mokslo problemos. Tai yra kūno padėties įvertinimo problema. Atsižvelgiant į dvimatį žmogaus vaizdą, mašininis regėjimas sunkiai atsako į klausimą: kokią trimatę pozą žmogus užima?



Tai sunku, nes kūnai gali būti iš dalies užkimšti, dažnai kitų kūno dalių, pavyzdžiui, kai kas nors stovi sudėjęs rankas. Dėl to mašinai sunku nustatyti trimatę struktūrą iš 2D vaizdo.

Įvairios kompiuterių mokslo komandos bandė išspręsti šią problemą. Šiame darbe Weng ir bendrai naudoja programą, vadinamą SMPL, kurią sukūrė „Microsoft“ komanda ir Max Planck intelektualių sistemų institutas Vokietijoje.

Tai prasideda 2D žmogaus kūno išpjova ir ant figūros uždedamas 3D skeletas. Tada skeletas gali būti animuotas, kad būtų sukurtas judėjimo pojūtis. Tai išsprendžia pozos įvertinimo problemą, nors ir tam tikromis aplinkybėmis.



Kodas turi matyti kūno išpjovą nuo galvos iki kojų iš priekio. Jis gali susidoroti su kai kurių tipų okliuzija, pvz., ranka prieš kūną, bet negali susidoroti su sudėtingesnėmis okliuzijomis, pvz., kai kas nors sėdi sukryžiavęs kojas. Nepaisant to, nuotraukos išpjovą pridedant 3D skelete, tikroviškos animacijos nesukuriama.

Štai čia Weng ir bendradarbiai. Pagrindinis jų pasiekimas yra sukurti būdą, kaip iškreipti 2D išpjovą taip, kad būtų sukurtas tikroviškas 3D kūno modelis. Taigi pagrindinis mūsų techninis indėlis yra būdas sukurti animacinį 3D modelį, atitinkantį siluetą vienoje nuotraukoje, sako jie.

Anksčiau kompiuterių mokslininkai bandė išspręsti šią problemą deformuodami trimatį kūno formos tinklelį, kad atspindėtų 2D išpjovą. Tai ne visada veikia gerai, todėl Weng ir kiti išbando kitokį požiūrį.



Jų idėja yra susieti kūno formos tinklelį į 2D erdvę ir tada sulygiuoti jį su 2D išpjova naudojant deformavimo algoritmą. Tai identifikuoja konkrečias kūno dalis – galvą, dešinę ranką, dešinę koją, kairę ranką, kairę koją ir liemenį – ir kiekvieną iškreipia taip, kad atitiktų išpjovą.

Atlikę lygiavimą 2D formatu, jie vėl paverčia jį 3D. Jie sako, kad šis 2D deformacijos metodas puikiai tinka sudėtingiems siluetams.

Komanda ypatingą dėmesį skiria galvai, į kurią žiūrovai linkę sutelkti dėmesį. Jie sako, kad galvos pozos tikslumas yra svarbus gerai animacijai. Taigi jų algoritmas taip pat nustato tokias funkcijas kaip žvilgsnio kryptis ir galvos kampas, o tada naudoja tai, kad gautų tikslų kūno tinklelio galvos pozos kampą.



Šie automatizuoti metodai yra geri, tačiau jie nėra tobuli. Taigi komanda taip pat sukūrė vartotojo sąsają, kuri leidžia bet kam pakeisti skeleto orientaciją kūno atžvilgiu. Tai leidžia vartotojams ištaisyti visas klaidas ir tiksliai sureguliuoti animaciją.

Galutinis rezultatas – įspūdinga animacinė nuotrauka. Algoritmas išskiria žmogaus kūną nuotraukoje, išpjauna jį iš vaizdo ir užpildo spragą lopų užpildymo algoritmu. Tada jis animuoja šį kūną trimis matmenimis, kad jis išeitų iš nuotraukos, bėgtų, šokinėtų ar mojuotų, panašiai kaip stebuklingose ​​nuotraukose, kurias įsivaizduoja Rowling. Algoritmas veikia net papildytos realybės nustatymuose.

Mūsų metodas veikia su įvairiomis viso kūno, gana priekinėmis nuotraukomis, nuo sporto nuotraukų iki meno ir plakatų, sako jie. Komanda sukūrė vaizdo įrašą, kuriame parodytas jų metodas ir rezultatai čia . Verta pažiūrėti!

Tai įdomus darbas, galintis linksminti ir informuoti. Kaip pasakė Wengas ir bendradarbiai: manome, kad šis metodas ne tik suteikia galimybę žmonėms naujų būdų mėgautis nuotraukomis ir su jomis bendrauti, bet ir siūlo būdą atkurti virtualų pseudoportretą iš vieno vaizdo, tuo pačiu suteikiant įžvalgos apie žmogaus meno būklę. modeliavimas iš vienos nuotraukos.

Net Rowling tikrai būtų sužavėta.

Nuoroda: arxiv.org/abs/1812.02246 : Nuotraukos pažadinimas: 3D simbolių animacija iš vienos nuotraukos

paslėpti