211service.com
Klaidų kupini duomenų rinkiniai iškreipia mūsų supratimą apie tai, koks iš tikrųjų geras AI
Jeremy Lwanga / Unsplash
The Remiantis 10 dažniausiai cituojamų AI duomenų rinkinių, gausu etikečių klaidų naujas tyrimas iš MIT , ir tai iškreipia mūsų supratimą apie šios srities pažangą.
Duomenų stuburas: Duomenų rinkiniai yra AI tyrimų pagrindas, tačiau kai kurie yra svarbesni nei kiti. Yra pagrindinis jų rinkinys, kurį tyrėjai naudoja vertindami mašininio mokymosi modelius, kad galėtų stebėti, kaip AI galimybės laikui bėgant tobulėja. Vienas žinomiausių yra kanoninis vaizdo atpažinimo duomenų rinkinys „ImageNet“, pradėjęs šiuolaikinę AI revoliuciją. Taip pat yra MNIST, kuri kaupia ranka rašytų skaičių nuo 0 iki 9 vaizdus. Kiti duomenų rinkiniai bando modelius, išmokytus atpažinti garsą, tekstą ir ranka piešinius.
Taip, bet: Pastaraisiais metais atlikti tyrimai parodė, kad šiuose duomenų rinkiniuose gali būti rimtų trūkumų. Pavyzdžiui, „ImageNet“ yra rasistinės ir seksistinės etiketės taip pat nuotraukos žmonių veidai gauti be sutikimo . Naujausiame tyrime dabar nagrinėjama kita problema: daugelis etikečių yra tiesiog klaidingos. Grybas pažymėtas šaukštu, varlė – katė, o aukšta Ariana Grande nata – švilpukas. „ImageNet“ bandymo rinkinio etikečių klaidų lygis yra 5,8%. Tuo tarpu „QuickDraw“ – rankinių piešinių rinkinio – klaidų lygis yra 10,1%.
Kaip buvo išmatuota? Kiekvienas iš 10 modelių vertinimui naudojamų duomenų rinkinių turi atitinkamą duomenų rinkinį, naudojamą jų mokymui. Tyrėjai, MIT magistrantai Curtis G. Northcutt ir Anish Athalye bei alumnas Jonas Mueller, panaudojo mokymo duomenų rinkinius, kad sukurtų mašininio mokymosi modelį, o paskui naudojo juos, kad numatytų etiketes bandymų duomenyse. Jei modelis nesutiko su pradine etikete, duomenų taškas buvo pažymėtas rankiniu būdu peržiūrėti. Penki „Amazon Mechanical Turk“ apžvalgininkai buvo paprašyti balsuoti už tai, kuri etiketė – modelio ar originalo – jų manymu yra teisinga. Jei dauguma žmonių vertintojų sutiko su modeliu, pradinė etiketė buvo įvertinta kaip klaida ir tada ištaisyta.
Ar tai svarbu? Taip. Tyrėjai ištyrė 34 modelius, kurių našumas anksčiau buvo vertinamas pagal „ImageNet“ testų rinkinį. Tada jie iš naujo įvertino kiekvieną modelį pagal maždaug 1500 pavyzdžių, kai buvo nustatyta, kad duomenų etiketės yra neteisingos. Jie nustatė, kad modeliai, kurių originalas pasirodė ne taip gerai neteisinga Etiketės buvo vienos iš geriausių rezultatų po to, kai etiketės buvo pataisytos. Konkrečiai kalbant, atrodė, kad paprastesni modeliai buvo geresni naudojant pataisytus duomenis nei sudėtingesni modeliai, kuriuos naudoja technologijų milžinai, pvz., „Google“, norėdami atpažinti vaizdą ir laikomi geriausiais šioje srityje. Kitaip tariant, dėl klaidingų bandymų duomenų galime turėti išpūstą jausmą, kokie puikūs yra šie sudėtingi modeliai.
Kas dabar? Northcutt skatina dirbtinio intelekto lauką kurti švaresnius duomenų rinkinius modeliams įvertinti ir lauko pažangai stebėti. Jis taip pat rekomenduoja tyrėjams pagerinti duomenų higieną dirbant su savo duomenimis. Priešingu atveju, anot jo, jei turite triukšmingą duomenų rinkinį ir daugybę modelių, kuriuos bandote, ir ketinate juos įdiegti realiame pasaulyje, galite pasirinkti netinkamą modelį. Šiuo tikslu jis sukūrė atvirojo kodo kodas Jis naudojo savo tyrime taisydamas etiketės klaidas, kurios, jo teigimu, jau naudojamos keliose didelėse technologijų įmonėse.