Maži dirbtinio intelekto modeliai gali papildyti automatinio taisymo ir balso asistentus jūsų telefone

Kategorija: Dirbtinis intelektas Paskelbta Spalio 04 d Mobiliojo telefono su kalbančiu balso asistentu iliustracija Mobiliojo telefono su kalbančiu balso asistentu iliustracija





Tyrėjai sėkmingai sumažino milžinišką kalbos modelį, skirtą naudoti komercinėse programose.

Kas skaičiuoja? Per pastaruosius metus natūralios kalbos modeliai tapo žymiai geresni, nes jie tapo žymiai didesni. Pavyzdžiui, praėjusių metų spalio mėn. „Google“ išleido modelį, pavadintą BERT kuris išlaikė ilgą skaitymo supratimo etaloną šioje srityje. Didesnė modelio versija turėjo 340 milijonų duomenų parametrų, o jo mokymas tik vieną kartą kainavo pakankamai elektros energijos JAV namų ūkiui 50 dienų.

Po keturių mėnesių „OpenAI“ greitai jį papildė savo modeliu GPT-2. Modelis pademonstravo įspūdingą įtikinamos prozos konstravimo įgūdį; taip pat naudojo 1,5 milijardo parametrų. Dabar MegatronLM, naujausias ir didžiausias Nvidia modelis, turi 8,3 milijardo parametrų . (Taip, viskas išeina iš rankų.)



Didelis, blogas, bjaurus: AI tyrėjai vis labiau nerimauja dėl šios tendencijos pasekmių. Birželio mėnesį Masačusetso universiteto (Amherst) grupė parodė tokio didelio masto modelių kūrimo ir mokymo klimato kaitą. Jie apskaičiavo, kad mokymas BERT išmetė beveik tiek pat anglies, kiek skrydis pirmyn ir atgal tarp Niujorko ir San Francisko; GPT-2 ir MegatronLM, ekstrapoliuojant, greičiausiai išmestų daug daugiau.

Ši tendencija taip pat gali paspartinti AI tyrimų sutelkimą kelių technologijų milžinų rankose. Per mažai išteklių turinčios laboratorijos akademinėje bendruomenėje arba šalyse, kuriose yra mažiau išteklių, paprasčiausiai neturi galimybių naudoti ar kurti tokių skaičiavimo požiūriu brangių modelių.

Mieloji, aš sumažinau AI: Atsakydami į tai, daugelis tyrėjų sutelkia dėmesį į mažinant dydį esamų modelių neprarasdami savo galimybių. Dabar du nauji dokumentai, išleisti per dieną vienas po kito, sėkmingai tai padarė mažesnėje BERT versijoje su 100 milijonų parametrų.



The pirmasis popierius, iš „Huawei“ tyrėjų, gamina modelį, pavadintą „TinyBERT“, kuris yra mažiau nei septintadalis originalo dydžio ir beveik 10 kartų greitesnis. Jis taip pat beveik taip pat gerai supranta kalbą kaip originalas. The antra, iš „Google“ tyrėjų, gamina kitą, kuri yra mažesnė nei 60 kartų, tačiau jos kalbos supratimas yra šiek tiek prastesnis nei „Huawei“ versija.

Kaip jie tai padarė: Abiejuose straipsniuose naudojami bendros suspaudimo technikos, žinomos kaip žinių distiliavimas, variantai. Tai apima didelio AI modelio, kurį norite sumažinti (mokytoją), naudojimą, kad jo įvaizdis būtų pritaikytas daug mažesniam modeliui (mokiniui). Norėdami tai padaryti, įvedate tuos pačius duomenis į abu ir tada koreguojate mokinį, kol jo išvestis atitiks mokytojo.

Už laboratorijos ribų: Maži modeliai ne tik pagerins prieigą prie naujausių DI, bet ir padės vartotojams pritaikyti naujausius dirbtinio intelekto patobulinimus. Jie išvengia poreikio siųsti vartotojų duomenis į debesį, o tai pagerina greitį ir privatumą. Konkrečiai kalbant apie natūralios kalbos modelius, galingesnis teksto numatymas ir kalbos generavimas galėtų patobulinti daugybę programų, pvz., automatinio užbaigimo jūsų telefone ir balso asistentus, tokius kaip Alexa ir Google Assistant.



Jei norite, kad daugiau tokių istorijų būtų pristatyta tiesiai į jūsų pašto dėžutę, užsiprenumeruokite Webby nominuotą AI informacinį biuletenį The Algorithm. Tai nemokama.