AI padeda apibendrinti naujausius AI dalykus

Piltuvėlis, išfiltruojantis teksto maišalynę į popierius

Ponia Tech | howadesign / Daiktavardis projektas





Naujienos: Naujas AI modelis Apibendrinant mokslinę literatūrą, dabar jie gali padėti mokslininkams naršyti ir nustatyti naujausius pažangiausius straipsnius, kuriuos jie nori perskaityti. Lapkričio 16 d. Alleno dirbtinio intelekto institutas (AI2) pristatė modelį savo pavyzdiniame gaminyje, Semantikos mokslininkas , dirbtinio intelekto varoma mokslinių darbų paieškos sistema. Jame pateikiama vieno sakinio tl;dr (per ilga; neperskaityta) santrauka po kiekvienu informatikos straipsniu (kol kas), kai vartotojai naudojasi paieškos funkcija arba patenka į autoriaus puslapį. Šią savaitę darbas taip pat buvo priimtas į konferenciją „Empiriniai natūralios kalbos apdorojimo metodai“.

Semantic Scholar TLDR funkcijos ekrano kopija.

Semantic Scholar funkcijos tl;dr ekrano kopija.

AI2

Kontekstas: Informacijos pertekliaus laikais dirbtinio intelekto naudojimas tekstui apibendrinti buvo populiari natūralios kalbos apdorojimo (NLP) problema. Yra du bendri požiūriai į šią užduotį. Vienas vadinamas išgaunamuoju, kuriuo siekiama iš teksto pažodžiui rasti sakinį ar sakinių rinkinį, kuris atspindi jo esmę. Kitas vadinamas abstrakčiuoju, kuris apima naujų sakinių generavimą. Nors gavybos metodai anksčiau buvo populiaresni dėl NLP sistemų apribojimų, pastaraisiais metais natūralios kalbos kūrimo pažanga padarė abstrakčiąją kur kas geresnę.



Kaip jie tai padarė: AI2 abstrakčiame modelyje naudojamas vadinamasis transformatorius – neuroninio tinklo architektūros tipas, pirmą kartą išrastas 2017 m., kuris nuo to laiko paskatino visus pagrindinius NLP šuolius, įskaitant OpenAI GPT-3 . Tyrėjai pirmiausia išmokė transformatorių naudoti bendrąjį teksto korpusą, kad nustatytų pradinį anglų kalbos žinių bagažą. Šis procesas žinomas kaip išankstinis mokymas ir yra dalis to, kas daro transformatorius tokius galingus. Tada jie patikslino modelį, kitaip tariant, toliau mokė jį konkrečiam apibendrinimo uždaviniui.

Tikslesni duomenys: Pirmiausia mokslininkai sukūrė duomenų rinkinį, pavadintą SciTldr, kuriame yra maždaug 5400 porų mokslinių straipsnių ir atitinkamų vieno sakinio santraukų. Norėdami rasti šias aukštos kokybės santraukas, pirmiausia jie ieškojo jų „OpenReview“ – viešoje konferencijos pranešimų pateikimo platformoje, kurioje mokslininkai dažnai paskelbia savo vieno sakinio santrauką. Tai suteikė porą tūkstančių porų. Tada tyrėjai pasamdė anotatorius, kad jie apibendrintų daugiau straipsnių, skaitydami ir toliau glausdami santraukas, kurias jau parašė recenzentai.

Norėdami dar labiau papildyti šias 5 400 porų, mokslininkai sudarė antrą duomenų rinkinį iš 20 000 porų mokslinių straipsnių ir jų pavadinimų. Tyrėjai suprato, kad kadangi patys pavadinimai yra santraukos forma, jie dar labiau padėtų modeliui pagerinti rezultatus. Tai buvo patvirtinta eksperimentuojant.



Semantikos mokslininkas

Funkcija tl;dr ypač naudinga nuskaitant dokumentus mobiliajame telefone.

AI2

Ekstremalus apibendrinimas: Nors daugelis kitų tyrimų buvo susiję su apibendrinimo užduotimi, šis išsiskiria suspaudimo lygiu, kurį jis gali pasiekti. Moksliniai darbai, įtraukti į SciTldr duomenų rinkinį, vidutiniškai sudaro 5000 žodžių. Jų vieno sakinio santraukų vidurkis yra 21. Tai reiškia, kad kiekvienas popierius vidutiniškai suglaudinamas iki 238 kartų didesnio dydžio. Kitas geriausias abstraktus metodas yra mokomas suspausti mokslinius straipsnius vidutiniškai tik 36,5 karto. Testavimo metu žmonių apžvalgininkai taip pat nusprendė, kad modelio santraukos yra informatyvesnės ir tikslesnės nei ankstesni metodai.

Tolesni žingsniai: Jau dabar yra keletas būdų, kuriais AI2 stengiasi patobulinti savo modelį per trumpą laiką, sako Danielis Weldas, Vašingtono universiteto profesorius ir Semantic Scholar tyrimų grupės vadovas. Viena vertus, jie planuoja išmokyti modelį tvarkyti ne tik informatikos dokumentus. Kita vertus, galbūt iš dalies dėl mokymo proceso, jie pastebėjo, kad tl;dr santraukos kartais per daug sutampa su popieriaus pavadinimu, todėl sumažėja bendras jų naudingumas. Jie planuoja atnaujinti modelio mokymo procesą, kad būtų užkirstas kelias tokiam sutapimui, kad laikui bėgant jis išmoktų išvengti pasikartojimo.



Ilgainiui komanda taip pat dirbs apibendrindama kelis dokumentus vienu metu, o tai gali būti naudinga tyrėjams, pradedantiems naują sritį, arba galbūt net politikos formuotojams, norintiems greitai įsibėgėti. Mes tikrai džiaugiamės galėdami sukurti asmeninius tyrimų pranešimus, sako Weldas, kur galime apibendrinti ne tik vieną dokumentą, bet ir šešis naujausius pasiekimus tam tikroje srityje.

paslėpti