Dirbtinis intelektas, skirtas melagingoms naujienoms generuoti, taip pat galėtų padėti jas aptikti

Hendrikas Strobeltas ir Sebastianas Gehrmannas





Praėjusį mėnesį OpenAI gana dramatiškai sustabdė savo naujausio kalbos modelio GPT-2 išleidimą, nes bijojo, kad jis gali būti naudojamas automatizuoti masinę dezinformacijos gamybą. Šis sprendimas taip pat paspartino AI bendruomenės vykstančias diskusijas apie tai, kaip aptikti tokias netikras naujienas. Naujame eksperimentas MIT-IBM Watson AI Lab ir HarvardNLP mokslininkai svarstė, ar tie patys kalbiniai modeliai, kuriais galima rašyti tokią įtikinamą prozą, gali aptikti ir kitas modeliu sukurtas ištraukas.

Šios hipotezės idėja paprasta: kalbos modeliai sukuria sakinius, numatydami kitą teksto sekos žodį. Taigi, jei jie gali nesunkiai nuspėti daugumą tam tikros ištraukos žodžių, greičiausiai tai parašė vienas iš jų pačių.

Tyrėjai išbandė savo idėją pastatydami interaktyvus įrankis paremta viešai prieinama pažeminta OpenAI GPT-2 versija. Kai įrankiui pateikiate teksto ištrauką, žodžiai paryškinami žaliai, geltonai arba raudonai, kad būtų rodomas mažėjantis nuspėjamumas; jas paryškina purpurine spalva, jei iš viso jų nebūtų numatęs. Teoriškai, kuo didesnė raudonų ir violetinių žodžių dalis, tuo didesnė tikimybė, kad ištrauką parašė žmogus; kuo didesnė žalios ir geltonos spalvos žodžių dalis, tuo didesnė tikimybė, kad tai parašyta kalbos modeliu.



aptikti netikras naujienas

Skaitymo supratimo ištrauka iš JAV standartizuoto testo, parašyta žmogaus. Hendrikas Strobeltas ir Sebastianas Gehrmannas

aptikti netikras naujienas

Ištrauka, parašyta OpenAI sumažinto GPT-2. Hendrikas Strobeltas ir Sebastianas Gehrmannas

Iš tiesų, mokslininkai nustatė, kad ištraukos, parašytos pažemintos ir pilnos GPT-2 versijos, buvo beveik visiškai žalios ir geltonos spalvos, o žmonių parašytose mokslinėse santraukose ir JAV standartizuotų testų skaitymo supratimo ištraukose buvo daug raudonos ir violetinės spalvos.



Bet ne taip greitai. Janelle Shane, tyrėja, kuri vadovauja populiariam tinklaraščiui Leiskite neuroniniams tinklams būti keistam ir kuris nebuvo įtrauktas į pradinį tyrimą, padėjo įrankį daugiau griežtas testas . Užuot tiesiog pateikusi GPT-2 sukurtą tekstą, ji teikė jai ištraukas, parašytas ir kitų kalbų modelių, įskaitant vieną, apmokytą „Amazon“ apžvalgose, o kitą – požemių ir drakonų biografijas. Ji nustatė, kad įrankis nesugebėjo nuspėti didelės žodžių dalies kiekvienoje iš šių ištraukų, todėl manoma, kad juos parašė žmogus. Tai atskleidžia svarbią įžvalgą: kalbos modelis gali gerai aptikti savo, bet nebūtinai kitų išvestį.

Ši istorija iš pradžių pasirodė mūsų AI informaciniame biuletenyje „Algoritmas“. Jei norite, kad jis būtų pristatytas tiesiai į gautuosius, prisiregistruokite čia nemokamai.

paslėpti