Kaip galime būti tikri, kad AI elgsis? Galbūt žiūrėdamas, kaip jis ginčijasi su savimi.

OpenAI tinklaraštis





Kažkada gali būti visiškai normalu stebėti, kaip AI sistema kovoja su savimi.

Idėja kilo iš tyrėjų iš OpenAI , ne pelno siekianti organizacija, kurią įkūrė keli Silicio slėnio šviesuoliai, įskaitant „Y Combinator“ partnerį Samas Altmaną, „LinkedIn“ pirmininką Reidą Hoffmaną, „Facebook“ valdybos narį ir „Palantir“ įkūrėją Peterį Thielį bei „Tesla“ ir „SpaceX“ vadovą Eloną Muską.

OpenAI mokslininkai anksčiau įrodė, kad dirbtinio intelekto sistemos, kurios treniruojasi patys, kartais gali sukurti netikėtų ir nepageidaujamų įpročių. Pavyzdžiui, kompiuteriniame žaidime agentas gali sugalvoti, kaip tai padaryti gedimas savo kelią į aukštesnį balą. Kai kuriais atvejais asmuo gali tai padaryti prižiūrėti mokymo procesą . Bet jei AI programa daro kažką neįtikėtinai sudėtingo, tai gali būti neįmanoma. Taigi mokslininkai siūlo, kad dvi sistemos aptartų konkretų tikslą.



Manome, kad šis ar panašus metodas ilgainiui galėtų padėti mums išmokyti dirbtinio intelekto sistemas atlikti daug labiau pažinimo požiūriu pažangesnes užduotis, nei sugeba žmonės, ir neatsižvelgti į žmogaus pageidavimus, rašo tyrėjai. dienoraščio įrašą nubrėždamas koncepciją.

Paimkite, pavyzdžiui, AI sistemą, skirtą apsiginti nuo žmonių arba AI įsilaužėlių. Kad sistema nepadarytų nieko žalingo ar neetiško, gali prireikti jai iššūkį paaiškinti konkretaus veiksmo logiką. Ši logika gali būti per sudėtinga, kad žmogus ją suprastų, todėl mokslininkai siūlo kitam AI diskutuoti apie veiksmo su pirmąja sistema išmintį, naudojant natūralią kalbą, kol žmogus stebi. Daugiau informacijos rasite a tiriamasis darbas .

Kad dirbtinio intelekto programos galėtų ginčytis tarpusavyje, reikia sudėtingesnių technologijų, nei egzistuoja šiuo metu. Iki šiol „OpenAI“ tyrėjai šią idėją ištyrė tik keliais labai paprastais pavyzdžiais. Vienas iš jų apima dvi AI sistemas, kurios bando įtikinti stebėtoją apie paslėptą charakterį, lėtai atskleidžiant atskirus pikselius.



Tyrėjai sukūrė svetainę kur bet kurie du žmonės gali pabandyti atlikti diskutuojančių AI sistemų vaidmenis, o trečiasis yra teisėjas. Abu dalyviai varžosi, siekdami įtikinti teisėją apie įvaizdžio prigimtį, išryškindami jo dalis. Galiausiai stebėtojui tampa lengviau pasakyti, kas yra sąžiningas.

Vincentas Conitzeris , Duke universiteto mokslininkas, nagrinėjantis etikos problemas, susijusias su AI, teigia, kad darbas yra ankstyvoje stadijoje, bet yra žadantis. Jis sako, kad dirbtinio intelekto sistemų, galinčių paaiškinti jų sprendimus, kūrimas yra sudėtinga mokslinių tyrimų darbotvarkė. Jei pasiseks, tai gali labai prisidėti prie atsakingo AI naudojimo.

Tokia, kokia ji yra – ir nepaisant kai kurie svetimas pareiškimus tokių kaip Elonas Muskas (OpenAI finansuotojas ir dar visai neseniai jo valdybos narys) – mums vis dar toli iki AI sistemų, galinčių mus apgauti ir pergudrauti tokiu scenarijumi, kuris vaizduojamas tokiuose filmuose kaip Buvusi mašina ir Ji .

Vis dėlto kai kurie dirbtinio intelekto tyrėjai tiria būdus, kaip užtikrinti, kad technologija nesielgtų netyčia. Tai gali tapti dar svarbiau, nes dirbtinio intelekto programos tampa sudėtingesnės ir nepastebimos (žr. „The dark secret at the heart of AI“).

Manau, kad vertybių derinimo per diskusijas idėja yra labai įdomi ir potencialiai naudinga, sako Arielis Procaccia , CMU kompiuterių mokslo profesorius, studijuojantis sprendimų priėmimą naudojant autonomines sistemas.

Tačiau Procaccia pažymi, kad darbas yra labai preliminarus ir kad koncepcijoje gali būti net esminis prieštaravimas. Jis sako, kad norint diskutuoti apie vertybėmis apkrautus klausimus taip, kad tai būtų suprantama žmogaus teisėjui, AI agentams gali prireikti tvirtai suvokti žmogiškąsias vertybes. Taigi požiūris, be abejo, yra vežimo pastatymas prieš arklį.

Iyad Rawan MIT žiniasklaidos laboratorijos mokslininkas priduria, kad tyrėjai turėtų būti atsargūs, kad AI neįsitrauktų į ginčą. Manau, kad jie labai greitai išspręs kai kurias labai sudėtingas problemas, sako jis. Pirma, kaip automatizuoti argumentavimą natūralia kalba, o tai vis dar yra neišspręsta problema.

paslėpti