211service.com
Prireikė pandemijos, bet JAV pagaliau turi (kai kuriuos) centralizuotus medicininius duomenis
Automobiliai rikiuojasi COVID-19 bandymų aikštelėje Dodger stadione Los Andžele Mario Tama / Getty Images
- Šiuo metu NIH N3C duomenų bazėje yra 6,3 milijono atpažintų įrašų
- Tai tapo viena didžiausių COVID pacientų įrašų kolekcijų pasaulyje
- Pagal šią schemą išvengiama duomenų talpyklų ir privatumo problemų, kurios kelia mįslę JAV sveikatos priežiūros sistemoje
Per visą pandemiją tvyrojo rimta įtampa tarp to, ką visuomenė nori žinoti, ir to, ką mokslininkai galėjo pasakyti tikrai.
Mokslininkai galėjo sužinoti daugiau apie Covidą greičiau nei apie bet kurią kitą ligą istorijoje, tačiau tuo pat metu visuomenė buvo šokiruota, kai gydytojai negali atsakyti, atrodytų, pagrindinių klausimų: kokie yra COVID-19 simptomai? Kaip plinta? Kas yra jautriausias? Koks geriausias būdas tai gydyti?
Niekur šis konfliktas nebuvo aiškesnis nei JAV, kurios beveik penktadalį savo bendrojo vidaus produkto išleidžia sveikatos priežiūrai, tačiau pasiekia blogesnių rezultatų nei bet kuri kita turtinga šalis. Rasti atsakymus buvo sudėtinga ne tik dėl to, kad mokslas yra sunkus, bet ir dėl to, kad Amerikos sveikatos priežiūra yra sukurta ant nesuderinamų, archajiškų sistemų kratinio.
Susijusi istorija
JAV neįsivaizduoja, kaip tvarkyti visus renkamus bandymų duomenis. JAV kiekviena valstija nusprendžia, kaip pranešti apie COVID-19 testų rezultatus. Rezultatas – chaotiška sistema, kuri kenkia mūsų reakcijai į pandemiją.Visoje šalyje federaliniai, valstijų ir vietiniai privatumo įstatymai sutampa ir kartais prieštarauja vienas kitam. Tuo tarpu medicininiai įrašai yra netvarkingi, suskaidyti ir juos turinčios institucijos intensyviai slepia – tiek dėl privatumo, tiek dėl to, kad medicininių duomenų, kurių tapatybė buvo panaikinta, pardavimas yra neįtikėtinai pelningas.
Tačiau pasiekti šiuose silosuose įstrigusius duomenis yra vienintelis būdas atsakyti į klausimus apie COVID. Štai kodėl tiek daug gyvybiškai svarbių tyrimų buvo atlikta užsienyje, šalyse, kuriose yra nacionalinės sveikatos priežiūros sistemos, nors JAV yra daug COVID sergančių pacientų ir tyrimų institucijų. Vieni stipriausių duomenų apie mirtingumo nuo koronaviruso rizikos veiksniai ir savybės ilgai Covid pavyzdžiui, atvyko iš JK. Ten visuomenės sveikatos tyrėjai turi prieigą prie duomenų iš 56 milijonų NHS pacientų medicininių įrašų.
Pandemijos pradžioje JAV nacionalinio sveikatos instituto (NIH) finansuojama tyrėjų grupė suprato, kad į daugelį klausimų apie COVID-19 būtų neįmanoma atsakyti nepanaikinus dalijimosi duomenimis kliūčių. Taigi jie sukūrė sistemą, skirtą faktiniams pacientų įrašams iš skirtingų institucijų sujungti tokiu būdu, kuris galėtų būti privatus ir naudingas.
Rezultatas yra Nacionalinis COVID kohortos bendradarbiavimas (N3C) , kuri renka medicininius įrašus iš milijonų pacientų visoje šalyje, juos išvalo, o tada suteikia prieigą grupėms, kurios tiria viską, nuo kada naudoti ventiliatorių ir kaip koronavirusas veikia menstruacinius ciklus.
Tiesiog šokiruoja, kad neturėjome suderintų, apibendrintų sveikatos duomenų tyrimams pandemijos akivaizdoje, sako Melissa Haendel, Kolorado universiteto Anschutz medicinos universiteto tyrimų informatikos profesorė ir viena iš N3C vadovų. Niekada nebūtume privertę visų pateikti tokio lygio duomenų ne pandemijos kontekste, bet dabar, kai tai padarėme, tai yra įrodymas, kad klinikinius duomenis galima suderinti ir plačiai dalytis saugiu ir skaidriu būdu. .
Duomenų bazė dabar yra viena didžiausių koronaviruso įrašų rinkinių pasaulyje, joje yra 6,3 milijono pacientų įrašų iš 56 įstaigų ir jų skaičius nuolat auga, įskaitant įrašus iš 2,1 milijono pacientų, užsikrėtusių virusu. Dauguma įrašų siekia 2018 m., o prisidedančios organizacijos įsipareigojo juos atnaujinti penkerius metus. Dėl to N3C šiandien yra ne tik vienas iš naudingiausių išteklių tiriant ligą, bet ir vienas iš perspektyviausių būdų tirti ilgą koronavirusą.
Sistema, kai institucijos masiškai siunčia įrašus centralizuotai federalinei vyriausybei, yra Amerikos sveikatos priežiūros anomalija. Tinkamai panaudojus, jis gali atsakyti į išsamius klausimus dar ilgai po pandemijos. Ir tai netgi gali būti panašių pastangų koncepcijos įrodymas ateityje.
Atvirojo kodo duomenys
Norėdami įtraukti informaciją į duomenų bazę, dalyvaujantys paslaugų teikėjai pirmiausia pasirenka dvi pacientų grupes: žmones, kuriems nustatytas teigiamas COVID testas, ir kitus, kurie bus kontrolinė grupė. Tada jie pašalina viską, kas leidžia identifikuoti duomenis, išskyrus pašto kodą ir paslaugų teikimo datas, ir saugiai perduoda juos N3C. Ten technikai išvalo duomenis – tai ne visada lengva užduotis – ir įveda juos į duomenų bazę.
Kiekvienas gali pateikti mokslinių tyrimų pasiūlymą per N3C prietaisų skydelis , neatsižvelgiant į tai, ar jis yra susijęs su pateikiančia institucija, ar ne. Netgi piliečiai mokslininkai gali prašyti prieigos prie anoniminės duomenų rinkinio versijos.
NIH komitetas peržiūri kiekvieną pasiūlymą ir nusprendžia, kurią duomenų versiją tyrėjai galės pasiekti. Yra keletas informacijos lygių: ribotas duomenų rinkinys, antrasis lygis, kuriame yra tikri įrašai su užslėptais pašto kodais ir datomis, ir trečiasis, sudarytas iš kompiuteriu sukurtų sintetinių įrašų, kurie bando išlaikyti tuos pačius atributus kaip tikrieji įrašai, neįtraukdami jokių tikri paciento duomenys. Kiekvienas, prieš gaudamas prieigą, turi praeiti duomenų saugumo mokymus.
Iki šiol buvo patvirtinta 215 mokslinių tyrimų projektų, įskaitant tyrimus, skirtus stebėti pacientų, kurie buvo paskiepyti įvairiomis Covid vakcinomis, rezultatus ir ištirti planinių operacijų komplikacijų skaičių koronavirusu nesergantiems pacientams pandemijos metu. Pirmoji bendradarbiavimo publikacija buvo analizė mirtingumo rizikos veiksniai vėžiu sergantiems pacientams, užsikrėtusiems SARS CoV2, ir buvo išleisti keli išankstiniai atspaudai tokiomis temomis, kaip koronaviruso pasekmės. kepenų ligomis sergantiems pacientams ir ŽIV užsikrėtusių žmonių .
Daugiau atskaitomybės, geresnis mokslas
Švarūs, tikslūs duomenys yra gyvybiškai svarbūs tokiems tyrimams, tačiau pandemijos chaose buvo sunku juos pasiekti. Praėjusį birželį du pagrindiniai žurnalai BMJ ir Lancetas, atsiėmė dokumentus, pagrįstus mažai žinomos medicinos duomenų bendrovės, turinčios keletą darbuotojų, „Surgisphere“ duomenimis. Ji teigė turinti prieigą prie beveik 100 000 koronaviruso pacientų 700 ligoninių visame pasaulyje realiuoju laiku medicininių įrašų. Kai kuriais atvejais pacientų skaičius buvo didesnis nei iš tikrųjų buvo diagnozuota konkrečioje šalyje.
Prieš atšaukiant dokumentus, buvo nuspręsta sustabdyti klinikinius tyrimus ir pakeisti medicinos praktiką. Tačiau kai tyrėjams kilo įtarimų – ypač atsižvelgiant į tai, kad net vienas susitarimas dėl medicininių duomenų perdavimo reikalauja milžiniško laiko ir darbo – bendrovė atsisakė niekam tikrinti duomenis. Tiesą sakant, nėra įrodymų, kad duomenų bazė kada nors egzistavo .
Susijusi istorija
Covid-19 duomenys yra viešoji gėrybė. JAV vyriausybė turi pradėti su juo elgtis kaip su viena. JAV nesugebėjo teikti pirmenybės itin efektyviai ir ekonomiškai intervencijai – suteikiant greitą ir lengvą prieigą prie koronaviruso duomenų.Kita vertus, N3C tikrina ir yra atskaitingas tūkstančiams šimtų dalyvaujančių institucijų mokslininkų, daug dėmesio skiriant skaidrumui ir atkuriamumui. Viskas, ką vartotojai daro per sąsają, kuri naudoja Palantir's GovCloud platforma, yra kruopščiai saugoma, todėl kiekvienas, turintis prieigą, gali atsekti savo žingsnius.
Tai nėra raketų mokslas ir tikrai nėra nauja. Tai tiesiog sunkus darbas. Tai nuobodu, tai turi būti daroma atsargiai ir mes turime patvirtinti kiekvieną žingsnį, sako Christopheris Chute'as, Johns Hopkins medicinos profesorius, kuris taip pat vadovauja N3C. Blogiausia, ką galėtume padaryti, tai metodiškai paversti duomenis šiukšlėmis, kurios mums duotų klaidingus atsakymus.
Brutali jėga
Haendelis pabrėžia, kad šios pastangos nebuvo lengvos. Ji sako, kad žinių įvairovė, kurios prireikė, kad tai įvyktų – atkaklumas, atsidavimas ir, tiesą sakant, žiauri jėga – yra tiesiog precedento neturinti.
Ši žiauri jėga kilo iš daugybės skirtingų sričių, ne tik medicinos.
Tai, kad visi dalyvavo visais mokslo aspektais, tikrai padėjo. Kovido metu žmonės buvo daug labiau linkę bendradarbiauti, sako Mary Boland, Pensilvanijos universiteto informatikos profesorė. Galite turėti inžinierių, kompiuterių mokslininkų, fizikų – visus šiuos žmones, kurie paprastai nedalyvauja visuomenės sveikatos tyrimuose.
Bolandas priklauso grupei, kuri naudoja N3C duomenis, siekdama išsiaiškinti, ar COVID padidina nereguliarų kraujavimą moterims, sergančioms policistinių kiaušidžių sindromu. Paprastai dauguma tyrėjų turi naudoti draudimo išmokų duomenis, kad gautų pakankamai didelę duomenų bazę gyventojų lygio analizei, sako ji.
Teiginių duomenys gali atsakyti į kai kuriuos klausimus, pavyzdžiui, kaip narkotikai veikia realiame pasaulyje. Tačiau šiose duomenų bazėse trūksta didžiulio kiekio informacijos, įskaitant laboratorijos rezultatus, simptomus, apie kuriuos praneša žmonės, ir net duomenų apie tai, ar pacientai išgyvena, ar miršta.
Surinkimas ir valymas
Be draudimo išmokų duomenų bazių, dauguma sveikatos duomenų bendradarbiaujančių JAV naudoja federalinį modelį. Visi šių tyrimų dalyviai sutinka suformatuoti savo duomenų rinkinius įprastu formatu ir tada vykdyti užklausas iš kolektyvo, pavyzdžiui, rimtų koronaviruso atvejų proporcijos pagal amžiaus grupes. Keletas tarptautinių Covid tyrimų kolektyvų, įskaitant Stebėjimo sveikatos duomenų mokslai ir informatika (OHDSI, tariamai Odisėja), veikia taip, išvengiant teisinių ir politinių problemų, susijusių su tarpvalstybiniais pacientų duomenimis.
OHDSI, kuri buvo įkurta 2014 m., turi tyrėjų iš 30 šalių ir turi 600 milijonų pacientų rekordus.
Tai leidžia kiekvienai institucijai saugoti savo duomenis už savo užkardos, taikant savo duomenų apsaugą. Norint judėti pirmyn ir atgal, nereikia jokių paciento duomenų, sako Bolandas. Tai guodžia daugeliui vietų, ypač atsižvelgiant į visus pastaruoju metu vykstančius įsilaužimus.
Tačiau pasikliauti, kad kiekviena institucija paruoš savo duomenis tokiai sistemai, kyla daug rizikos.
Duomenų įvedimas į bendrą duomenų formatą yra didžiausias iššūkis, nes net vaistų pavadinimai – manote, kad tai bus standartizuota visoje JAV, bet taip tikrai nėra, sako Bolandas. Vaistinės dažnai turi savo generinius vaistus, o jų sudedamosios dalys gali šiek tiek skirtis dėl patentų įstatymų. Kiekvienas iš jų turi savo narkotikų pavadinimą.
Kita vertus, N3C prašo visų dalyvių nusiųsti neapdorotus, netvarkingus įrašus į vieną vietą ir leisti centriniam korpusui juos išvalyti bei standartizuoti. Nors yra daug akivaizdžių pranašumų, yra didelių teisinių ir socialinių kliūčių dalyvauti tokiu būdu tiek Amerikoje, tiek tarptautiniu mastu; Pavyzdžiui, daugelis institucijų negali prisidėti prie N3C dėl savo valstijų privatumo įstatymų.
Tai taip pat sudėtinga technologiškai. Sujungti net du elektroninių medicininių įrašų rinkinius yra itin sunku ir daug darbo reikalaujanti; duomenų kokybė dažnai yra žema, o standartizavimas yra mažas. Remiantis 2018 m. „Pew“ straipsniu, įvairiose sveikatos priežiūros organizacijose net 1 iš 5 medicininių įrašų yra pasikartojantys failai, dažniausiai dėl duomenų įvedimo klaidų per susitikimus ar registracijas.
Tie, kurie gina federacinius modelius, dažnai tvirtina, kad jie patys atlieka kokybės kontrolę už savo užkardos. Tačiau N3C mokslininkai buvo šokiruoti sužinoję, kokie netvarkingi buvo duomenys.
Svetainės sulaukė tam tikro skepticizmo, pavyzdžiui: „Mums tikrai nereikia tokios duomenų kokybės sistemos – mes jau tai darome savo svetainėse konfidencialiai, už ugniasienės“. Mums nereikia jūsų smirdančių harmonizavimo įrankių“, – sako Haendelis. Tačiau mes sužinojome, kad šių kokybės priemonių nepakanka, kai žiūrite į apibendrintus duomenis.
Kai kurios duomenų kokybės problemos ribojasi su absurdu.
Kai kuriais atvejais organizacijoms nepavyko nustatyti matavimo vienetų. Taigi buvo svoris, bet nebuvo vieneto, kaip mes tik turėjome žinoti, sako Chute. Tačiau turėdami tokį didelį įrašų skaičių, jie turėjo pranašumą ir leido išsaugoti daug duomenų taškų, kurie kitu atveju būtų buvę išmesti.
Galėjome pažvelgti į duomenų, kurių vienetus turėjome, pasiskirstymą ir pamatyti, kur tinka paslaptingi duomenys, sako jis. Galite tiesiog pažvelgti į akis – o, akivaizdu, kad tai yra svarai ar kilogramai.
Didelė žuvis daug didesniame vandenyne
Kad ir kokia ji būtų, N3C duomenų bazė yra nyksta dėl duomenų, renkamų ir tvarkomų kitur JAV sveikatos priežiūros sistemoje, nuo vyriausybinių agentūrų iki ligoninių, bandymų laboratorijų, draudikų ir kt. Sveikatos ir žmogiškųjų paslaugų departamentas seka daugiau nei 2000 su sveikata susijusių duomenų rinkinių vien iš federalinių, valstijų ir vietinių agentūrų.
Susijusi istorija
Pandemijos superžvaigždės duomenų mokslininko Youyang Gu pamokos Jis per savaitę sukūrė mašininio mokymosi modelį ir kasdien jį naudojo nešiojamajame kompiuteryje (užtruko tik valandą), sukurdamas nepaprastai tikslias COVID-19 prognozes.
Kiekvieno naudingumą riboja silosuoti : mokslininkams, dirbantiems savarankiškai, iš esmės neįmanoma sujungti Medicare teiginių, įrašų iš vakcinų registrų, valstijų rasinės ir etninės priklausomybės duomenų apie skiepijimą arba duomenų bazes apie COVID-19 variantus, paimtus iš pacientų mėginių visoje šalyje. Iš tiesų neapdorotų įrašų pavertimas naudinga informacija yra toks sudėtingas, kad tapo klestinčia privačia pramone: duomenų brokeriai perka masiškai neidentifikuotus įrašus, analizuoja kintamųjų koreliacijas ir parduoda savo analizes (arba pačius duomenis) tyrėjams ir vyriausybėms.
Esame pasirengę atiduoti visus savo duomenis komerciniam subjektui ir leisti jiems juos parduoti mums, bet nenorime mokėti už paprasčiausią visuomenės sveikatos infrastruktūrą, sako Haendelis. Šios savanorių pastangos pandemijos akivaizdoje yra nuostabios, tačiau tai nėra tvarus ilgalaikis sprendimas kovojant su būsimomis pandemijomis ar tik sveikatos priežiūra apskritai.
N3C metodas padeda išvengti kai kurių iš šių problemų, tačiau jo duomenyse, ypač informacijoje apie skiepus, yra didelių spragų. Dauguma vakcinų yra įvedamos bendruomenės vietose, o bendradarbių įrašai yra iš pirminės sveikatos priežiūros vizitų ir hospitalizacijų, o tai reiškia, kad įrašuose buvo užfiksuota tik 245 000 Pfizer vakcinų ir 104 000 Moderna vakcinų. Sveikatos priežiūros analizės įmonė kuria įrankį, skirtą saugiai integruoti pacientų įrašus iš kelių šaltinių, tačiau jis nebus pasiekiamas bent kelis mėnesius.
Nepaisant šių spragų, didžiulė N3C duomenų bazė yra vienas geriausių išteklių tyrėjams, norintiems atsakyti į daugybę neišspręstų klausimų apie COVID.
Štai čia mes dabar įstrigome, sako Haendelis. Mums tikrai reikia įvairių klinikinės priežiūros aspektų srities ekspertų ir už juos slypinčio mokslo, kad padėtų mums rasti visas adatas šieno kupetose.
Redaktoriaus pastaba: ankstesnėje šios istorijos versijoje neteisingai buvo nurodytas komitetas, kuris peržiūri N3C duomenų naudojimo pasiūlymus. Tai yra NIH dalis, o ne Johns Hopkins.
Ši istorija yra Pandemijos technologijų projekto, remiamo Rokfelerio fondo, dalis.