Zvezno učenje za zdravstvo: zdravljenje raka brez deljenja podatkov
Tragedija podatkovnih silosov
Predstavljajte si pet velikih raziskovalnih bolnišnic v Evropi: v Berlinu, Parizu, Amsterdamu, Milanu in Madridu. Vsaka bolnišnica ima 1.000 pacientov s posebno, redko obliko otroške levkemije. Vzorec 1.000 pacientov je premajhen za usposabljanje zanesljivega modela globokega učenja za zgodnje odkrivanje bolezni. Model se preveč prilagodi podatkom; nauči se posebnosti berlinskega skenerja namesto patologije raka.
Če pa bi lahko združili podatkovne nize, bi imeli 5.000 pacientov: podatkovni niz, dovolj velik za usposabljanje prelomne diagnostične umetne inteligence, ki bi lahko rešila na tisoče življenj.
V starem svetu je bilo to nemogoče. GDPR v Evropi, HIPAA v ZDA in stroga pravila o zaupnosti pacientov strogo prepovedujejo pošiljanje surovih zdravstvenih kartotek iz bolnišnice A v bolnišnico B ali njihovo nalaganje v osrednji oblak v lasti tehnološkega velikana.
Podatki zato ostajajo v silosih. Umetna inteligenca se nikoli ne usposobi. Vzorec ostane neodkrit. Pacienti umirajo.
To je tragedija zasebnosti podatkov v primerjavi z medicinskim napredkom. Gre za zastoj. A to je zastoj, ki ga lahko prekinemo z matematiko.
Zvezno učenje: Obrat usposabljanja
Zvezno učenje (angl. Federated Learning, FL) popolnoma obrne standardno paradigmo usposabljanja umetne inteligence.
Standardni pristop (centraliziran): Zberi vse podatke iz vseh virov v ogromno centralno podatkovno jezero. Usposabljaj model na tem jezeru.
Zvezni pristop (decentraliziran): Pusti podatke, kjer so. Pošlji model k podatkom.
Takole deluje v praksi, korak za korakom:
- Inicializacija: Centralni strežnik (koordinator) ustvari »prazen« ali vnaprej usposobljen globalni model.
- Distribucija: Strežnik pošlje kopijo tega modela vsaki od 5 bolnišnic.
- Lokalno usposabljanje: Vsaka bolnišnica usposablja model lokalno na svojih zasebnih podatkih o pacientih. To usposabljanje poteka na bolnišničnih varnih strežnikih, za njihovim požarnim zidom. Surovi podatki o pacientih nikoli ne zapustijo kleti.
- Ustvarjanje posodobitve: Lokalni postopek usposabljanja ustvari »posodobitev modela«: niz matematičnih prilagoditev uteži (sinaps) nevronske mreže. V bistvu sporoča: »Za boljše prepoznavanje raka dvigni nevron št. 45 za 0,1 in znižaj nevron št. 92 za 0,05.«
- Agregacija: Bolnišnica pošlje samo to posodobitev modela (matematiko) nazaj na centralni strežnik. Brez imen pacientov, brez rentgenskih posnetkov, brez izvidov krvnih preiskav. Samo datoteka s števili s plavajočo vejico.
- Povprečenje: Centralni strežnik zbere posodobitve vseh 5 bolnišnic. Jih povpreči (z algoritmom, kot je zvezno povprečenje) in ustvari nov, pametnejši globalni model.
- Ponavljanje: Novi globalni model se pošlje nazaj bolnišnicam in cikel se ponovi.
Matematična čarovnija
Čarovnija tega postopka je v tem, da globalni model postaja pametnejši, kot da bi bil usposobljen na vseh 5.000 pacientih, čeprav jih dejansko nikoli ni »videl« neposredno. Nauči se vzorcev bolezni (ki so skupni vsem bolnišnicam), ne da bi se naučil identitet pacientov (ki so za vsako bolnišnico edinstvene).
Loči zmožnost učenja od potrebe po videnju.
Obramba v globino: SMPC in diferencialna zasebnost
Paranoidni varnostni inženirji (kot smo mi pri Dweve) bodo vprašali: "Ampak ali ne moreš iz posodobitve modela obnoviti podatkov o bolnikih?"
To je upravičen pomislek. Teoretično bi lahko zlonamerni osrednji strežnik, če je posodobitev modela zelo specifična, sklepal, da je "bolnik X v bolnišnici v Berlinu moral imeti stanje Y."
Da bi to preprečili, Dweve na zvezno učenje doda dve dodatni kriptografski tehnologiji:
1. Varni večstranski izračun (SMPC)
To je kriptografski protokol, ki osrednjemu strežniku omogoča izračun vsote posodobitev, ne da bi kdaj videl posamezne posodobitve.
Predstavljajte si tri osebe, ki želijo izračunati svojo povprečno plačo, vendar nihče ne želi razkriti svoje plače drugim. SMPC jim to omogoča. Strežnik vidi agregatni rezultat, vendar ga matematično ne more razstaviti nazaj na posamezne vnose. Strežnik dobesedno ne ve, katera bolnišnica je poslala katero posodobitev.
2. Diferencialna zasebnost (DP)
Kot je opisano v našem članku o zasebnosti, lokalnim posodobitvam dodamo statistični šum, preden zapustijo bolnišnico. To "zamegli" prispevek vsakega posameznega bolnika in omogoči matematično dokazano anonimnost.
Vpliv v resničnem svetu
To tehnologijo trenutno uvajamo s konzorcijem evropskih onkoloških centrov. Ti usposabljajo model za odkrivanje tumorjev čez meje (Nemčija, Francija, Nizozemska), ne da bi kršili katero koli predpis o zasebnosti. Rešujejo problem prenosa podatkov "Schrems II" tako, da podatkov preprosto ne prenašajo.
To je prihodnost medicinskih raziskav. Odpira ogromno, ujeto vrednost svetovnih zdravstvenih podatkov. Omogoča nam boj proti boleznim kot globalna kolektivna vrsta, hkrati pa spoštuje zasebnost posameznika.
Ni nam treba izbirati med zasebnostjo in zdravjem. Ni nam treba izbirati med posameznikom in kolektivom. Z zveznim učenjem lahko imamo oboje.
Ste pripravljeni sprostiti moč svojih zdravstvenih podatkov brez ogrožanja zasebnosti pacientov? Infrastruktura zveznega učenja podjetja Dweve omogoča prebojno medicinsko umetno inteligenco čez institucionalne meje ob polni skladnosti z GDPR in HIPAA. Stopite v stik z nami, če želite izvedeti, kako lahko sodelovalna umetna inteligenca preoblikuje vaše raziskovalne zmogljivosti.