Zvezno učenje za zdravstvo: zdravljenje raka brez deljenja podatkov

Kako federativno učenje reši zastoj pri izmenjavi zdravstvenih podatkov.

Zvezno učenje za zdravstvo: zdravljenje raka brez deljenja podatkov

Tragedija podatkovnih silosov

Predstavljajte si pet velikih raziskovalnih bolnišnic v Evropi: v Berlinu, Parizu, Amsterdamu, Milanu in Madridu. Vsaka bolnišnica ima 1.000 pacientov s posebno, redko obliko otroške levkemije. Vzorec 1.000 pacientov je premajhen za usposabljanje zanesljivega modela globokega učenja za zgodnje odkrivanje bolezni. Model se preveč prilagodi podatkom; nauči se posebnosti berlinskega skenerja namesto patologije raka.

Če pa bi lahko združili podatkovne nize, bi imeli 5.000 pacientov: podatkovni niz, dovolj velik za usposabljanje prelomne diagnostične umetne inteligence, ki bi lahko rešila na tisoče življenj.

V starem svetu je bilo to nemogoče. GDPR v Evropi, HIPAA v ZDA in stroga pravila o zaupnosti pacientov strogo prepovedujejo pošiljanje surovih zdravstvenih kartotek iz bolnišnice A v bolnišnico B ali njihovo nalaganje v osrednji oblak v lasti tehnološkega velikana.

Podatki zato ostajajo v silosih. Umetna inteligenca se nikoli ne usposobi. Vzorec ostane neodkrit. Pacienti umirajo.

To je tragedija zasebnosti podatkov v primerjavi z medicinskim napredkom. Gre za zastoj. A to je zastoj, ki ga lahko prekinemo z matematiko.

Tradicionalno usposabljanje umetne inteligence proti zveznemu učenjuTradicionalno (centralizirano)Bolnišnica ABolnišnica BBolnišnica CCentralni oblakNaloženi podatki pacientov ✗Zvezno učenjeBolnišnica ABolnišnica BBolnišnica CKoordinatorPoslane so samo posodobitve modela ✓Postopek zveznega učenja1. RazdelitevModel → Bolnišnice2. Lokalno usposabljanjePodatki ostanejo na kraju samem3. Pošiljanje posodobitevSamo matematika, brez podatkov4. ZdruževanjePovprečje → GlobalnoPodatki pacientov NIKOLI ne zapustijo bolnišnice. Delijo se samo matematične posodobitve.
Tragedija ni v tem, da bolnišnice varujejo paciente. Je v tem, da stari vzorec usposabljanja zahteva skupno podatkovno zbirko, preden se model lahko uči.

Zvezno učenje: Obrat usposabljanja

Zvezno učenje (angl. Federated Learning, FL) popolnoma obrne standardno paradigmo usposabljanja umetne inteligence.

Standardni pristop (centraliziran): Zberi vse podatke iz vseh virov v ogromno centralno podatkovno jezero. Usposabljaj model na tem jezeru.

Zvezni pristop (decentraliziran): Pusti podatke, kjer so. Pošlji model k podatkom.

Takole deluje v praksi, korak za korakom:

  1. Inicializacija: Centralni strežnik (koordinator) ustvari »prazen« ali vnaprej usposobljen globalni model.
  2. Distribucija: Strežnik pošlje kopijo tega modela vsaki od 5 bolnišnic.
  3. Lokalno usposabljanje: Vsaka bolnišnica usposablja model lokalno na svojih zasebnih podatkih o pacientih. To usposabljanje poteka na bolnišničnih varnih strežnikih, za njihovim požarnim zidom. Surovi podatki o pacientih nikoli ne zapustijo kleti.
  4. Ustvarjanje posodobitve: Lokalni postopek usposabljanja ustvari »posodobitev modela«: niz matematičnih prilagoditev uteži (sinaps) nevronske mreže. V bistvu sporoča: »Za boljše prepoznavanje raka dvigni nevron št. 45 za 0,1 in znižaj nevron št. 92 za 0,05.«
  5. Agregacija: Bolnišnica pošlje samo to posodobitev modela (matematiko) nazaj na centralni strežnik. Brez imen pacientov, brez rentgenskih posnetkov, brez izvidov krvnih preiskav. Samo datoteka s števili s plavajočo vejico.
  6. Povprečenje: Centralni strežnik zbere posodobitve vseh 5 bolnišnic. Jih povpreči (z algoritmom, kot je zvezno povprečenje) in ustvari nov, pametnejši globalni model.
  7. Ponavljanje: Novi globalni model se pošlje nazaj bolnišnicam in cikel se ponovi.
Zvezno učenje obrne nevarno gibanje: računanje prečka institucionalne meje, medtem ko zapisi o pacientih ostanejo za požarnim zidom.

Matematična čarovnija

Čarovnija tega postopka je v tem, da globalni model postaja pametnejši, kot da bi bil usposobljen na vseh 5.000 pacientih, čeprav jih dejansko nikoli ni »videl« neposredno. Nauči se vzorcev bolezni (ki so skupni vsem bolnišnicam), ne da bi se naučil identitet pacientov (ki so za vsako bolnišnico edinstvene).

Loči zmožnost učenja od potrebe po videnju.

Dwevejeva obramba v globino: plasti zasebnostiPlast 1: zvezno učenjePodatki nikoli ne zapustijo bolnišnice. Prenesejo se samo posodobitve modela.Rešuje: omejitve prenosa podatkov, skladnost z GDPR, institucionalno suverenostPlast 2: varni večstranski izračun (SMPC)Strežnik izračuna agregat, ne da bi videl posamezne posodobitve bolnišnic.Rešuje: napade zlonamernega koordinatorja, napade s sklepanjem na podlagi posodobitevPlast 3: diferencialna zasebnost (DP)Posodobitvam se doda statistični šum, ki matematično omeji izgubo zasebnosti.Rešuje: ponovno identifikacijo iz vzorcev, napade s sklepanjem o članstvuRezultat: matematično dokazana jamstva zasebnosti (ε-diferencialna zasebnost)

Obramba v globino: SMPC in diferencialna zasebnost

Paranoidni varnostni inženirji (kot smo mi pri Dweve) bodo vprašali: "Ampak ali ne moreš iz posodobitve modela obnoviti podatkov o bolnikih?"

To je upravičen pomislek. Teoretično bi lahko zlonamerni osrednji strežnik, če je posodobitev modela zelo specifična, sklepal, da je "bolnik X v bolnišnici v Berlinu moral imeti stanje Y."

Da bi to preprečili, Dweve na zvezno učenje doda dve dodatni kriptografski tehnologiji:

1. Varni večstranski izračun (SMPC)

To je kriptografski protokol, ki osrednjemu strežniku omogoča izračun vsote posodobitev, ne da bi kdaj videl posamezne posodobitve.

Predstavljajte si tri osebe, ki želijo izračunati svojo povprečno plačo, vendar nihče ne želi razkriti svoje plače drugim. SMPC jim to omogoča. Strežnik vidi agregatni rezultat, vendar ga matematično ne more razstaviti nazaj na posamezne vnose. Strežnik dobesedno ne ve, katera bolnišnica je poslala katero posodobitev.

2. Diferencialna zasebnost (DP)

Kot je opisano v našem članku o zasebnosti, lokalnim posodobitvam dodamo statistični šum, preden zapustijo bolnišnico. To "zamegli" prispevek vsakega posameznega bolnika in omogoči matematično dokazano anonimnost.

Koordinator naj bi izvedel splošno smer modela, ne pa tega, katera bolnišnica ali pacient ga je usmeril tja.

Vpliv v resničnem svetu

To tehnologijo trenutno uvajamo s konzorcijem evropskih onkoloških centrov. Ti usposabljajo model za odkrivanje tumorjev čez meje (Nemčija, Francija, Nizozemska), ne da bi kršili katero koli predpis o zasebnosti. Rešujejo problem prenosa podatkov "Schrems II" tako, da podatkov preprosto ne prenašajo.

To je prihodnost medicinskih raziskav. Odpira ogromno, ujeto vrednost svetovnih zdravstvenih podatkov. Omogoča nam boj proti boleznim kot globalna kolektivna vrsta, hkrati pa spoštuje zasebnost posameznika.

Ni nam treba izbirati med zasebnostjo in zdravjem. Ni nam treba izbirati med posameznikom in kolektivom. Z zveznim učenjem lahko imamo oboje.

Ste pripravljeni sprostiti moč svojih zdravstvenih podatkov brez ogrožanja zasebnosti pacientov? Infrastruktura zveznega učenja podjetja Dweve omogoča prebojno medicinsko umetno inteligenco čez institucionalne meje ob polni skladnosti z GDPR in HIPAA. Stopite v stik z nami, če želite izvedeti, kako lahko sodelovalna umetna inteligenca preoblikuje vaše raziskovalne zmogljivosti.

Praktična prednost je klinično sodelovanje z manjšim ciljem skladnosti: skupno učenje, ne skupni surovi zapisi.