Federated Learning za zdravstvo: Liječenje raka bez dijeljenja podataka

Federativno učenje rješava problem dijeljenja bolničkih podataka. Evo kako funkcionira.

Federated Learning za zdravstvo: Liječenje raka bez dijeljenja podataka

Tragedija podatkovnih silosa

Zamislite pet velikih istraživačkih bolnica u Europi: u Berlinu, Parizu, Amsterdamu, Milanu i Madridu. Svaka bolnica ima 1.000 pacijenata s rijetkim oblikom dječje leukemije. Uzorak od 1.000 pacijenata premalen je za treniranje pouzdanog modela dubokog učenja koji bi rano otkrio bolest. Model se pretrenira; nauči specifične osobitosti berlinskog skenera umjesto patologije raka.

No kada biste kombinirali skupove podataka, imali biste 5.000 pacijenata: dovoljno velik skup podataka za treniranje revolucionarne dijagnostičke umjetne inteligencije koja bi mogla spasiti tisuće života.

U starom svijetu to je bilo nemoguće. GDPR u Europi, HIPAA u SAD-u i stroga pravila o povjerljivosti pacijenata strogo zabranjuju slanje sirovih zapisa pacijenata iz bolnice A u bolnicu B ili njihovo učitavanje na središnji poslužitelj u oblaku u vlasništvu tehnološkog diva.

Podaci stoga ostaju u silosima. Umjetna inteligencija nikada se ne trenira. Obrazac ostaje neotkriven. Pacijenti umiru.

To je tragedija sukoba privatnosti podataka i medicinskog napretka. To je ćorsokak. No to je ćorsokak koji možemo razriješiti matematikom.

Tradicionalno treniranje umjetne inteligencije naspram saveznog učenjaTradicionalno (centralizirano)Bolnica ABolnica BBolnica CCentralni oblakPodaci pacijenata preneseni ✗Savezno učenjeBolnica ABolnica BBolnica CKoordinatorSamo ažuriranja modela poslana ✓Proces saveznog učenja1. DistribucijaModel → Bolnice2. Lokalno treniranjePodaci ostaju na mjestu3. Slanje ažuriranjaSamo matematika, bez podataka4. AgregacijaProsjek → GlobalnoPodaci pacijenata NIKADA ne napuštaju bolnicu. Dijele se samo matematička ažuriranja.
Tragedija nije u tome što bolnice štite pacijente. Tragedija je u tome što stari obrazac treniranja zahtijeva zajedničku bazu podataka prije nego što model uopće može učiti.

Federativno učenje: preokret treniranja

Federativno učenje (FL) u potpunosti preokreće standardnu paradigmu treniranja umjetne inteligencije.

Standardni pristup (centralizirani): Prikupite sve podatke iz svih izvora u golemo središnje jezero podataka. Trenirajte model na tom jezeru.

Federativni pristup (decentralizirani): Ostavite podatke gdje jesu. Pošaljite model podacima.

Evo kako to funkcionira u praksi, korak po korak:

  1. Inicijalizacija: Središnji poslužitelj (koordinator) stvara "prazan" ili unaprijed trenirani globalni model.
  2. Distribucija: Poslužitelj šalje kopiju tog modela svakoj od 5 bolnica.
  3. Lokalno treniranje: Svaka bolnica trenira model lokalno na vlastitim privatnim podacima o pacijentima. To treniranje odvija se na sigurnim poslužiteljima te bolnice, iza njezinog vatrozida. Sirovi podaci o pacijentima nikada ne napuštaju podrum.
  4. Generiranje ažuriranja: Lokalni proces treniranja proizvodi "ažuriranje modela": skup matematičkih prilagodbi težina (sinapsi) neuronske mreže. U biti kaže: "Da bismo bolje prepoznavali rak, podigni neuron #45 za 0,1 i spusti neuron #92 za 0,05."
  5. Agregacija: Bolnica šalje samo to ažuriranje modela (matematiku) natrag središnjem poslužitelju. Bez imena pacijenata, bez rendgenskih snimaka, bez rezultata krvnih pretraga. Samo datoteka s brojevima s pomičnim zarezom.
  6. Prosječivanje: Središnji poslužitelj prikuplja ažuriranja od svih 5 bolnica. Prosječuje ih zajedno (algoritmom poput federativnog prosječivanja) kako bi stvorio novi, pametniji globalni model.
  7. Ponavljanje: Novi globalni model šalje se natrag bolnicama i ciklus se ponavlja.
Federativno učenje preokreće opasno kretanje: izračun prelazi institucionalne granice, dok evidencija o pacijentima ostaje iza vatrozida.

Matematička čarolija

Čarolija ovog procesa jest u tome što globalni model postaje pametniji kao da je treniran na svih 5.000 pacijenata, iako ih zapravo nikada nije izravno "vidio". Uči obrasce bolesti (koji su zajednički svim bolnicama), a ne uči identitete pacijenata (koji su jedinstveni za svaku bolnicu).

Time se razdvaja sposobnost učenja od potrebe za uvidom u podatke.

Dweveova obrana u dubinu: slojevi privatnostiSloj 1: Federativno učenjePodaci nikada ne napuštaju bolnicu. Prenose se samo ažuriranja modela.Rješava: ograničenja prijenosa podataka, usklađenost s GDPR-om, institucionalni suverenitetSloj 2: Sigurno višestranačko računanje (SMPC)Poslužitelj izračunava zbroj bez uvida u pojedinačna ažuriranja bolnica.Rješava: napade zlonamjernog koordinatora, napade zaključivanjem na ažuriranjaSloj 3: Diferencijalna privatnost (DP)Statistički šum dodaje se ažuriranjima, matematički ograničavajući gubitak privatnosti.Rješava: ponovnu identifikaciju iz obrazaca, napade zaključivanjem o pripadnostiRezultat: matematički dokazana jamstva privatnosti (ε-diferencijalna privatnost)

Obrana u dubinu: SMPC i diferencijalna privatnost

Paranoidni sigurnosni inženjeri (poput nas u Dweveu) pitat će: "Ali zar ne možete obrnutim inženjeringom izvući podatke o pacijentima iz ažuriranja modela?"

To je opravdana zabrinutost. U teoriji, ako je ažuriranje modela vrlo specifično, zlonamjerni središnji poslužitelj mogao bi zaključiti da je "pacijent X u bolnici u Berlinu morao imati stanje Y."

Kako bi to spriječio, Dweve dodaje dvije dodatne kriptografske tehnologije na federativno učenje:

1. Sigurno višestranačko računanje (SMPC)

To je kriptografski protokol koji središnjem poslužitelju omogućuje izračun zbroja ažuriranja bez ikakvog uvida u pojedinačna ažuriranja.

Zamislite da tri osobe žele izračunati svoju prosječnu plaću, ali nitko ne želi otkriti svoju plaću drugima. SMPC im to omogućuje. Poslužitelj vidi agregirani rezultat, ali ga matematički ne može rastaviti na pojedinačne unose. Poslužitelj doslovno ne zna koja je bolnica poslala koje ažuriranje.

2. Diferencijalna privatnost (DP)

Kao što je objašnjeno u našem članku o privatnosti, dodajemo statistički šum lokalnim ažuriranjima prije nego što napuste bolnicu. To "zamagljuje" doprinos bilo kojeg pojedinačnog pacijenta, čineći matematički dokazanu anonimnost mogućom.

Koordinator bi trebao naučiti ukupni smjer modela, a ne to koja ga je bolnica ili pacijent usmjerio.

Utjecaj u stvarnom svijetu

Trenutačno uvodimo ovu tehnologiju s konzorcijem europskih onkoloških centara. Oni treniraju model za otkrivanje tumora preko granica (Njemačka, Francuska, Nizozemska), a da pritom ne krše nijednu uredbu o privatnosti. Rješavaju problem prijenosa podataka iz presude "Schrems II" jednostavno tako što podatke ne prenose.

To je budućnost medicinskih istraživanja. Otključava golemu, zarobljenu vrijednost svjetskih zdravstvenih podataka. Omogućuje nam da se s bolešću borimo kao globalna kolektivna vrsta, poštujući pritom privatnost pojedinca.

Ne moramo birati između privatnosti i zdravlja. Ne moramo birati između pojedinca i kolektiva. Uz federativno učenje možemo imati oboje.

Spremni ste otključati snagu svojih zdravstvenih podataka bez ugrožavanja privatnosti pacijenata? Infrastruktura federativnog učenja tvrtke Dweve omogućuje revolucionarnu medicinsku umjetnu inteligenciju preko institucionalnih granica, uz punu usklađenost s GDPR-om i HIPAA-om. Kontaktirajte nas kako biste saznali kako suradnička umjetna inteligencija može transformirati vaše istraživačke mogućnosti.

Praktična je prednost klinička suradnja s manjim ciljem usklađenosti: zajedničko učenje, a ne zajednički sirovi zapisi.