Federated Learning za zdravstvo: Liječenje raka bez dijeljenja podataka
Tragedija podatkovnih silosa
Zamislite pet velikih istraživačkih bolnica u Europi: u Berlinu, Parizu, Amsterdamu, Milanu i Madridu. Svaka bolnica ima 1.000 pacijenata s rijetkim oblikom dječje leukemije. Uzorak od 1.000 pacijenata premalen je za treniranje pouzdanog modela dubokog učenja koji bi rano otkrio bolest. Model se pretrenira; nauči specifične osobitosti berlinskog skenera umjesto patologije raka.
No kada biste kombinirali skupove podataka, imali biste 5.000 pacijenata: dovoljno velik skup podataka za treniranje revolucionarne dijagnostičke umjetne inteligencije koja bi mogla spasiti tisuće života.
U starom svijetu to je bilo nemoguće. GDPR u Europi, HIPAA u SAD-u i stroga pravila o povjerljivosti pacijenata strogo zabranjuju slanje sirovih zapisa pacijenata iz bolnice A u bolnicu B ili njihovo učitavanje na središnji poslužitelj u oblaku u vlasništvu tehnološkog diva.
Podaci stoga ostaju u silosima. Umjetna inteligencija nikada se ne trenira. Obrazac ostaje neotkriven. Pacijenti umiru.
To je tragedija sukoba privatnosti podataka i medicinskog napretka. To je ćorsokak. No to je ćorsokak koji možemo razriješiti matematikom.
Federativno učenje: preokret treniranja
Federativno učenje (FL) u potpunosti preokreće standardnu paradigmu treniranja umjetne inteligencije.
Standardni pristup (centralizirani): Prikupite sve podatke iz svih izvora u golemo središnje jezero podataka. Trenirajte model na tom jezeru.
Federativni pristup (decentralizirani): Ostavite podatke gdje jesu. Pošaljite model podacima.
Evo kako to funkcionira u praksi, korak po korak:
- Inicijalizacija: Središnji poslužitelj (koordinator) stvara "prazan" ili unaprijed trenirani globalni model.
- Distribucija: Poslužitelj šalje kopiju tog modela svakoj od 5 bolnica.
- Lokalno treniranje: Svaka bolnica trenira model lokalno na vlastitim privatnim podacima o pacijentima. To treniranje odvija se na sigurnim poslužiteljima te bolnice, iza njezinog vatrozida. Sirovi podaci o pacijentima nikada ne napuštaju podrum.
- Generiranje ažuriranja: Lokalni proces treniranja proizvodi "ažuriranje modela": skup matematičkih prilagodbi težina (sinapsi) neuronske mreže. U biti kaže: "Da bismo bolje prepoznavali rak, podigni neuron #45 za 0,1 i spusti neuron #92 za 0,05."
- Agregacija: Bolnica šalje samo to ažuriranje modela (matematiku) natrag središnjem poslužitelju. Bez imena pacijenata, bez rendgenskih snimaka, bez rezultata krvnih pretraga. Samo datoteka s brojevima s pomičnim zarezom.
- Prosječivanje: Središnji poslužitelj prikuplja ažuriranja od svih 5 bolnica. Prosječuje ih zajedno (algoritmom poput federativnog prosječivanja) kako bi stvorio novi, pametniji globalni model.
- Ponavljanje: Novi globalni model šalje se natrag bolnicama i ciklus se ponavlja.
Matematička čarolija
Čarolija ovog procesa jest u tome što globalni model postaje pametniji kao da je treniran na svih 5.000 pacijenata, iako ih zapravo nikada nije izravno "vidio". Uči obrasce bolesti (koji su zajednički svim bolnicama), a ne uči identitete pacijenata (koji su jedinstveni za svaku bolnicu).
Time se razdvaja sposobnost učenja od potrebe za uvidom u podatke.
Obrana u dubinu: SMPC i diferencijalna privatnost
Paranoidni sigurnosni inženjeri (poput nas u Dweveu) pitat će: "Ali zar ne možete obrnutim inženjeringom izvući podatke o pacijentima iz ažuriranja modela?"
To je opravdana zabrinutost. U teoriji, ako je ažuriranje modela vrlo specifično, zlonamjerni središnji poslužitelj mogao bi zaključiti da je "pacijent X u bolnici u Berlinu morao imati stanje Y."
Kako bi to spriječio, Dweve dodaje dvije dodatne kriptografske tehnologije na federativno učenje:
1. Sigurno višestranačko računanje (SMPC)
To je kriptografski protokol koji središnjem poslužitelju omogućuje izračun zbroja ažuriranja bez ikakvog uvida u pojedinačna ažuriranja.
Zamislite da tri osobe žele izračunati svoju prosječnu plaću, ali nitko ne želi otkriti svoju plaću drugima. SMPC im to omogućuje. Poslužitelj vidi agregirani rezultat, ali ga matematički ne može rastaviti na pojedinačne unose. Poslužitelj doslovno ne zna koja je bolnica poslala koje ažuriranje.
2. Diferencijalna privatnost (DP)
Kao što je objašnjeno u našem članku o privatnosti, dodajemo statistički šum lokalnim ažuriranjima prije nego što napuste bolnicu. To "zamagljuje" doprinos bilo kojeg pojedinačnog pacijenta, čineći matematički dokazanu anonimnost mogućom.
Utjecaj u stvarnom svijetu
Trenutačno uvodimo ovu tehnologiju s konzorcijem europskih onkoloških centara. Oni treniraju model za otkrivanje tumora preko granica (Njemačka, Francuska, Nizozemska), a da pritom ne krše nijednu uredbu o privatnosti. Rješavaju problem prijenosa podataka iz presude "Schrems II" jednostavno tako što podatke ne prenose.
To je budućnost medicinskih istraživanja. Otključava golemu, zarobljenu vrijednost svjetskih zdravstvenih podataka. Omogućuje nam da se s bolešću borimo kao globalna kolektivna vrsta, poštujući pritom privatnost pojedinca.
Ne moramo birati između privatnosti i zdravlja. Ne moramo birati između pojedinca i kolektiva. Uz federativno učenje možemo imati oboje.
Spremni ste otključati snagu svojih zdravstvenih podataka bez ugrožavanja privatnosti pacijenata? Infrastruktura federativnog učenja tvrtke Dweve omogućuje revolucionarnu medicinsku umjetnu inteligenciju preko institucionalnih granica, uz punu usklađenost s GDPR-om i HIPAA-om. Kontaktirajte nas kako biste saznali kako suradnička umjetna inteligencija može transformirati vaše istraživačke mogućnosti.