Decentralizēta mašīnmācīšanās veselības aprūpē: vēža ārstēšana bez datu koplietošanas
Datu silosu traģēdija
Iedomājieties piecas lielas pētniecības slimnīcas Eiropā: Berlīnē, Parīzē, Amsterdamā, Milānā un Madridē. Katrā slimnīcā ir 1 000 pacientu ar retu, specifisku pediatriskās leikēmijas formu. Izlases lielums 1 000 ir pārāk mazs, lai apmācītu uzticamu Deep Learning modeli slimības agrīnai atklāšanai. Modelis pārmācās; tas apgūst Berlīnes skenera specifiskās īpatnības, nevis vēža patoloģiju.
Tomēr, ja datu kopas varētu apvienot, būtu 5 000 pacientu: datu kopa, kas ir pietiekami liela, lai apmācītu izrāvienu sniedzošu diagnostikas mākslīgā intelekta sistēmu, kas varētu glābt tūkstošiem dzīvību.
Vecajā pasaulē tas nebija iespējams. GDPR Eiropā, HIPAA ASV un stingri pacientu konfidencialitātes noteikumi stingri aizliedz nosūtīt neapstrādātus pacientu ierakstus no slimnīcas A uz slimnīcu B vai augšupielādēt tos centralizētā mākoņserverī, kas pieder tehnoloģiju gigantam.
Tāpēc dati paliek silosos. Mākslīgais intelekts nekad netiek apmācīts. Modelis paliek neatklāts. Pacienti mirst.
Šī ir datu privātuma un medicīnas progresa traģēdija. Tas ir strupceļš. Bet tas ir strupceļš, ko varam pārraut ar matemātiku.
Federated Learning: apmācības inversija
Federated Learning (FL) pilnībā apgriež kājām gaisā standarta AI apmācības paradigmu.
Standarta pieeja (centralizēta): Savāc visus datus no visiem avotiem vienā milzīgā centrālā datu ezerā. Apmāciet modeli uz šī ezera.
Federatīvā pieeja (decentralizēta): Atstājiet datus tur, kur tie ir. Nosūtiet modeli pie datiem.
Lūk, kā tas darbojas praksē, soli pa solim:
- Inicializācija: Centrālais serveris (koordinators) izveido "tukšu" vai iepriekš apmācītu globālo modeli.
- Izplatīšana: Serveris nosūta šī modeļa kopiju katrai no 5 slimnīcām.
- Lokālā apmācība: Katra slimnīca apmāca modeli lokāli uz saviem privātajiem pacientu datiem. Šī apmācība notiek uz slimnīcas pašas drošajiem serveriem, aiz tās ugunsmūra. Neapstrādātie pacientu dati nekad nepamet pagrabu.
- Atjauninājuma ģenerēšana: Lokālās apmācības process rada "modeļa atjauninājumu": matemātisku pielāgojumu kopu neironu tīkla svariem (sinapsēm). Tas būtībā saka: "Lai labāk atpazītu vēzi, paceliet neironu #45 par 0,1 un nolaidiet neironu #92 par 0,05."
- Agregācija: Slimnīca nosūta atpakaļ centrālajam serverim tikai šo modeļa atjauninājumu (matemātiku). Nekādu pacientu vārdu, nekādu rentgena attēlu, nekādu asins analīžu rezultātu. Tikai fails ar peldošā komata skaitļiem.
- Vidējošana: Centrālais serveris savāc atjauninājumus no visām 5 slimnīcām. Tas tos vidējo (izmantojot algoritmu, piemēram, Federated Averaging), lai izveidotu jaunu, gudrāku globālo modeli.
- Atkārtošana: Jaunais globālais modelis tiek nosūtīts atpakaļ slimnīcām, un cikls atkārtojas.
Matemātiskā maģija
Šī procesa maģija ir tā, ka globālais modelis kļūst gudrāks it kā tas būtu apmācīts uz visiem 5 000 pacientiem, lai gan tas nekad īsti nevienu no tiem "nav redzējis" tieši. Tas apgūst slimības modeļus (kas ir kopīgi visām slimnīcām), neapgūstot pacientu identitātes (kas ir unikālas katrai slimnīcai).
Tas atdala spēju mācīties no nepieciešamības redzēt.
Aizsardzība dziļumā: SMPC un diferenciālais privātums
Paranoiski drošības inženieri (tādi kā mēs Dweve) jautās: "Bet vai jūs nevarat rekonstruēt pacienta datus no modeļa atjauninājuma?"
Tas ir pamatots jautājums. Teorētiski, ja modeļa atjauninājums ir ļoti specifisks, ļaunprātīgs centrālais serveris varētu secināt, ka "pacientam X Berlīnes slimnīcā noteikti ir bijis stāvoklis Y."
Lai to novērstu, Dweve papildus federatīvajai mācīšanās pievieno divas kriptogrāfijas tehnoloģijas:
1. Droša vairāku pušu aprēķināšana (SMPC)
Šis ir kriptogrāfijas protokols, kas ļauj centrālajam serverim aprēķināt atjauninājumu summu, nekad neredzot atsevišķus atjauninājumus.
Iedomājieties, ka trīs cilvēki vēlas aprēķināt savu vidējo algu, bet neviens nevēlas atklāt savu algu citiem. SMPC viņiem to ļauj. Serveris redz kopējo rezultātu, bet matemātiski nevar to sadalīt atpakaļ atsevišķās ievadēs. Serveris burtiski nezina, kura slimnīca nosūtīja kuru atjauninājumu.
2. Diferenciālais privātums (DP)
Kā apspriests mūsu privātuma rakstā, mēs pievienojam statistisko troksni vietējiem atjauninājumiem, pirms tie atstāj slimnīcu. Tas "izpludina" jebkura atsevišķa pacienta ieguldījumu, padarot matemātiski pierādītu anonimitāti iespējamu.
Ietekme reālajā pasaulē
Šo tehnoloģiju pašlaik ieviešam kopā ar Eiropas onkoloģijas centru konsorciju. Tie apmāca audzēju atpazīšanas modeli pāri robežām (Vācija, Francija, Nīderlande), nepārkāpjot nevienu privātuma regulējumu. Viņi atrisina "Schrems II" datu pārsūtīšanas problēmu, vienkārši nepārsūtot datus.
Tā ir medicīnas pētniecības nākotne. Tā atbrīvo milzīgo, neizmantoto pasaules veselības datu vērtību. Tā ļauj mums cīnīties pret slimībām kā globālai kolektīvai sugai, vienlaikus respektējot katra indivīda privātumu.
Mums nav jāizvēlas starp privātumu un veselību. Mums nav jāizvēlas starp indivīdu un kolektīvu. Ar federatīvo mācīšanos mēs varam iegūt abus.
Vai esat gatavi atraisīt savu veselības datu spēku, neapdraudot pacientu privātumu? Dweve federatīvās mācīšanās infrastruktūra nodrošina izrāvienu medicīnas mākslīgajā intelektā pāri institūciju robežām, vienlaikus pilnībā ievērojot GDPR un HIPAA prasības. Sazinieties ar mums, lai uzzinātu, kā sadarbīgs mākslīgais intelekts var pārveidot jūsu pētniecības iespējas.