Decentralizēta mašīnmācīšanās veselības aprūpē: vēža ārstēšana bez datu koplietošanas

Here is the translated fragment: Hospitals have the data to cure diseases, but privacy laws prevent them from sharing it. Federated Learning solves the...

Decentralizēta mašīnmācīšanās veselības aprūpē: vēža ārstēšana bez datu koplietošanas

Datu silosu traģēdija

Iedomājieties piecas lielas pētniecības slimnīcas Eiropā: Berlīnē, Parīzē, Amsterdamā, Milānā un Madridē. Katrā slimnīcā ir 1 000 pacientu ar retu, specifisku pediatriskās leikēmijas formu. Izlases lielums 1 000 ir pārāk mazs, lai apmācītu uzticamu Deep Learning modeli slimības agrīnai atklāšanai. Modelis pārmācās; tas apgūst Berlīnes skenera specifiskās īpatnības, nevis vēža patoloģiju.

Tomēr, ja datu kopas varētu apvienot, būtu 5 000 pacientu: datu kopa, kas ir pietiekami liela, lai apmācītu izrāvienu sniedzošu diagnostikas mākslīgā intelekta sistēmu, kas varētu glābt tūkstošiem dzīvību.

Vecajā pasaulē tas nebija iespējams. GDPR Eiropā, HIPAA ASV un stingri pacientu konfidencialitātes noteikumi stingri aizliedz nosūtīt neapstrādātus pacientu ierakstus no slimnīcas A uz slimnīcu B vai augšupielādēt tos centralizētā mākoņserverī, kas pieder tehnoloģiju gigantam.

Tāpēc dati paliek silosos. Mākslīgais intelekts nekad netiek apmācīts. Modelis paliek neatklāts. Pacienti mirst.

Šī ir datu privātuma un medicīnas progresa traģēdija. Tas ir strupceļš. Bet tas ir strupceļš, ko varam pārraut ar matemātiku.

Tradicionālā AI apmācība pret federatīvo mācīšanosTradicionālā (centralizētā)Slimnīca ASlimnīca BSlimnīca CCentrālais mākonisPacientu dati augšupielādēti ✗Federatīvā mācīšanāsSlimnīca ASlimnīca BSlimnīca CKoordinatorsTiek nosūtīti tikai modeļa atjauninājumi ✓Federatīvās mācīšanās process1. IzplatītModelis → Slimnīcas2. Apmācīt lokāliDati paliek uz vietas3. Nosūtīt atjauninājumusTikai matemātika, bez datiem4. ApkopotVidējais → GlobālaisPacientu dati NEKAD nepamet slimnīcu. Tiek kopīgoti tikai matemātiskie atjauninājumi.
Traidēdija nav tā, ka slimnīcas aizsargā pacientus. Tā ir tā, ka vecais apmācības modelis prasa kopīgu datubāzi, pirms modelis vispār var mācīties.

Federated Learning: apmācības inversija

Federated Learning (FL) pilnībā apgriež kājām gaisā standarta AI apmācības paradigmu.

Standarta pieeja (centralizēta): Savāc visus datus no visiem avotiem vienā milzīgā centrālā datu ezerā. Apmāciet modeli uz šī ezera.

Federatīvā pieeja (decentralizēta): Atstājiet datus tur, kur tie ir. Nosūtiet modeli pie datiem.

Lūk, kā tas darbojas praksē, soli pa solim:

  1. Inicializācija: Centrālais serveris (koordinators) izveido "tukšu" vai iepriekš apmācītu globālo modeli.
  2. Izplatīšana: Serveris nosūta šī modeļa kopiju katrai no 5 slimnīcām.
  3. Lokālā apmācība: Katra slimnīca apmāca modeli lokāli uz saviem privātajiem pacientu datiem. Šī apmācība notiek uz slimnīcas pašas drošajiem serveriem, aiz tās ugunsmūra. Neapstrādātie pacientu dati nekad nepamet pagrabu.
  4. Atjauninājuma ģenerēšana: Lokālās apmācības process rada "modeļa atjauninājumu": matemātisku pielāgojumu kopu neironu tīkla svariem (sinapsēm). Tas būtībā saka: "Lai labāk atpazītu vēzi, paceliet neironu #45 par 0,1 un nolaidiet neironu #92 par 0,05."
  5. Agregācija: Slimnīca nosūta atpakaļ centrālajam serverim tikai šo modeļa atjauninājumu (matemātiku). Nekādu pacientu vārdu, nekādu rentgena attēlu, nekādu asins analīžu rezultātu. Tikai fails ar peldošā komata skaitļiem.
  6. Vidējošana: Centrālais serveris savāc atjauninājumus no visām 5 slimnīcām. Tas tos vidējo (izmantojot algoritmu, piemēram, Federated Averaging), lai izveidotu jaunu, gudrāku globālo modeli.
  7. Atkārtošana: Jaunais globālais modelis tiek nosūtīts atpakaļ slimnīcām, un cikls atkārtojas.
Federated learning apgriež bīstamo kustību: aprēķini šķērso institūciju robežas, kamēr pacientu ieraksti paliek aiz ugunsmūra.

Matemātiskā maģija

Šī procesa maģija ir tā, ka globālais modelis kļūst gudrāks it kā tas būtu apmācīts uz visiem 5 000 pacientiem, lai gan tas nekad īsti nevienu no tiem "nav redzējis" tieši. Tas apgūst slimības modeļus (kas ir kopīgi visām slimnīcām), neapgūstot pacientu identitātes (kas ir unikālas katrai slimnīcai).

Tas atdala spēju mācīties no nepieciešamības redzēt.

Dweve aizsardzība dziļumā: privātuma līmeņi1. līmenis: federatīvā mācīšanāsDati nekad nepamet slimnīcu. Tiek pārsūtīti tikai modeļa atjauninājumi.Risina: datu pārsūtīšanas ierobežojumus, GDPR atbilstību, iestāžu suverenitāti2. līmenis: droša vairāku pušu aprēķināšana (SMPC)Serveris aprēķina kopsummu, neredzot atsevišķus slimnīcu atjauninājumus.Risina: ļaunprātīga koordinatora uzbrukumus, secinājumu uzbrukumus atjauninājumiem3. līmenis: diferenciālā privātums (DP)Atjauninājumiem tiek pievienots statistiskais troksnis, matemātiski ierobežojot privātuma zudumu.Risina: atkārtotu identificēšanu pēc modeļiem, dalības secinājumu uzbrukumusRezultāts: matemātiski pierādītas privātuma garantijas (ε-diferenciālais privātums)

Aizsardzība dziļumā: SMPC un diferenciālais privātums

Paranoiski drošības inženieri (tādi kā mēs Dweve) jautās: "Bet vai jūs nevarat rekonstruēt pacienta datus no modeļa atjauninājuma?"

Tas ir pamatots jautājums. Teorētiski, ja modeļa atjauninājums ir ļoti specifisks, ļaunprātīgs centrālais serveris varētu secināt, ka "pacientam X Berlīnes slimnīcā noteikti ir bijis stāvoklis Y."

Lai to novērstu, Dweve papildus federatīvajai mācīšanās pievieno divas kriptogrāfijas tehnoloģijas:

1. Droša vairāku pušu aprēķināšana (SMPC)

Šis ir kriptogrāfijas protokols, kas ļauj centrālajam serverim aprēķināt atjauninājumu summu, nekad neredzot atsevišķus atjauninājumus.

Iedomājieties, ka trīs cilvēki vēlas aprēķināt savu vidējo algu, bet neviens nevēlas atklāt savu algu citiem. SMPC viņiem to ļauj. Serveris redz kopējo rezultātu, bet matemātiski nevar to sadalīt atpakaļ atsevišķās ievadēs. Serveris burtiski nezina, kura slimnīca nosūtīja kuru atjauninājumu.

2. Diferenciālais privātums (DP)

Kā apspriests mūsu privātuma rakstā, mēs pievienojam statistisko troksni vietējiem atjauninājumiem, pirms tie atstāj slimnīcu. Tas "izpludina" jebkura atsevišķa pacienta ieguldījumu, padarot matemātiski pierādītu anonimitāti iespējamu.

Koordinators būtu jāuzzina tikai modeļa kopējais virziens, nevis tas, kura slimnīca vai pacients to ir noteicis.

Ietekme reālajā pasaulē

Šo tehnoloģiju pašlaik ieviešam kopā ar Eiropas onkoloģijas centru konsorciju. Tie apmāca audzēju atpazīšanas modeli pāri robežām (Vācija, Francija, Nīderlande), nepārkāpjot nevienu privātuma regulējumu. Viņi atrisina "Schrems II" datu pārsūtīšanas problēmu, vienkārši nepārsūtot datus.

Tā ir medicīnas pētniecības nākotne. Tā atbrīvo milzīgo, neizmantoto pasaules veselības datu vērtību. Tā ļauj mums cīnīties pret slimībām kā globālai kolektīvai sugai, vienlaikus respektējot katra indivīda privātumu.

Mums nav jāizvēlas starp privātumu un veselību. Mums nav jāizvēlas starp indivīdu un kolektīvu. Ar federatīvo mācīšanos mēs varam iegūt abus.

Vai esat gatavi atraisīt savu veselības datu spēku, neapdraudot pacientu privātumu? Dweve federatīvās mācīšanās infrastruktūra nodrošina izrāvienu medicīnas mākslīgajā intelektā pāri institūciju robežām, vienlaikus pilnībā ievērojot GDPR un HIPAA prasības. Sazinieties ar mums, lai uzzinātu, kā sadarbīgs mākslīgais intelekts var pārveidot jūsu pētniecības iespējas.

Praktiskais ieguvums ir klīniskā sadarbība ar mazāku atbilstības mērķi: kopīga mācīšanās, nevis kopīgi neapstrādāti ieraksti.