Fødereret læring i sundhedsvæsenet: Kur mod kræft uden at dele data
Datasilo-tragedien
Forestil dig, at der er fem store forskningshospitaler i Europa: i Berlin, Paris, Amsterdam, Milano og Madrid. Hvert hospital har 1.000 patienter med en specifik, sjælden form for pædiatrisk leukæmi. En stikprøvestørrelse på 1.000 er for lille til at træne en pålidelig Deep Learning-model til at opdage sygdommen tidligt. Modellen overfitter; den lærer de specifikke særheder ved Berlin-scanneren frem for kræftens patologi.
Hvis man imidlertid kunne kombinere datasættene, ville man have 5.000 patienter: et datasæt, der er stort nok til at træne en banebrydende diagnostisk AI, som kunne redde tusindvis af liv.
I den gamle verden var dette umuligt. GDPR i Europa, HIPAA i USA og strenge regler om patientfortrolighed forbyder strengt at sende rå patientjournaler fra Hospital A til Hospital B eller at uploade dem til en central cloudserver ejet af en techgigant.
Så dataene ligger i siloer. AI'en bliver aldrig trænet. Mønsteret forbliver uopdaget. Patienter dør.
Dette er tragedien ved databeskyttelse vs. medicinske fremskridt. Det er en dødvande. Men det er en dødvande, vi kan bryde med matematik.
Federated Learning: Vendingen af Træningen
Federated Learning (FL) vender fuldstændig op og ned på det normale paradigme for AI-træning.
Den standardiserede tilgang (centraliseret): Saml alle data fra alle kilder i en enorm central datasø. Træn modellen på søen.
Den federerede tilgang (decentraliseret): Lad dataene blive, hvor de er. Send modellen til dataene.
Sådan fungerer det i praksis, trin for trin:
- Initialisering: En central server (koordinatoren) opretter en "blank" eller prætrænet global model.
- Distribution: Serveren sender en kopi af denne model til hvert af de 5 hospitaler.
- Lokal træning: Hvert hospital træner modellen lokalt på sine egne private patientdata. Træningen foregår på hospitalets egne sikre servere, bag deres firewall. De rå patientdata forlader aldrig kælderen.
- Generering af opdateringer: Den lokale træningsproces producerer en "modelopdatering": et sæt matematiske justeringer af vægtene (synapserne) i det neurale netværk. Den siger i bund og grund: "For at genkende kræft bedre, skub neuron #45 op med 0,1 og neuron #92 ned med 0,05."
- Aggregering: Hospitalet sender kun denne modelopdatering (matematikken) tilbage til den centrale server. Ingen patientnavne, ingen røntgenbilleder, ingen blodprøveresultater. Bare en fil med kommatal.
- Gennemsnit: Den centrale server indsamler opdateringerne fra alle 5 hospitaler. Den beregner gennemsnittet af dem (ved hjælp af en algoritme som Federated Averaging) for at skabe en ny, klogere global model.
- Gentagelse: Den nye globale model sendes tilbage til hospitalerne, og cyklussen gentages.
Den Matematiske Magi
Magien ved denne proces er, at den globale model bliver klogere, som om den var blevet trænet på alle 5.000 patienter, selvom den aldrig faktisk "så" nogen af dem direkte. Den lærer sygdommens mønstre (som er fælles på tværs af alle hospitaler) uden at lære patienternes identiteter (som er unikke for hvert hospital).
Den adskiller evnen til at lære fra behovet for at se.
Forsvar i dybden: SMPC og differentiel privatliv
Paranoide sikkerhedsingeniører (som os hos Dweve) vil spørge: "Men kan I ikke reverse-engineere patientdataene fra modelopdateringen?"
Det er en berettiget bekymring. I teorien, hvis en modelopdatering er meget specifik, kan en ondsindet central server måske udlede, at "Patient X på Hospital Berlin må have haft tilstand Y."
For at forhindre dette lægger Dweve to yderligere kryptografiske teknologier oven på federeret læring:
1. Sikker multi-party-beregning (SMPC)
Dette er en kryptografisk protokol, der gør det muligt for den centrale server at beregne summen af opdateringerne uden nogensinde at se de enkelte opdateringer.
Forestil dig, at tre personer vil beregne deres gennemsnitlige løn, men ingen vil afsløre deres løn for de andre. SMPC gør det muligt for dem at gøre dette. Serveren ser det samlede resultat, men kan matematisk ikke dekomponere det tilbage til de enkelte input. Serveren ved bogstaveligt talt ikke, hvilket hospital der sendte hvilken opdatering.
2. Differentiel privatliv (DP)
Som beskrevet i vores privatlivsartikel tilføjer vi statistisk støj til de lokale opdateringer, før de forlader hospitalet. Dette "slører" bidraget fra enhver enkelt patient, hvilket gør matematisk bevist anonymitet mulig.
Virkelig effekt
Vi er i gang med at udrulle denne teknologi sammen med et konsortium af europæiske kræftcentre. De træner en model til tumorgenkendelse på tværs af landegrænser (Tyskland, Frankrig, Holland) uden at overtræde en eneste privatlivsregulering. De løser "Schrems II"-problemet med dataoverførsel ved simpelthen ikke at overføre data.
Det er fremtiden for medicinsk forskning. Det frigør den enorme, indelukkede værdi i verdens sundhedsdata. Det giver os mulighed for at bekæmpe sygdom som en global kollektiv art, samtidig med at vi respekterer den enkeltes privatliv.
Vi behøver ikke at vælge mellem privatliv og sundhed. Vi behøver ikke at vælge mellem individet og kollektivet. Med Federated Learning kan vi få begge dele.
Klar til at frigøre kraften i dine sundhedsdata uden at gå på kompromis med patienternes privatliv? Dweves Federated Learning-infrastruktur muliggør banebrydende medicinsk AI på tværs af institutionelle grænser, samtidig med at den overholder både GDPR og HIPAA. Kontakt os for at høre, hvordan kollaborativ AI kan forvandle dine forskningsmuligheder.