Föderatiivne õpe tervishoius: vähiravi ilma andmeid jagamata
Andmesilode tragöödia
Kujutage ette, et Euroopas on viis suurt teadushaiglat: Berliinis, Pariisis, Amsterdamis, Milanos ja Madridis. Igas haiglas on 1 000 patsienti, kellel on haruldane laste leukeemia vorm. Valimi suurus 1 000 on liiga väike, et treenida usaldusväärset süvaõppe mudelit, mis tuvastaks haiguse varakult. Mudel kohandub üle; see õpib selgeks Berliini skanneri eripärad, mitte vähi patoloogia.
Kui aga saaksite andmestikud ühendada, oleks teil 5 000 patsienti: piisavalt suur andmestik, et treenida läbimurdelist diagnostilist tehisintellekti, mis võiks päästa tuhandeid elusid.
Vanasti oli see võimatu. GDPR Euroopas, HIPAA Ameerika Ühendriikides ja ranged patsiendi konfidentsiaalsuse reeglid keelavad rangelt saata toorpatsiendiandmeid haiglast A haiglasse B või laadida need üles tsentraalsesse pilveserverisse, mis kuulub tehnoloogiahiiglasele.
Nii jäävad andmed silodesse. Tehisintellekti ei treenita kunagi. Muster jääb avastamata. Patsiendid surevad.
See on andmekaitse ja meditsiinilise progressi tragöödia. See on ummikseis. Kuid see on ummikseis, mille saame matemaatikaga murda.
Föderatiivne õpe: treeningu ümberpööramine
Föderatiivne õpe (FL) pöörab täielikult ümber AI-treeningu standardse paradigma.
Standardne lähenemine (tsentraliseeritud): Koguge kõik andmed kõikidest allikatest kokku hiiglaslikku tsentraalsesse andmejärve. Treening toimub sellel andmejärvel.
Föderatiivne lähenemine (detsentraliseeritud): Jätke andmed sinna, kus nad on. Saatke mudel andmete juurde.
Siin on, kuidas see praktikas samm-sammult töötab:
- Initsialiseerimine: Tsentraalne server (koordinaator) loob "tühja" või eelnevalt treenitud globaalse mudeli.
- Jaotamine: Server saadab selle mudeli koopia igasse 5 haiglasse.
- Kohalik treening: Iga haigla treenib mudelit kohalikult oma privaatsete patsiendiandmete peal. See treening toimub haigla enda turvalistel serveritel, nende tulemüüri taga. Toored patsiendiandmed ei lahku kunagi keldrist.
- Uuenduse genereerimine: Kohalik treeningprotsess toodab "mudeliuuenduse": hulga matemaatilisi kohandusi närvivõrgu kaaludele (sünapsidele). See ütleb sisuliselt: "Et vähki paremini ära tunda, nihuta neuronit #45 üles 0,1 võrra ja neuronit #92 alla 0,05 võrra."
- Agregeerimine: Haigla saadab ainult selle mudeliuuenduse (matemaatika) tagasi tsentraalsele serverile. Ei mingeid patsientide nimesid, röntgenipilte ega vereanalüüsi tulemusi. Ainult ujukomaarvudest koosnev fail.
- Keskmistamine: Tsentraalne server kogub uuendused kõikidest 5 haiglast. Ta keskmistab need kokku (kasutades algoritmi nagu föderatiivne keskmistamine), et luua uus, targem globaalne mudel.
- Kordamine: Uus globaalne mudel saadetakse haiglatesse tagasi ja tsükkel kordub.
Matemaatiline maagia
Selle protsessi maagia seisneb selles, et globaalne mudel muutub targemaks justkui oleks teda treenitud kõikide 5000 patsiendi peal, kuigi ta ei "näinud" kunagi ühtegi neist otseselt. Ta õpib haiguse mustreid (mis on ühised kõikidele haiglatele) ilma patsientide identiteete õppimata (mis on igale haiglale ainulaadsed).
See lahutab õppimisvõime vajadusest näha.
Kaitse sügavuti: SMPC ja diferentsiaalne privaatsus
Paranoilised turvainsenerid (nagu meie Dweve'is) küsivad: "Aga kas te ei saa patsiendiandmeid mudelivärskendusest tagasi konstrueerida?"
See on õigustatud mure. Teoreetiliselt võib pahatahtlik keskne server väga spetsiifilise mudelivärskenduse korral järeldada, et "patsiendil X Berliini haiglas pidi olema seisund Y".
Selle vältimiseks lisab Dweve föderatiivsele õppele kaks täiendavat krüptograafilist tehnoloogiat:
1. Turvaline mitme osapoole arvutus (SMPC)
Tegemist on krüptograafilise protokolliga, mis võimaldab keskse serveril arvutada värskenduste summa ilma kunagi nägemata üksikuid värskendusi.
Kujutage ette, et kolm inimest tahavad arvutada oma keskmist palka, kuid keegi ei taha oma palka teistele avaldada. SMPC võimaldab neil seda teha. Server näeb koondtulemust, kuid ei saa seda matemaatiliselt üksikuteks sisenditeks lahutada. Server ei tea sõna otseses mõttes, milline haigla millise värskenduse saatis.
2. Diferentsiaalne privaatsus (DP)
Nagu meie privaatsuse artiklis arutasime, lisame kohalikele värskendustele statistilist müra enne, kui need haiglast lahkuvad. See "hägustab" üksiku patsiendi panuse, muutes matemaatiliselt tõestatud anonüümsuse võimalikuks.
Mõju reaalses maailmas
Me juurutame seda tehnoloogiat praegu koos Euroopa onkoloogiakeskuste konsortsiumiga. Nad treenivad kasvajate tuvastamise mudelit üle riigipiiride (Saksamaa, Prantsusmaa, Holland), rikkumata ühtegi privaatsusmäärust. Nad lahendavad "Schrems II" andmeedastuse probleemi lihtsalt sellega, et andmeid ei edastata.
See on meditsiiniuuringute tulevik. See avab maailma terviseandmete tohutu, lukustatud väärtuse. See võimaldab meil võidelda haigustega ülemaailmse kollektiivse liigina, austades samal ajal üksikisiku privaatsust.
Me ei pea valima privaatsuse ja tervise vahel. Me ei pea valima üksikisiku ja kollektiivi vahel. Föderatiivse õppimisega saame mõlemad.
Valmis avama oma terviseandmete jõudu ilma patsientide privaatsust ohustamata? Dweve'i föderatiivse õppimise infrastruktuur võimaldab murrangulist meditsiinilist tehisintellekti üle institutsionaalsete piiride, säilitades samal ajal täieliku GDPR-i ja HIPAA vastavuse. Võtke meiega ühendust, et teada saada, kuidas koostööpõhine tehisintellekt saab teie uurimisvõimekust muuta.