Föderatiivne õpe tervishoius: vähiravi ilma andmeid jagamata

Haiglatel on andmed haiguste ravimiseks, kuid privaatsusseadused takistavad nende jagamist. Föderatiivne õpe lahendab ummiku. Siin on, kuidas see töötab.

Föderatiivne õpe tervishoius: vähiravi ilma andmeid jagamata

Andmesilode tragöödia

Kujutage ette, et Euroopas on viis suurt teadushaiglat: Berliinis, Pariisis, Amsterdamis, Milanos ja Madridis. Igas haiglas on 1 000 patsienti, kellel on haruldane laste leukeemia vorm. Valimi suurus 1 000 on liiga väike, et treenida usaldusväärset süvaõppe mudelit, mis tuvastaks haiguse varakult. Mudel kohandub üle; see õpib selgeks Berliini skanneri eripärad, mitte vähi patoloogia.

Kui aga saaksite andmestikud ühendada, oleks teil 5 000 patsienti: piisavalt suur andmestik, et treenida läbimurdelist diagnostilist tehisintellekti, mis võiks päästa tuhandeid elusid.

Vanasti oli see võimatu. GDPR Euroopas, HIPAA Ameerika Ühendriikides ja ranged patsiendi konfidentsiaalsuse reeglid keelavad rangelt saata toorpatsiendiandmeid haiglast A haiglasse B või laadida need üles tsentraalsesse pilveserverisse, mis kuulub tehnoloogiahiiglasele.

Nii jäävad andmed silodesse. Tehisintellekti ei treenita kunagi. Muster jääb avastamata. Patsiendid surevad.

See on andmekaitse ja meditsiinilise progressi tragöödia. See on ummikseis. Kuid see on ummikseis, mille saame matemaatikaga murda.

Traditsiooniline AI-treening vs. föderatiivne õpeTraditsiooniline (tsentraliseeritud)Haigla AHaigla BHaigla CKeskne pilvPatsiendiandmed üles laaditud ✗Föderatiivne õpeHaigla AHaigla BHaigla CKoordinaatorSaadetakse ainult mudeliuuendused ✓Föderatiivse õppe protsess1. JagamineMudel → haiglad2. Kohalik treeningAndmed jäävad kohale3. Uuenduste saatmineAinult matemaatika, mitte andmed4. KoondamineKeskmine → globaalnePatsiendiandmed EI lahku kunagi haiglast. Jagatakse ainult matemaatilisi uuendusi.
Tragöödia ei seisne selles, et haiglad kaitsevad patsiente. See seisneb selles, et vana treeningmuster nõuab ühist andmebaasi enne, kui mudel saab õppida.

Föderatiivne õpe: treeningu ümberpööramine

Föderatiivne õpe (FL) pöörab täielikult ümber AI-treeningu standardse paradigma.

Standardne lähenemine (tsentraliseeritud): Koguge kõik andmed kõikidest allikatest kokku hiiglaslikku tsentraalsesse andmejärve. Treening toimub sellel andmejärvel.

Föderatiivne lähenemine (detsentraliseeritud): Jätke andmed sinna, kus nad on. Saatke mudel andmete juurde.

Siin on, kuidas see praktikas samm-sammult töötab:

  1. Initsialiseerimine: Tsentraalne server (koordinaator) loob "tühja" või eelnevalt treenitud globaalse mudeli.
  2. Jaotamine: Server saadab selle mudeli koopia igasse 5 haiglasse.
  3. Kohalik treening: Iga haigla treenib mudelit kohalikult oma privaatsete patsiendiandmete peal. See treening toimub haigla enda turvalistel serveritel, nende tulemüüri taga. Toored patsiendiandmed ei lahku kunagi keldrist.
  4. Uuenduse genereerimine: Kohalik treeningprotsess toodab "mudeliuuenduse": hulga matemaatilisi kohandusi närvivõrgu kaaludele (sünapsidele). See ütleb sisuliselt: "Et vähki paremini ära tunda, nihuta neuronit #45 üles 0,1 võrra ja neuronit #92 alla 0,05 võrra."
  5. Agregeerimine: Haigla saadab ainult selle mudeliuuenduse (matemaatika) tagasi tsentraalsele serverile. Ei mingeid patsientide nimesid, röntgenipilte ega vereanalüüsi tulemusi. Ainult ujukomaarvudest koosnev fail.
  6. Keskmistamine: Tsentraalne server kogub uuendused kõikidest 5 haiglast. Ta keskmistab need kokku (kasutades algoritmi nagu föderatiivne keskmistamine), et luua uus, targem globaalne mudel.
  7. Kordamine: Uus globaalne mudel saadetakse haiglatesse tagasi ja tsükkel kordub.
Föderatiivne õpe pöörab ohtliku liikumise ümber: arvutamine ületab asutuste piire, samal ajal kui patsiendiandmed jäävad tulemüüri taha.

Matemaatiline maagia

Selle protsessi maagia seisneb selles, et globaalne mudel muutub targemaks justkui oleks teda treenitud kõikide 5000 patsiendi peal, kuigi ta ei "näinud" kunagi ühtegi neist otseselt. Ta õpib haiguse mustreid (mis on ühised kõikidele haiglatele) ilma patsientide identiteete õppimata (mis on igale haiglale ainulaadsed).

See lahutab õppimisvõime vajadusest näha.

Dweve'i kaitse sügavuti: privaatsuse kihidKiht 1: föderatiivne õpeAndmed ei lahku kunagi haiglast. Edastatakse ainult mudelivärskendused.Lahendab: andmeedastuse piirangud, GDPR-i nõuete täitmine, institutsionaalne suveräänsusKiht 2: turvaline mitme osapoole arvutus (SMPC)Server arvutab koondtulemuse ilma üksikuid haiglavärskendusi nägemata.Lahendab: pahatahtliku koordinaatori ründed, järeldusründed värskenduste põhjalKiht 3: diferentsiaalne privaatsus (DP)Värskendustele lisatakse statistiline müra, mis piirab privaatsuskadu matemaatiliselt.Lahendab: mustrite põhjal uuesti tuvastamise, liikmelisuse järeldusründedTulemus: matemaatiliselt tõestatud privaatsusgarantiid (ε-diferentsiaalne privaatsus)

Kaitse sügavuti: SMPC ja diferentsiaalne privaatsus

Paranoilised turvainsenerid (nagu meie Dweve'is) küsivad: "Aga kas te ei saa patsiendiandmeid mudelivärskendusest tagasi konstrueerida?"

See on õigustatud mure. Teoreetiliselt võib pahatahtlik keskne server väga spetsiifilise mudelivärskenduse korral järeldada, et "patsiendil X Berliini haiglas pidi olema seisund Y".

Selle vältimiseks lisab Dweve föderatiivsele õppele kaks täiendavat krüptograafilist tehnoloogiat:

1. Turvaline mitme osapoole arvutus (SMPC)

Tegemist on krüptograafilise protokolliga, mis võimaldab keskse serveril arvutada värskenduste summa ilma kunagi nägemata üksikuid värskendusi.

Kujutage ette, et kolm inimest tahavad arvutada oma keskmist palka, kuid keegi ei taha oma palka teistele avaldada. SMPC võimaldab neil seda teha. Server näeb koondtulemust, kuid ei saa seda matemaatiliselt üksikuteks sisenditeks lahutada. Server ei tea sõna otseses mõttes, milline haigla millise värskenduse saatis.

2. Diferentsiaalne privaatsus (DP)

Nagu meie privaatsuse artiklis arutasime, lisame kohalikele värskendustele statistilist müra enne, kui need haiglast lahkuvad. See "hägustab" üksiku patsiendi panuse, muutes matemaatiliselt tõestatud anonüümsuse võimalikuks.

Koordinaator peaks õppima mudeli üldise suuna, mitte seda, milline haigla või patsient selle sinna suunas.

Mõju reaalses maailmas

Me juurutame seda tehnoloogiat praegu koos Euroopa onkoloogiakeskuste konsortsiumiga. Nad treenivad kasvajate tuvastamise mudelit üle riigipiiride (Saksamaa, Prantsusmaa, Holland), rikkumata ühtegi privaatsusmäärust. Nad lahendavad "Schrems II" andmeedastuse probleemi lihtsalt sellega, et andmeid ei edastata.

See on meditsiiniuuringute tulevik. See avab maailma terviseandmete tohutu, lukustatud väärtuse. See võimaldab meil võidelda haigustega ülemaailmse kollektiivse liigina, austades samal ajal üksikisiku privaatsust.

Me ei pea valima privaatsuse ja tervise vahel. Me ei pea valima üksikisiku ja kollektiivi vahel. Föderatiivse õppimisega saame mõlemad.

Valmis avama oma terviseandmete jõudu ilma patsientide privaatsust ohustamata? Dweve'i föderatiivse õppimise infrastruktuur võimaldab murrangulist meditsiinilist tehisintellekti üle institutsionaalsete piiride, säilitades samal ajal täieliku GDPR-i ja HIPAA vastavuse. Võtke meiega ühendust, et teada saada, kuidas koostööpõhine tehisintellekt saab teie uurimisvõimekust muuta.

Praktiline võit on kliiniline koostöö väiksema vastavuseesmärgiga: jagatud õppimine, mitte jagatud toorandmed.