Federated Learning terveydenhuollossa: Syövän parantaminen jakamatta tietoja

Näin federated learning ratkaisee sairaaloiden tiedonjakolukon.

Federated Learning terveydenhuollossa: Syövän parantaminen jakamatta tietoja

Datasilojen tragedia

Kuvittele, että Euroopassa on viisi suurta tutkimussairaalaa: Berliinissä, Pariisissa, Amsterdamissa, Milanossa ja Madridissa. Jokaisessa sairaalassa on 1 000 potilasta, joilla on tietty harvinainen lastenleukemian muoto. Otoskoko 1 000 on liian pieni luotettavan syväoppimismallin kouluttamiseen taudin varhaista havaitsemista varten. Malli ylisovittuu; se oppii Berliinin skannerin erityispiirteet syövän patologian sijaan.

Jos tietoaineistot voitaisiin kuitenkin yhdistää, potilaita olisi 5 000: riittävän suuri aineisto läpimurtoa tekevän diagnostiikka-AI:n kouluttamiseen, joka voisi pelastaa tuhansia ihmishenkiä.

Vanhassa maailmassa tämä oli mahdotonta. Euroopan GDPR, Yhdysvaltojen HIPAA ja tiukat potilastietojen salassapitosäännöt kieltävät ehdottomasti raakojen potilastietojen lähettämisen sairaalasta A sairaalaan B tai niiden lataamisen teknologiayrityksen omistamalle keskitetylle pilvipalvelimelle.

Niinpä tiedot jäävät siloihin. AI:ta ei koskaan kouluteta. Kuvio jää löytymättä. Potilaat kuolevat.

Tämä on tietosuojan ja lääketieteen edistyksen välinen tragedia. Se on umpikuja. Mutta se on umpikuja, jonka voimme murtaa matematiikalla.

Perinteinen tekoälyn koulutus vs. hajautettu oppiminenPerinteinen (keskitetty)Sairaala ASairaala BSairaala CKeskitetty pilviPotilastiedot lähetetty ✗Hajautettu oppiminenSairaala ASairaala BSairaala CKoordinaattoriVain mallipäivitykset lähetetty ✓Hajautetun oppimisen prosessi1. JaaMalli → Sairaalat2. Kouluta paikallisestiTiedot pysyvät paikalla3. Lähetä päivityksetVain matematiikka, ei tietoja4. YhdistäKeskiarvo → GlobaaliPotilastiedot eivät KOSKAAN poistu sairaalasta. Vain matemaattiset päivitykset jaetaan.
Vika ei ole siinä, että sairaalat suojaavat potilaitaan. Vika on siinä, että vanha koulutusmalli edellyttää jaettua tietokantaa ennen kuin malli voi oppia.

Liittoutunut oppiminen: koulutuksen käänteinen asetelma

Liittoutunut oppiminen (FL) kääntää täysin nurin tekoälyn koulutuksen vakiintuneen paradigman.

Perinteinen lähestymistapa (keskitetty): Kerää kaikki data kaikista lähteistä valtavaan keskusmuodostelmaan. Kouluta malli tässä tietojärvessä.

Liittoutunut lähestymistapa (hajautettu): Jätä data paikoilleen. Lähetä malli datan luo.

Näin se toimii käytännössä vaihe vaiheelta:

  1. Alustus: Keskuspalvelin (koordinaattori) luo "tyhjän" tai esikoulutetun globaalin mallin.
  2. Jakelu: Palvelin lähettää kopion tästä mallista kullekin viidestä sairaalasta.
  3. Paikallinen koulutus: Kukin sairaala kouluttaa mallia paikallisesti omalla yksityisellä potilasdatallaan. Koulutus tapahtuu sairaalan omilla suojatuilla palvelimilla niiden palomuurin takana. Raaka potilasdata ei koskaan poistu kellarista.
  4. Päivityksen tuottaminen: Paikallinen koulutusprosessi tuottaa "mallipäivityksen": joukon matemaattisia säätöjä neuroverkon painoihin (synapseihin). Se kertoo käytännössä: "Jotta syöpä tunnistettaisiin paremmin, nosta neuronia #45 0,1:llä ja laske neuronia #92 0,05:llä."
  5. Aggregointi: Sairaala lähettää vain tämän mallipäivityksen (matematiikan) takaisin keskuspalvelimelle. Ei potilaan nimiä, ei röntgenkuvia, ei verikokeiden tuloksia. Vain tiedosto liukulukuja.
  6. Keskiarvoistaminen: Keskuspalvelin kerää päivitykset kaikilta viideltä sairaalalta. Se laskee niistä keskiarvon (käyttäen esimerkiksi Federated Averaging -algoritmia) ja luo uuden, älykkäämmän globaalin mallin.
  7. Toisto: Uusi globaali malli lähetetään takaisin sairaaloille, ja sykli toistuu.
Liittoutunut oppiminen kääntää vaarallisen liikkeen toisinpäin: laskenta ylittää organisaatiorajat, kun potilastiedot pysyvät palomuurin takana.

Matemaattinen taika

Tämän prosessin taika on siinä, että globaali malli tulee älykkäämmäksi ikään kuin se olisi koulutettu kaikilla 5 000 potilaalla, vaikka se ei koskaan varsinaisesti "nähnyt" yhtäkään heistä suoraan. Se oppii taudin piirteet (jotka ovat yhteisiä kaikille sairaaloille) oppimatta potilaiden henkilöllisyyksiä (jotka ovat ainutlaatuisia kullekin sairaalalle).

Se erottaa oppimisen kyvyn näkemisen tarpeesta.

Dweven puolustus syvyydessä: yksityisyyden kerroksetKerros 1: Federated LearningData ei koskaan poistu sairaalasta. Vain mallipäivitykset lähetetään.Ratkaisee: tiedonsiirtorajoitukset, GDPR-vaatimukset, laitosten suvereniteettiKerros 2: Suojattu monen osapuolen laskenta (SMPC)Palvelin laskee kokonaissumman näkemättä yksittäisiä sairaalapäivityksiä.Ratkaisee: haitalliset koordinaattorihyökkäykset, päivityksiin kohdistuvat päättelyhyökkäyksetKerros 3: Differentiaalinen yksityisyys (DP)Päivityksiin lisätään tilastollista kohinaa, mikä rajaa yksityisyyden menetyksen matemaattisesti.Ratkaisee: uudelleentunnistamisen kaavoista, jäsenyyspäättelyhyökkäyksetTulos: matemaattisesti todistetut yksityisyystakuut (ε-differentiaalinen yksityisyys)

Puolustus syvyydessä: SMPC ja differentiaalinen yksityisyys

Paranoidit tietoturvainsinöörit (kuten me Dwevella) kysyvät: "Eikö potilastietoja voi käänteismallintaa mallipäivityksestä?"

Se on aiheellinen huoli. Teoriassa, jos mallipäivitys on hyvin yksityiskohtainen, haitallinen keskuspalvelin saattaa pystyä päättelemään, että "potilaalla X Berliinin sairaalassa on täytynyt olla sairaus Y."

Tämän estämiseksi Dweve lisää Federated Learningin päälle kaksi kryptografista teknologiaa:

1. Suojattu monen osapuolen laskenta (SMPC)

Tämä on kryptografinen protokolla, jonka avulla keskuspalvelin voi laskea päivitysten summan näkemättä koskaan yksittäisiä päivityksiä.

Kuvittele, että kolme henkilöä haluavat laskea keskipalkkansa, mutta kukaan ei halua paljastaa palkkaansa muille. SMPC mahdollistaa tämän. Palvelin näkee kokonaistuloksen, mutta ei voi matemaattisesti hajottaa sitä takaisin yksittäisiksi syötteiksi. Palvelin ei kirjaimellisesti tiedä, mikä sairaala lähetti minkäkin päivityksen.

2. Differentiaalinen yksityisyys (DP)

Kuten yksityisyysartikkelissamme käsiteltiin, lisäämme tilastollista kohinaa paikallisiin päivityksiin ennen kuin ne lähtevät sairaalasta. Tämä "sumentaa" yksittäisen potilaan vaikutuksen, mikä mahdollistaa matemaattisesti todistetun anonymiteetin.

Koordinaattorin tulisi nähdä mallin kokonaissuunta, ei sitä, mikä sairaala tai potilas sen sinne työnsi.

Vaikutus käytännössä

Otamme tätä teknologiaa parhaillaan käyttöön eurooppalaisten onkologiakeskusten konsortion kanssa. Ne kouluttavat kasvainten tunnistusmallia yli rajojen (Saksa, Ranska, Alankomaat) rikkomatta yhtäkään tietosuoja-asetusta. Ne ratkaisevat "Schrems II" -tiedonsiirto-ongelman yksinkertaisesti olemalla siirtämättä tietoja.

Tämä on lääketieteellisen tutkimuksen tulevaisuus. Se avaa valtavan, lukitun arvon, joka maailman terveysdatoissa piilee. Se antaa meille mahdollisuuden taistella sairauksia vastaan globaalina kollektiivisena lajina samalla kun kunnioitamme yksilön yksityisyyttä.

Meidän ei tarvitse valita yksityisyyden ja terveyden välillä. Meidän ei tarvitse valita yksilön ja kollektiivin välillä. Federated Learningin avulla voimme saada molemmat.

Valmiina avaamaan terveysdatanne voiman tinkimättä potilaiden yksityisyydestä? Dweven Federated Learning -infrastruktuuri mahdollistaa läpimurtoja tekevän lääketieteellisen tekoälyn yli organisaatiorajojen ja täyttää samalla sekä GDPR- että HIPAA-vaatimukset. Ota yhteyttä ja opi, miten yhteistyöpohjainen tekoäly voi muuttaa tutkimusvalmiuksianne.

Käytännön voitto on kliininen yhteistyö pienemmän vaatimustenmukaisuustavoitteen kanssa: jaettua oppimista, ei jaettuja raakatietoja.