Federované učenie v zdravotníctve: liečba rakoviny bez zdieľania dát

Federované učenie: ako nemocnice liečia choroby bez zdieľania dát

Federované učenie v zdravotníctve: liečba rakoviny bez zdieľania dát

Trágédia dátových síl

Predstavte si päť veľkých výskumných nemocníc v Európe: v Berlíne, Paríži, Amsterdame, Miláne a Madride. Každá nemocnica má 1 000 pacientov so špecifickou, zriedkavou formou detskej leukémie. Veľkosť vzorky 1 000 je príliš malá na to, aby sa dal spoľahlivo natrénovať model hlbokého učenia na včasné odhalenie choroby. Model sa preučí; naučí sa špecifické zvláštnosti berlínskeho skenera, nie patológiu rakoviny.

Ak by sa však dali dáta skombinovať, mali by ste 5 000 pacientov: súbor dát dostatočne veľký na to, aby sa dal natrénovať prelomový diagnostický AI, ktorý by mohol zachrániť tisíce životov.

V starom svete to bolo nemožné. GDPR v Európe, HIPAA v USA a prísne pravidlá dôvernosti pacientov prísne zakazujú posielať surové záznamy o pacientoch z nemocnice A do nemocnice B alebo ich nahrávať na centrálny cloudový server vo vlastníctve technologického giganta.

Dáta teda sedia v silách. AI sa nikdy netrénuje. Vzor zostáva neobjavený. Pacienti zomierajú.

Toto je tragédia ochrany osobných údajov verzus medicínskeho pokroku. Je to slepá ulička. Ale je to slepá ulička, ktorú môžeme prelomiť matematikou.

Tradičný tréning AI vs. federované učenieTradičný (centralizovaný)Nemocnica ANemocnica BNemocnica CCentrálny cloudNahrávanie údajov pacientov ✗Federované učenieNemocnica ANemocnica BNemocnica CKoordinátorPosielajú sa len aktualizácie modelu ✓Proces federovaného učenia1. DistribúciaModel → nemocnice2. Lokálny tréningÚdaje zostávajú na mieste3. Posielanie aktualizáciíLen matematika, žiadne údaje4. AgregáciaPriemer → globálnyÚdaje pacientov NIKDY neopúšťajú nemocnicu. Zdieľajú sa len matematické aktualizácie.
Tragédia nie je v tom, že nemocnice chránia pacientov. Je v tom, že starý spôsob trénovania vyžaduje zdieľanú databázu, kým sa model vôbec môže učiť.

Federované učenie: Obrátenie tréningu

Federované učenie (FL) úplne obracia štandardnú paradigmu trénovania umelej inteligencie.

Štandardný prístup (centralizovaný): Zhromaždite všetky dáta zo všetkých zdrojov do obrovského centrálneho dátového jazera. Trénujte model na tomto jazere.

Federovaný prístup (decentralizovaný): Nechajte dáta tam, kde sú. Pošlite model k dátam.

Takto to funguje v praxi, krok za krokom:

  1. Inicializácia: Centrálny server (koordinátor) vytvorí „prázdny" alebo predtrénovaný globálny model.
  2. Distribúcia: Server pošle kópiu tohto modelu každej z 5 nemocníc.
  3. Lokálne trénovanie: Každá nemocnica trénuje model lokálne na svojich vlastných súkromných údajoch o pacientoch. Toto trénovanie prebieha na vlastných bezpečných serveroch nemocnice, za jej firewallom. Surové údaje o pacientoch nikdy neopustia suterén.
  4. Generovanie aktualizácie: Lokálny tréningový proces vytvorí „aktualizáciu modelu": súbor matematických úprav váh (synapsií) neurónovej siete. V podstate hovorí: „Aby sme lepšie rozpoznávali rakovinu, posuňte neurón #45 hore o 0,1 a neurón #92 dole o 0,05."
  5. Agregácia: Nemocnica pošle späť na centrálny server iba túto aktualizáciu modelu (matematiku). Žiadne mená pacientov, žiadne röntgenové snímky, žiadne výsledky krvných testov. Len súbor čísel s pohyblivou desatinnou čiarkou.
  6. Sprieemerovanie: Centrálny server zhromaždí aktualizácie zo všetkých 5 nemocníc. Spriemeruje ich (pomocou algoritmu, ako je federované spriemerovanie), čím vytvorí nový, múdrejší globálny model.
  7. Opakovanie: Nový globálny model sa pošle späť do nemocníc a cyklus sa opakuje.
Federované učenie obracia nebezpečný pohyb: výpočty prekračujú inštitucionálne hranice, zatiaľ čo záznamy o pacientoch zostávajú za firewallom.

Matematické kúzlo

Kúzlo tohto procesu spočíva v tom, že globálny model je múdrejší akoby bol trénovaný na všetkých 5 000 pacientoch, hoci žiadneho z nich nikdy priamo „nevidel". Naučí sa vzorce choroby (ktoré sú spoločné pre všetky nemocnice) bez toho, aby sa naučil identity pacientov (ktoré sú pre každú nemocnicu jedinečné).

Oddeľuje schopnosť učiť sa od potreby vidieť.

Obrana Dweve do hĺbky: Vrstvy súkromiaVrstva 1: Federované učenieDáta nikdy neopustia nemocnicu. Prenášajú sa len aktualizácie modelu.Rieši: Obmedzenia prenosu dát, súlad s GDPR, inštitucionálnu suverenituVrstva 2: Bezpečný multiparty výpočet (SMPC)Server počíta agregát bez toho, aby videl jednotlivé aktualizácie nemocníc.Rieši: Útoky škodlivého koordinátora, inferenčné útoky na aktualizácieVrstva 3: Diferenciálne súkromie (DP)K aktualizáciám sa pridáva štatistický šum, ktorý matematicky ohraničuje stratu súkromia.Rieši: Re-identifikáciu zo vzorov, inferenčné útoky na členstvoVýsledok: Matematicky dokázané záruky súkromia (ε-diferenciálne súkromie)

Obrana do hĺbky: SMPC a diferenciálne súkromie

Paranoidní bezpečnostní inžinieri (ako my v Dweve) sa opýtajú: „Ale nemôžete z aktualizácie modelu spätne získať údaje o pacientoch?"

Je to oprávnená obava. Teoreticky, ak je aktualizácia modelu veľmi špecifická, škodlivý centrálny server by mohol odvodiť, že „pacient X v nemocnici v Berlíne musel mať stav Y."

Aby sme tomu zabránili, Dweve vrství na federované učenie dve ďalšie kryptografické technológie:

1. Bezpečný multiparty výpočet (SMPC)

Ide o kryptografický protokol, ktorý centrálnemu serveru umožňuje vypočítať súčet aktualizácií bez toho, aby niekedy videl jednotlivé aktualizácie.

Predstavte si troch ľudí, ktorí chcú vypočítať svoj priemerný plat, ale nikto nechce ostatným prezradiť svoj plat. SMPC im to umožní. Server vidí agregovaný výsledok, ale matematicky ho nedokáže rozložiť späť na jednotlivé vstupy. Server doslova nevie, ktorá nemocnica poslala ktorú aktualizáciu.

2. Diferenciálne súkromie (DP)

Ako sme uviedli v našom článku o súkromí, pridávame do lokálnych aktualizácií štatistický šum ešte predtým, než opustia nemocnicu. Toto „rozmazáva" príspevok každého jednotlivého pacienta, čo umožňuje matematicky dokázanú anonymitu.

Koordinátor by sa mal dozvedieť smer pohybu modelu ako celku, nie to, ktorá nemocnica alebo pacient ho tam posunul.

Vplyv v reálnom svete

Túto technológiu v súčasnosti nasadzujeme s konzorciom európskych onkologických centier. Trénujú model na detekciu nádorov cez hranice (Nemecko, Francúzsko, Holandsko) bez porušenia jediného nariadenia o ochrane súkromia. Riešia problém prenosu údajov „Schrems II" jednoducho tým, že údaje neprenášajú.

Toto je budúcnosť medicínskeho výskumu. Uvoľňuje obrovskú, uväznenú hodnotu svetových zdravotných údajov. Umožňuje nám bojovať s chorobami ako globálny kolektívny druh, pričom rešpektuje súkromie jednotlivca.

Nemusíme si vyberať medzi súkromím a zdravím. Nemusíme si vyberať medzi jednotlivcom a kolektívom. S federovaným učením môžeme mať oboje.

Ste pripravení odomknúť silu svojich zdravotných údajov bez ohrozenia súkromia pacientov? Infraštruktúra federovaného učenia od Dweve umožňuje prelomovú medicínsku AI naprieč inštitucionálnymi hranicami pri plnom súlade s GDPR a HIPAA. Kontaktujte nás a zistite, ako môže kolaboratívna AI transformovať vaše výskumné možnosti.

Praktickým prínosom je klinická spolupráca s menším cieľom zhody: zdieľané učenie, nie zdieľané surové záznamy.