Federované učenie v zdravotníctve: liečba rakoviny bez zdieľania dát
Trágédia dátových síl
Predstavte si päť veľkých výskumných nemocníc v Európe: v Berlíne, Paríži, Amsterdame, Miláne a Madride. Každá nemocnica má 1 000 pacientov so špecifickou, zriedkavou formou detskej leukémie. Veľkosť vzorky 1 000 je príliš malá na to, aby sa dal spoľahlivo natrénovať model hlbokého učenia na včasné odhalenie choroby. Model sa preučí; naučí sa špecifické zvláštnosti berlínskeho skenera, nie patológiu rakoviny.
Ak by sa však dali dáta skombinovať, mali by ste 5 000 pacientov: súbor dát dostatočne veľký na to, aby sa dal natrénovať prelomový diagnostický AI, ktorý by mohol zachrániť tisíce životov.
V starom svete to bolo nemožné. GDPR v Európe, HIPAA v USA a prísne pravidlá dôvernosti pacientov prísne zakazujú posielať surové záznamy o pacientoch z nemocnice A do nemocnice B alebo ich nahrávať na centrálny cloudový server vo vlastníctve technologického giganta.
Dáta teda sedia v silách. AI sa nikdy netrénuje. Vzor zostáva neobjavený. Pacienti zomierajú.
Toto je tragédia ochrany osobných údajov verzus medicínskeho pokroku. Je to slepá ulička. Ale je to slepá ulička, ktorú môžeme prelomiť matematikou.
Federované učenie: Obrátenie tréningu
Federované učenie (FL) úplne obracia štandardnú paradigmu trénovania umelej inteligencie.
Štandardný prístup (centralizovaný): Zhromaždite všetky dáta zo všetkých zdrojov do obrovského centrálneho dátového jazera. Trénujte model na tomto jazere.
Federovaný prístup (decentralizovaný): Nechajte dáta tam, kde sú. Pošlite model k dátam.
Takto to funguje v praxi, krok za krokom:
- Inicializácia: Centrálny server (koordinátor) vytvorí „prázdny" alebo predtrénovaný globálny model.
- Distribúcia: Server pošle kópiu tohto modelu každej z 5 nemocníc.
- Lokálne trénovanie: Každá nemocnica trénuje model lokálne na svojich vlastných súkromných údajoch o pacientoch. Toto trénovanie prebieha na vlastných bezpečných serveroch nemocnice, za jej firewallom. Surové údaje o pacientoch nikdy neopustia suterén.
- Generovanie aktualizácie: Lokálny tréningový proces vytvorí „aktualizáciu modelu": súbor matematických úprav váh (synapsií) neurónovej siete. V podstate hovorí: „Aby sme lepšie rozpoznávali rakovinu, posuňte neurón #45 hore o 0,1 a neurón #92 dole o 0,05."
- Agregácia: Nemocnica pošle späť na centrálny server iba túto aktualizáciu modelu (matematiku). Žiadne mená pacientov, žiadne röntgenové snímky, žiadne výsledky krvných testov. Len súbor čísel s pohyblivou desatinnou čiarkou.
- Sprieemerovanie: Centrálny server zhromaždí aktualizácie zo všetkých 5 nemocníc. Spriemeruje ich (pomocou algoritmu, ako je federované spriemerovanie), čím vytvorí nový, múdrejší globálny model.
- Opakovanie: Nový globálny model sa pošle späť do nemocníc a cyklus sa opakuje.
Matematické kúzlo
Kúzlo tohto procesu spočíva v tom, že globálny model je múdrejší akoby bol trénovaný na všetkých 5 000 pacientoch, hoci žiadneho z nich nikdy priamo „nevidel". Naučí sa vzorce choroby (ktoré sú spoločné pre všetky nemocnice) bez toho, aby sa naučil identity pacientov (ktoré sú pre každú nemocnicu jedinečné).
Oddeľuje schopnosť učiť sa od potreby vidieť.
Obrana do hĺbky: SMPC a diferenciálne súkromie
Paranoidní bezpečnostní inžinieri (ako my v Dweve) sa opýtajú: „Ale nemôžete z aktualizácie modelu spätne získať údaje o pacientoch?"
Je to oprávnená obava. Teoreticky, ak je aktualizácia modelu veľmi špecifická, škodlivý centrálny server by mohol odvodiť, že „pacient X v nemocnici v Berlíne musel mať stav Y."
Aby sme tomu zabránili, Dweve vrství na federované učenie dve ďalšie kryptografické technológie:
1. Bezpečný multiparty výpočet (SMPC)
Ide o kryptografický protokol, ktorý centrálnemu serveru umožňuje vypočítať súčet aktualizácií bez toho, aby niekedy videl jednotlivé aktualizácie.
Predstavte si troch ľudí, ktorí chcú vypočítať svoj priemerný plat, ale nikto nechce ostatným prezradiť svoj plat. SMPC im to umožní. Server vidí agregovaný výsledok, ale matematicky ho nedokáže rozložiť späť na jednotlivé vstupy. Server doslova nevie, ktorá nemocnica poslala ktorú aktualizáciu.
2. Diferenciálne súkromie (DP)
Ako sme uviedli v našom článku o súkromí, pridávame do lokálnych aktualizácií štatistický šum ešte predtým, než opustia nemocnicu. Toto „rozmazáva" príspevok každého jednotlivého pacienta, čo umožňuje matematicky dokázanú anonymitu.
Vplyv v reálnom svete
Túto technológiu v súčasnosti nasadzujeme s konzorciom európskych onkologických centier. Trénujú model na detekciu nádorov cez hranice (Nemecko, Francúzsko, Holandsko) bez porušenia jediného nariadenia o ochrane súkromia. Riešia problém prenosu údajov „Schrems II" jednoducho tým, že údaje neprenášajú.
Toto je budúcnosť medicínskeho výskumu. Uvoľňuje obrovskú, uväznenú hodnotu svetových zdravotných údajov. Umožňuje nám bojovať s chorobami ako globálny kolektívny druh, pričom rešpektuje súkromie jednotlivca.
Nemusíme si vyberať medzi súkromím a zdravím. Nemusíme si vyberať medzi jednotlivcom a kolektívom. S federovaným učením môžeme mať oboje.
Ste pripravení odomknúť silu svojich zdravotných údajov bez ohrozenia súkromia pacientov? Infraštruktúra federovaného učenia od Dweve umožňuje prelomovú medicínsku AI naprieč inštitucionálnymi hranicami pri plnom súlade s GDPR a HIPAA. Kontaktujte nás a zistite, ako môže kolaboratívna AI transformovať vaše výskumné možnosti.