Federované učení ve zdravotnictví: Léčba rakoviny bez sdílení dat
Tragédie datových sil
Představte si pět velkých výzkumných nemocnic v Evropě: v Berlíně, Paříži, Amsterdamu, Miláně a Madridu. Každá nemocnice má 1 000 pacientů se specifickou, vzácnou formou dětské leukémie. Velikost vzorku 1 000 je příliš malá na to, aby bylo možné natrénovat spolehlivý model Deep Learning pro včasnou detekci tohoto onemocnění. Model se přeučí; naučí se specifické zvláštnosti berlínského skeneru, nikoli patologii rakoviny.
Pokud byste však mohli datové sady zkombinovat, měli byste 5 000 pacientů: datovou sadu dostatečně velkou na to, aby bylo možné natrénovat převratnou diagnostickou AI, která by mohla zachránit tisíce životů.
Ve starém světě to bylo nemožné. GDPR v Evropě, HIPAA v USA a přísná pravidla ochrany důvěrnosti pacientů přísně zakazují zasílání nezpracovaných záznamů o pacientech z nemocnice A do nemocnice B nebo jejich nahrávání na centrální cloudový server vlastněný technologickým gigantem.
Data tak zůstávají v silech. AI se nikdy netrénuje. Vzorec zůstává neobjevený. Pacienti umírají.
Toto je tragédie ochrany osobních údajů versus lékařský pokrok. Je to slepá ulička. Ale je to slepá ulička, kterou můžeme prolomit pomocí matematiky.
Federované učení: obrácení tréninku
Federované učení (FL) zcela obrací běžné paradigma trénování umělé inteligence.
Standardní přístup (centralizovaný): Shromážděte všechna data ze všech zdrojů do obrovského centrálního datového jezera. Na tomto jezeře model natrénujte.
Federovaný přístup (decentralizovaný): Nechte data tam, kde jsou. Pošlete model k datům.
Takto to v praxi funguje krok za krokem:
- Inicializace: Centrální server (koordinátor) vytvoří „prázdný" nebo předtrénovaný globální model.
- Distribuce: Server pošle kopii tohoto modelu každé z 5 nemocnic.
- Lokální trénink: Každá nemocnice trénuje model lokálně na svých vlastních soukromých datech pacientů. Trénink probíhá na vlastních zabezpečených serverech nemocnice, za jejím firewallem. Surová data pacientů nikdy neopustí suterén.
- Generování aktualizace: Lokální trénink vytvoří „aktualizaci modelu": soubor matematických úprav vah (synapsí) neuronové sítě. V podstatě říká: „Aby model lépe rozpoznával rakovinu, posuň neuron č. 45 o 0,1 nahoru a neuron č. 92 o 0,05 dolů."
- Agregace: Nemocnice pošle centrálnímu serveru zpět pouze tuto aktualizaci modelu (tu matematiku). Žádná jména pacientů, žádné rentgeny, žádné výsledky krevních testů. Jen soubor čísel s plovoucí desetinnou čárkou.
- Průměrování: Centrální server shromáždí aktualizace ze všech 5 nemocnic. Zprůměruje je dohromady (algoritmem, jako je federované průměrování) a vytvoří nový, chytřejší globální model.
- Opakování: Nový globální model se pošle zpět do nemocnic a cyklus se opakuje.
Matematická magie
Kouzlo tohoto procesu spočívá v tom, že globální model je chytřejší, jako by byl trénován na všech 5 000 pacientech, i když žádného z nich přímo nikdy „neviděl". Naučí se vzorce nemoci (které jsou společné všem nemocnicím), aniž by se naučil identity pacientů (které jsou pro každou nemocnici jedinečné).
Odděluje schopnost učit se od potřeby vidět.
Obrana do hloubky: SMPC a diferenciální soukromí
Paranoidní bezpečnostní inženýři (jako my ve Dweve) se zeptají: „Ale nemůžete z aktualizace modelu zpětně odvodit data pacientů?"
Je to oprávněná obava. Teoreticky, pokud je aktualizace modelu velmi specifická, mohl by škodlivý centrální server usoudit, že „pacient X v berlínské nemocnici musel mít stav Y."
Aby tomu Dweve zabránil, přidává na federované učení dvě další kryptografické technologie:
1. Zabezpečený multiparty výpočet (SMPC)
Jde o kryptografický protokol, který centrálnímu serveru umožňuje vypočítat součet aktualizací, aniž by kdy viděl jednotlivé aktualizace.
Představte si tři lidi, kteří chtějí vypočítat svůj průměrný plat, ale nikdo nechce ostatním prozradit svůj vlastní. SMPC jim to umožní. Server vidí agregovaný výsledek, ale matematicky ho nedokáže rozložit zpět na jednotlivé vstupy. Server doslova neví, která nemocnice poslala kterou aktualizaci.
2. Diferenciální soukromí (DP)
Jak jsme probrali v našem článku o soukromí, přidáváme do lokálních aktualizací statistický šum ještě předtím, než opustí nemocnici. Tím se „rozmaže" příspěvek každého jednotlivého pacienta, což umožňuje matematicky prokázanou anonymitu.
Dopad v reálném světě
Tuto technologii v současnosti nasazujeme s konsorciem evropských onkologických center. Trénují model pro detekci nádorů napříč hranicemi (Německo, Francie, Nizozemsko), aniž by porušili jediný předpis o ochraně soukromí. Řeší problém přenosu dat „Schrems II" tím, že data jednoduše nepřenášejí.
Toto je budoucnost lékařského výzkumu. Uvolňuje obrovskou, uvězněnou hodnotu světových zdravotních dat. Umožňuje nám bojovat s nemocemi jako globální kolektivní druh, při respektování soukromí jednotlivce.
Nemusíme si vybírat mezi soukromím a zdravím. Nemusíme si vybírat mezi jednotlivcem a kolektivem. S federovaným učením můžeme mít obojí.
Jste připraveni uvolnit sílu svých zdravotních dat, aniž byste ohrozili soukromí pacientů? Infrastruktura federovaného učení společnosti Dweve umožňuje převratnou lékařskou AI napříč institucionálními hranicemi při plném dodržování předpisů GDPR a HIPAA. Kontaktujte nás a zjistěte, jak může kolaborativní AI transformovat vaše výzkumné schopnosti.