Învățare federată în sănătate: tratarea cancerului fără partajarea datelor
Tragedia silozurilor de date
Imaginați-vă cinci mari spitale de cercetare din Europa: la Berlin, Paris, Amsterdam, Milano și Madrid. Fiecare spital are 1.000 de pacienți cu o formă specifică și rară de leucemie pediatrică. Un eșantion de 1.000 de pacienți este prea mic pentru a antrena un model fiabil de Deep Learning care să detecteze boala din timp. Modelul se supraajustează; învață particularitățile specifice ale scanerului din Berlin, nu patologia cancerului.
Totuși, dacă ați putea combina seturile de date, ați avea 5.000 de pacienți: un set de date suficient de mare pentru a antrena un AI de diagnostic revoluționar care ar putea salva mii de vieți.
În lumea veche, acest lucru era imposibil. GDPR în Europa, HIPAA în SUA și reguli stricte de confidențialitate a pacienților interzic cu desăvârșire trimiterea dosarelor medicale brute de la Spitalul A la Spitalul B sau încărcarea lor pe un server cloud central deținut de un gigant tehnologic.
Astfel, datele rămân în silozuri. AI-ul nu este niciodată antrenat. Tiparul rămâne nedescoperit. Pacienții mor.
Aceasta este tragedia confidențialității datelor versus progresul medical. Este un impas. Dar este un impas pe care îl putem depăși cu ajutorul matematicii.
Învățarea federată: inversarea instruirii
Învățarea federată (FL) inversează complet paradigma standard a instruirii AI.
Abordarea standard (centralizată): Adună toate datele din toate sursele într-un lac de date central masiv. Instruiește modelul pe lac.
Abordarea federată (descentralizată): Lasă datele acolo unde sunt. Trimite modelul către date.
Iată cum funcționează în practică, pas cu pas:
- Inițializare: Un server central (coordonatorul) creează un Model Global „gol" sau preinstruit.
- Distribuție: Serverul trimite o copie a acestui model fiecăruia dintre cele 5 spitale.
- Instruire locală: Fiecare spital instruiește modelul local, pe propriile date private ale pacienților. Această instruire are loc pe serverele securizate ale spitalului, în spatele firewall-ului său. Datele brute ale pacienților nu părăsesc niciodată subsolul.
- Generarea actualizării: Procesul de instruire locală produce o „Actualizare a modelului": un set de ajustări matematice ale ponderilor (sinapselor) rețelei neuronale. Spune, în esență: „Pentru a recunoaște mai bine cancerul, ajustează neuronul #45 în sus cu 0,1 și neuronul #92 în jos cu 0,05."
- Agregare: Spitalul trimite doar această Actualizare a modelului (matematica) înapoi la serverul central. Fără nume de pacienți, fără radiografii, fără rezultate ale analizelor de sânge. Doar un fișier cu numere în virgulă mobilă.
- Mediere: Serverul central colectează actualizările de la toate cele 5 spitale. Le mediază împreună (folosind un algoritm precum Federated Averaging) pentru a crea un Model Global nou, mai inteligent.
- Repetare: Noul Model Global este trimis înapoi la spitale, iar ciclul se repetă.
Magia matematică
Magia acestui proces este că Modelul Global devine mai inteligent ca și cum ar fi fost instruit pe toți cei 5.000 de pacienți, chiar dacă nu i-a „văzut" niciodată direct pe niciunul. Învață tiparele bolii (care sunt comune tuturor spitalelor) fără să învețe identitățile pacienților (care sunt unice pentru fiecare spital).
Decuplează capacitatea de a învăța de nevoia de a vedea.
Apărare în profunzime: SMPC și confidențialitate diferențială
Inginerii de securitate paranoici (ca noi, la Dweve) vor întreba: „Dar nu poți reconstitui datele pacientului din actualizarea modelului?"
Este o preocupare validă. Teoretic, dacă o actualizare de model este foarte specifică, un server central rău intenționat ar putea deduce că „pacientul X de la Spitalul Berlin trebuie să fi avut afecțiunea Y".
Pentru a preveni acest lucru, Dweve suprapune două tehnologii criptografice suplimentare peste învățarea federată:
1. Calcul securizat multipartit (SMPC)
Acesta este un protocol criptografic care permite serverului central să calculeze suma actualizărilor fără să vadă vreodată actualizările individuale.
Imaginați-vă trei persoane care vor să își calculeze salariul mediu, dar nimeni nu vrea să își dezvăluie salariul celorlalți. SMPC le permite să facă acest lucru. Serverul vede rezultatul agregat, dar matematic nu îl poate descompune înapoi în intrările individuale. Serverul pur și simplu nu știe care spital a trimis ce actualizare.
2. Confidențialitate diferențială (DP)
După cum am discutat în articolul nostru despre confidențialitate, adăugăm zgomot statistic actualizărilor locale înainte ca acestea să părăsească spitalul. Acest lucru „estompează" contribuția oricărui pacient individual, făcând posibil anonimatul demonstrat matematic.
Impact în lumea reală
Implementăm în prezent această tehnologie cu un consorțiu de centre europene de oncologie. Acestea antrenează un model de detecție a tumorilor peste granițe (Germania, Franța, Țările de Jos) fără a încălca nicio reglementare privind confidențialitatea. Rezolvă problema transferului de date „Schrems II" pur și simplu prin faptul că nu transferă date.
Acesta este viitorul cercetării medicale. Deblochează imensa valoare captivă a datelor medicale mondiale. Ne permite să luptăm împotriva bolilor ca specie globală colectivă, respectând totodată confidențialitatea individului.
Nu trebuie să alegem între confidențialitate și sănătate. Nu trebuie să alegem între individ și colectiv. Cu Învățarea Federată, putem avea ambele.
Sunteți gata să deblocați puterea datelor dumneavoastră medicale fără a compromite confidențialitatea pacienților? Infrastructura de Învățare Federată Dweve permite inteligență artificială medicală de avangardă peste granițele instituționale, menținând în același timp conformitatea deplină cu GDPR și HIPAA. Contactați-ne pentru a afla cum IA colaborativă vă poate transforma capacitățile de cercetare.