Szövetségi tanulás az egészségügyben: rákgyógyítás adatmegosztás nélkül
Az adatsilók tragédiája
Képzeljük el, hogy öt nagy európai kutatókórház van: Berlinben, Párizsban, Amszterdamban, Milánóban és Madridban. Mindegyik kórházban 1 000 olyan beteg van, akik a gyermekkori leukémia egy ritka formájában szenvednek. Az 1 000 fős minta túl kicsi ahhoz, hogy megbízható Deep Learning modellt lehessen betanítani a betegség korai felismerésére. A modell túltanul; a rák patológiája helyett a berlini szkenner sajátosságait tanulja meg.
Ha azonban össze lehetne vonni az adathalmazokat, 5 000 betegünk lenne: ez már elég nagy adathalmaz egy áttörést jelentő diagnosztikai MI betanításához, amely emberek ezreinek életét menthetné meg.
A régi világban ez lehetetlen volt. Az európai GDPR, az amerikai HIPAA és a szigorú betegtitokra vonatkozó szabályok szigorúan tiltják, hogy a nyers betegadatokat az A kórházból a B kórházba továbbítsák, vagy feltöltsék egy technológiai óriás által üzemeltetett központi felhőszerverre.
Így az adatok silókban maradnak. Az MI-t soha nem tanítják be. A minta felfedezetlen marad. A betegek meghalnak.
Ez az adatvédelem és az orvosi fejlődés közötti tragédia. Ez egy patthelyzet. De ez egy olyan patthelyzet, amelyet matematikával meg tudunk törni.
Szövetséges tanulás: a tanítás megfordítása
A szövetséges tanulás (FL) teljesen megfordítja a mesterséges intelligencia tanításának szokásos paradigmáját.
A szokásos megközelítés (központosított): Gyűjtsd össze az összes adatot minden forrásból egy hatalmas központi adatóceánba. Tanítsd a modellt az óceánon.
A szövetséges megközelítés (szétszórt): Hagyd az adatot ott, ahol van. Küldd a modellt az adathoz.
Így működik a gyakorlatban, lépésről lépésre:
- Inicializálás: Egy központi szerver (a koordinátor) létrehoz egy "üres" vagy előre betanított globális modellt.
- Terjesztés: A szerver elküldi a modell egy példányát mind az 5 kórháznak.
- Helyi tanítás: Minden kórház a saját, privát betegadatain tanítja a modellt helyben. Ez a tanítás a kórház saját, biztonságos szerverein történik, a tűzfal mögött. A nyers betegadat soha nem hagyja el az alagsort.
- Frissítés létrehozása: A helyi tanítási folyamat egy "modellfrissítést" hoz létre: a neurális hálózat súlyainak (szinapszisainak) matematikai módosításainak egy halmazát. Lényegében ezt mondja: "Ahhoz, hogy jobban felismerje a rákot, told meg a 45-ös neuront 0,1-gyel, és csökkentsd a 92-es neuront 0,05-tel."
- Összesítés: A kórház csak ezt a modellfrissítést (a matematikát) küldi vissza a központi szervernek. Nincs betegnév, nincs röntgen, nincs vérvizsgálati eredmény. Csak egy fájl lebegőpontos számokkal.
- Átlagolás: A központi szerver összegyűjti az összes 5 kórház frissítését. Átlagolja őket (például a szövetséges átlagolás algoritmusával), hogy létrehozzon egy új, okosabb globális modellt.
- Ismétlés: Az új globális modellt visszaküldik a kórházaknak, és a ciklus megismétlődik.
A matematikai varázslat
A folyamat varázslata az, hogy a globális modell okosabb lesz, mintha mind az 5 000 betegen tanították volna, még akkor is, ha valójában soha nem "látta" egyiket sem közvetlenül. Megtanulja a betegség mintázatait (amelyek minden kórházban közösek) anélkül, hogy megtanulná a betegek személyazonosságát (amelyek minden kórházban egyediek).
Szétválasztja a tanulás képességét a látás szükségességétől.
Többrétegű védelem: SMPC és differenciált adatvédelem
A paranoid biztonsági mérnökök (mint mi a Dweve-nél) megkérdezik: „De hát nem lehet visszafejteni a páciensadatokat a modellfrissítésből?”
Jogos aggály. Elméletileg, ha egy modellfrissítés nagyon specifikus, egy rosszindulatú központi szerver következtethet arra, hogy „a berlini kórház X betegének bizonyosan Y betegsége volt”.
Ennek megelőzésére a Dweve két további kriptográfiai technológiát rétegez a szövetséges tanulásra:
1. Biztonságos többoldalú számítás (SMPC)
Ez egy kriptográfiai protokoll, amely lehetővé teszi a központi szerver számára, hogy kiszámítsa a frissítések összegét anélkül, hogy valaha is látná az egyes frissítéseket.
Képzeljük el, hogy három ember ki akarja számolni az átlagfizetését, de senki sem akarja felfedni a fizetését a többiek előtt. Az SMPC ezt lehetővé teszi számukra. A szerver látja az összesített eredményt, de matematikailag képtelen azt visszabontani az egyes bemenetekre. A szerver szó szerint nem tudja, melyik kórház küldte melyik frissítést.
2. Differenciált adatvédelem (DP)
Ahogyan az adatvédelmi cikkünkben is tárgyaltuk, statisztikai zajt adunk a helyi frissítésekhez, mielőtt azok elhagyják a kórházat. Ez „elmosja” bármely egyes páciens hozzájárulását, matematikailag igazolt anonimitást téve lehetővé.
Valós hatás
Jelenleg ezt a technológiát európai onkológiai központok konzorciumával telepítjük. Határokon átnyúlóan (Németország, Franciaország, Hollandia) tanítanak daganatfelismerő modellt anélkül, hogy bármely adatvédelmi szabályozást megsértenének. A „Schrems II" adattovábbítási problémát azzal oldják meg, hogy egyszerűen nem továbbítanak adatot.
Ez az orvosi kutatás jövője. Felszínre hozza a világ egészségügyi adataiban rejlő hatalmas, kihasználatlan értéket. Lehetővé teszi, hogy globális kollektív fajként küzdjünk a betegségek ellen, miközben tiszteletben tartjuk az egyén magánéletét.
Nem kell választanunk a magánélet és az egészség között. Nem kell választanunk az egyén és a közösség között. A szövetséges tanulással (Federated Learning) mindkettőt megkaphatjuk.
Készen áll arra, hogy kiaknázza egészségügyi adatai erejét anélkül, hogy veszélyeztetné a páciensek magánéletét? A Dweve szövetséges tanulási infrastruktúrája áttörést jelentő orvosi MI-t tesz lehetővé intézményi határokon átnyúlóan, miközben teljes GDPR- és HIPAA-megfelelést biztosít. Vegye fel velünk a kapcsolatot, hogy megtudja, hogyan alakíthatja át a kollaboratív MI a kutatási képességeit.