Szövetségi tanulás az egészségügyben: rákgyógyítás adatmegosztás nélkül

A kórházak rendelkeznek a betegségek gyógyításához szükséges adatokkal, de az adatvédelmi törvények megakadályozzák a megosztásukat. A szövetséges tanulás...

Szövetségi tanulás az egészségügyben: rákgyógyítás adatmegosztás nélkül

Az adatsilók tragédiája

Képzeljük el, hogy öt nagy európai kutatókórház van: Berlinben, Párizsban, Amszterdamban, Milánóban és Madridban. Mindegyik kórházban 1 000 olyan beteg van, akik a gyermekkori leukémia egy ritka formájában szenvednek. Az 1 000 fős minta túl kicsi ahhoz, hogy megbízható Deep Learning modellt lehessen betanítani a betegség korai felismerésére. A modell túltanul; a rák patológiája helyett a berlini szkenner sajátosságait tanulja meg.

Ha azonban össze lehetne vonni az adathalmazokat, 5 000 betegünk lenne: ez már elég nagy adathalmaz egy áttörést jelentő diagnosztikai MI betanításához, amely emberek ezreinek életét menthetné meg.

A régi világban ez lehetetlen volt. Az európai GDPR, az amerikai HIPAA és a szigorú betegtitokra vonatkozó szabályok szigorúan tiltják, hogy a nyers betegadatokat az A kórházból a B kórházba továbbítsák, vagy feltöltsék egy technológiai óriás által üzemeltetett központi felhőszerverre.

Így az adatok silókban maradnak. Az MI-t soha nem tanítják be. A minta felfedezetlen marad. A betegek meghalnak.

Ez az adatvédelem és az orvosi fejlődés közötti tragédia. Ez egy patthelyzet. De ez egy olyan patthelyzet, amelyet matematikával meg tudunk törni.

Hagyományos MI-tanítás vs. szövetséges tanulásHagyományos (központosított)Kórház AKórház BKórház CKözponti felhőBetegek adatainak feltöltése ✗Szövetséges tanulásKórház AKórház BKórház CKoordinátorCsak modellfrissítések küldése ✓A szövetséges tanulás folyamata1. SzétosztásModell → Kórházak2. Helyi tanításAz adatok a helyszínen maradnak3. Frissítések küldéseCsak matematika, adat nélkül4. ÖsszesítésÁtlag → GlobálisA betegek adatai SOHA nem hagyják el a kórházat. Csak matematikai frissítések kerülnek megosztásra.
A tragédia nem az, hogy a kórházak védik a betegeket. Hanem az, hogy a régi tanítási minta egy közös adatbázist követel meg, mielőtt a modell tanulhatna.

Szövetséges tanulás: a tanítás megfordítása

A szövetséges tanulás (FL) teljesen megfordítja a mesterséges intelligencia tanításának szokásos paradigmáját.

A szokásos megközelítés (központosított): Gyűjtsd össze az összes adatot minden forrásból egy hatalmas központi adatóceánba. Tanítsd a modellt az óceánon.

A szövetséges megközelítés (szétszórt): Hagyd az adatot ott, ahol van. Küldd a modellt az adathoz.

Így működik a gyakorlatban, lépésről lépésre:

  1. Inicializálás: Egy központi szerver (a koordinátor) létrehoz egy "üres" vagy előre betanított globális modellt.
  2. Terjesztés: A szerver elküldi a modell egy példányát mind az 5 kórháznak.
  3. Helyi tanítás: Minden kórház a saját, privát betegadatain tanítja a modellt helyben. Ez a tanítás a kórház saját, biztonságos szerverein történik, a tűzfal mögött. A nyers betegadat soha nem hagyja el az alagsort.
  4. Frissítés létrehozása: A helyi tanítási folyamat egy "modellfrissítést" hoz létre: a neurális hálózat súlyainak (szinapszisainak) matematikai módosításainak egy halmazát. Lényegében ezt mondja: "Ahhoz, hogy jobban felismerje a rákot, told meg a 45-ös neuront 0,1-gyel, és csökkentsd a 92-es neuront 0,05-tel."
  5. Összesítés: A kórház csak ezt a modellfrissítést (a matematikát) küldi vissza a központi szervernek. Nincs betegnév, nincs röntgen, nincs vérvizsgálati eredmény. Csak egy fájl lebegőpontos számokkal.
  6. Átlagolás: A központi szerver összegyűjti az összes 5 kórház frissítését. Átlagolja őket (például a szövetséges átlagolás algoritmusával), hogy létrehozzon egy új, okosabb globális modellt.
  7. Ismétlés: Az új globális modellt visszaküldik a kórházaknak, és a ciklus megismétlődik.
A szövetséges tanulás megfordítja a veszélyes mozgást: a számítás átlépi az intézményi határokat, miközben a betegnyilvántartások a tűzfal mögött maradnak.

A matematikai varázslat

A folyamat varázslata az, hogy a globális modell okosabb lesz, mintha mind az 5 000 betegen tanították volna, még akkor is, ha valójában soha nem "látta" egyiket sem közvetlenül. Megtanulja a betegség mintázatait (amelyek minden kórházban közösek) anélkül, hogy megtanulná a betegek személyazonosságát (amelyek minden kórházban egyediek).

Szétválasztja a tanulás képességét a látás szükségességétől.

A Dweve többrétegű védelme: adatvédelmi rétegek1. réteg: szövetséges tanulásAz adatok soha nem hagyják el a kórházat. Csak a modellfrissítések kerülnek továbbításra.Megoldja: adattovábbítási korlátozások, GDPR-megfelelés, intézményi szuverenitás2. réteg: biztonságos többoldalú számítás (SMPC)A szerver az összesített értéket számolja ki anélkül, hogy látná az egyes kórházak frissítéseit.Megoldja: rosszindulatú koordinátori támadások, frissítésekre irányuló következtetéses támadások3. réteg: differenciált adatvédelem (DP)Statisztikai zajt adunk a frissítésekhez, matematikailag korlátozva az adatvédelmi veszteséget.Megoldja: mintázatokból történő újraazonosítás, tagsági következtetéses támadásokEredmény: matematikailag igazolt adatvédelmi garanciák (ε-differenciált adatvédelem)

Többrétegű védelem: SMPC és differenciált adatvédelem

A paranoid biztonsági mérnökök (mint mi a Dweve-nél) megkérdezik: „De hát nem lehet visszafejteni a páciensadatokat a modellfrissítésből?”

Jogos aggály. Elméletileg, ha egy modellfrissítés nagyon specifikus, egy rosszindulatú központi szerver következtethet arra, hogy „a berlini kórház X betegének bizonyosan Y betegsége volt”.

Ennek megelőzésére a Dweve két további kriptográfiai technológiát rétegez a szövetséges tanulásra:

1. Biztonságos többoldalú számítás (SMPC)

Ez egy kriptográfiai protokoll, amely lehetővé teszi a központi szerver számára, hogy kiszámítsa a frissítések összegét anélkül, hogy valaha is látná az egyes frissítéseket.

Képzeljük el, hogy három ember ki akarja számolni az átlagfizetését, de senki sem akarja felfedni a fizetését a többiek előtt. Az SMPC ezt lehetővé teszi számukra. A szerver látja az összesített eredményt, de matematikailag képtelen azt visszabontani az egyes bemenetekre. A szerver szó szerint nem tudja, melyik kórház küldte melyik frissítést.

2. Differenciált adatvédelem (DP)

Ahogyan az adatvédelmi cikkünkben is tárgyaltuk, statisztikai zajt adunk a helyi frissítésekhez, mielőtt azok elhagyják a kórházat. Ez „elmosja” bármely egyes páciens hozzájárulását, matematikailag igazolt anonimitást téve lehetővé.

A koordinátornak a modell általános irányát kell megismernie, nem pedig azt, hogy melyik kórház vagy páciens mozdította el azt.

Valós hatás

Jelenleg ezt a technológiát európai onkológiai központok konzorciumával telepítjük. Határokon átnyúlóan (Németország, Franciaország, Hollandia) tanítanak daganatfelismerő modellt anélkül, hogy bármely adatvédelmi szabályozást megsértenének. A „Schrems II" adattovábbítási problémát azzal oldják meg, hogy egyszerűen nem továbbítanak adatot.

Ez az orvosi kutatás jövője. Felszínre hozza a világ egészségügyi adataiban rejlő hatalmas, kihasználatlan értéket. Lehetővé teszi, hogy globális kollektív fajként küzdjünk a betegségek ellen, miközben tiszteletben tartjuk az egyén magánéletét.

Nem kell választanunk a magánélet és az egészség között. Nem kell választanunk az egyén és a közösség között. A szövetséges tanulással (Federated Learning) mindkettőt megkaphatjuk.

Készen áll arra, hogy kiaknázza egészségügyi adatai erejét anélkül, hogy veszélyeztetné a páciensek magánéletét? A Dweve szövetséges tanulási infrastruktúrája áttörést jelentő orvosi MI-t tesz lehetővé intézményi határokon átnyúlóan, miközben teljes GDPR- és HIPAA-megfelelést biztosít. Vegye fel velünk a kapcsolatot, hogy megtudja, hogyan alakíthatja át a kollaboratív MI a kutatási képességeit.

A gyakorlati nyereség a klinikai együttműködés kisebb megfelelési célponttal: megosztott tanulás, nem pedig megosztott nyers adatbázisok.