Федеративно обучение в здравеопазването: лечение на рак без споделяне на данни

Болниците разполагат с данните, които могат да излекуват болести, но законите за поверителност им пречат да ги споделят. Федеративното обучение решава тази...

Федеративно обучение в здравеопазването: лечение на рак без споделяне на данни

Трагедията на силозите за данни

Представете си пет големи изследователски болници в Европа: в Берлин, Париж, Амстердам, Милано и Мадрид. Във всяка болница има по 1 000 пациенти с рядка форма на детска левкемия. Извадка от 1 000 пациенти е твърде малка, за да се обучи надежден модел на задълбочено обучение за ранно откриване на болестта. Моделът се пренастройва; той научава специфичните особености на берлинския скенер, а не патологията на рака.

Ако обаче можете да комбинирате наборите от данни, ще получите 5 000 пациенти: набор от данни, достатъчно голям, за да обучите революционен диагностичен изкуствен интелект, който би могъл да спаси хиляди животи.

В стария свят това беше невъзможно. GDPR в Европа, HIPAA в САЩ и строгите правила за поверителност на пациентите категорично забраняват изпращането на сурови досиета на пациенти от болница А до болница Б или качването им в централен облачен сървър, собственост на технологичен гигант.

Така данните остават в силози. Изкуственият интелект никога не се обучава. Моделът остава неоткрит. Пациентите умират.

Това е трагедията на поверителността на данните срещу медицинския прогрес. Това е задънена улица. Но това е задънена улица, която можем да разбием с математика.

Традиционно обучение на ИИ срещу Федеративно обучениеТрадиционно (централизирано)Болница AБолница BБолница CЦентрален облакДанни на пациентите се качват ✗Федеративно обучениеБолница AБолница BБолница CКоординаторИзпращат се само актуализации на модела ✓Процес на федеративно обучение1. РазпределянеМодел → Болници2. Локално обучениеДанните остават на място3. Изпращане на актуализацииСамо математика, без данни4. АгрегиранеСредно → ГлобаленДанните на пациентите НИКОГА не напускат болницата. Споделят се само математически актуализации.
Трагедията не е в това, че болниците защитават пациентите си. Тя е в това, че старият модел на обучение изисква споделена база данни, преди моделът да може да се учи.

Федеративното обучение: обръщането на обучението

Федеративното обучение (FL) напълно обръща стандартната парадигма на обучението на ИИ.

Стандартният подход (централизиран): Събиране на всички данни от всички източници в огромно централно езеро от данни. Обучение на модела върху това езеро.

Федеративният подход (децентрализиран): Данните остават там, където са. Моделът отива при данните.

Ето как работи това на практика, стъпка по стъпка:

  1. Инициализация: Централен сървър (координаторът) създава „празен“ или предварително обучен глобален модел.
  2. Разпространение: Сървърът изпраща копие на този модел до всяка от 5-те болници.
  3. Локално обучение: Всяка болница обучава модела локално върху собствените си частни данни за пациенти. Това обучение се случва на защитените сървъри на болницата, зад нейната защитна стена. Суровите данни за пациенти никога не напускат мазето.
  4. Генериране на актуализация: Локалният процес на обучение създава „актуализация на модела“: набор от математически корекции на теглата (синапсите) на невронната мрежа. Тя по същество казва: „За да разпознаваме рака по-добре, повиши неврон №45 с 0,1 и намали неврон №92 с 0,05.“
  5. Агрегиране: Болницата изпраща само тази актуализация на модела (математиката) обратно на централния сървър. Без имена на пациенти, без рентгенови снимки, без резултати от кръвни изследвания. Само файл с числа с плаваща запетая.
  6. Осредняване: Централният сървър събира актуализациите от всичките 5 болници. Той ги осреднява (с помощта на алгоритъм като федеративното осредняване), за да създаде нов, по-умен глобален модел.
  7. Повторение: Новият глобален модел се изпраща обратно на болниците и цикълът се повтаря.
Федеративното обучение обръща опасното движение: изчисленията преминават институционалните граници, докато записите на пациентите остават зад защитната стена.

Математическата магия

Магията на този процес е, че глобалният модел става по-умен сякаш е бил обучен върху всичките 5 000 пациенти, въпреки че всъщност никога не ги е „виждал“ директно. Той научава моделите на заболяването (които са общи за всички болници), без да научава самоличността на пациентите (която е уникална за всяка болница).

Той разделя способността да се учи от необходимостта да се вижда.

Защита в дълбочина на Dweve: нива на поверителностНиво 1: Федеративно обучениеДанните никога не напускат болницата. Предават се само актуализации на модела.Решава: ограничения за трансфер на данни, съответствие с GDPR, институционален суверенитетНиво 2: Сигурно многостранно изчисление (SMPC)Сървърът изчислява обобщения резултат, без да вижда отделните актуализации на болниците.Решава: атаки от злонамерен координатор, атаки чрез извод върху актуализациитеНиво 3: Диференциална поверителност (DP)Към актуализациите се добавя статистически шум, който математически ограничава загубата на поверителност.Решава: повторно идентифициране по модели, атаки чрез извод за членствоРезултат: математически доказани гаранции за поверителност (ε-диференциална поверителност)

Защита в дълбочина: SMPC и диференциална поверителност

Параноичните инженери по сигурността (като нас в Dweve) ще попитат: „Но не можете ли да възстановите данните на пациентите от актуализацията на модела?"

Това е основателно притеснение. На теория, ако една актуализация на модела е много специфична, злонамерен централен сървър би могъл да заключи, че „пациент X в болницата в Берлин вероятно е имал състояние Y".

За да предотврати това, Dweve добавя два допълнителни криптографски слоя върху федеративното обучение:

1. Сигурно многостранно изчисление (SMPC)

Това е криптографски протокол, който позволява на централния сървър да изчисли сумата от актуализациите, без никога да вижда отделните актуализации.

Представете си трима души, които искат да изчислят средната си заплата, но никой не иска да разкрие заплатата си пред останалите. SMPC им позволява да направят това. Сървърът вижда обобщения резултат, но математически не може да го разложи обратно до отделните входни данни. Сървърът буквално не знае коя болница е изпратила коя актуализация.

2. Диференциална поверителност (DP)

Както обсъдихме в статията ни за поверителността, добавяме статистически шум към локалните актуализации, преди да напуснат болницата. Това „размива" приноса на всеки отделен пациент, което прави възможна математически доказана анонимност.

Координаторът трябва да научи общата посока на модела, а не коя болница или пациент я е предизвикал.

Реално въздействие

В момента внедряваме тази технология с консорциум от европейски онкологични центрове. Те обучават модел за откриване на тумори през граници (Германия, Франция, Нидерландия), без да нарушават нито един регламент за поверителност. Те решават проблема с трансфера на данни „Schrems II“, като просто не трансферират данни.

Това е бъдещето на медицинските изследвания. То отключва огромната, затворена стойност на здравните данни по света. Позволява ни да се борим с болестите като глобален колективен вид, като същевременно зачитаме поверителността на индивида.

Не е нужно да избираме между поверителност и здраве. Не е нужно да избираме между индивида и колектива. С федеративното обучение можем да имаме и двете.

Готови ли сте да отключите силата на вашите здравни данни, без да компрометирате поверителността на пациентите? Федеративната инфраструктура на Dweve позволява пробив в медицинския ИИ през институционални граници, като същевременно поддържа пълно съответствие с GDPR и HIPAA. Свържете се с нас, за да научите как съвместният ИИ може да трансформира вашите изследователски възможности.

Практическата полза е клинично сътрудничество с по-малка цел за съответствие: споделено обучение, а не споделени сурови записи.