Федеративно обучение в здравеопазването: лечение на рак без споделяне на данни
Трагедията на силозите за данни
Представете си пет големи изследователски болници в Европа: в Берлин, Париж, Амстердам, Милано и Мадрид. Във всяка болница има по 1 000 пациенти с рядка форма на детска левкемия. Извадка от 1 000 пациенти е твърде малка, за да се обучи надежден модел на задълбочено обучение за ранно откриване на болестта. Моделът се пренастройва; той научава специфичните особености на берлинския скенер, а не патологията на рака.
Ако обаче можете да комбинирате наборите от данни, ще получите 5 000 пациенти: набор от данни, достатъчно голям, за да обучите революционен диагностичен изкуствен интелект, който би могъл да спаси хиляди животи.
В стария свят това беше невъзможно. GDPR в Европа, HIPAA в САЩ и строгите правила за поверителност на пациентите категорично забраняват изпращането на сурови досиета на пациенти от болница А до болница Б или качването им в централен облачен сървър, собственост на технологичен гигант.
Така данните остават в силози. Изкуственият интелект никога не се обучава. Моделът остава неоткрит. Пациентите умират.
Това е трагедията на поверителността на данните срещу медицинския прогрес. Това е задънена улица. Но това е задънена улица, която можем да разбием с математика.
Федеративното обучение: обръщането на обучението
Федеративното обучение (FL) напълно обръща стандартната парадигма на обучението на ИИ.
Стандартният подход (централизиран): Събиране на всички данни от всички източници в огромно централно езеро от данни. Обучение на модела върху това езеро.
Федеративният подход (децентрализиран): Данните остават там, където са. Моделът отива при данните.
Ето как работи това на практика, стъпка по стъпка:
- Инициализация: Централен сървър (координаторът) създава „празен“ или предварително обучен глобален модел.
- Разпространение: Сървърът изпраща копие на този модел до всяка от 5-те болници.
- Локално обучение: Всяка болница обучава модела локално върху собствените си частни данни за пациенти. Това обучение се случва на защитените сървъри на болницата, зад нейната защитна стена. Суровите данни за пациенти никога не напускат мазето.
- Генериране на актуализация: Локалният процес на обучение създава „актуализация на модела“: набор от математически корекции на теглата (синапсите) на невронната мрежа. Тя по същество казва: „За да разпознаваме рака по-добре, повиши неврон №45 с 0,1 и намали неврон №92 с 0,05.“
- Агрегиране: Болницата изпраща само тази актуализация на модела (математиката) обратно на централния сървър. Без имена на пациенти, без рентгенови снимки, без резултати от кръвни изследвания. Само файл с числа с плаваща запетая.
- Осредняване: Централният сървър събира актуализациите от всичките 5 болници. Той ги осреднява (с помощта на алгоритъм като федеративното осредняване), за да създаде нов, по-умен глобален модел.
- Повторение: Новият глобален модел се изпраща обратно на болниците и цикълът се повтаря.
Математическата магия
Магията на този процес е, че глобалният модел става по-умен сякаш е бил обучен върху всичките 5 000 пациенти, въпреки че всъщност никога не ги е „виждал“ директно. Той научава моделите на заболяването (които са общи за всички болници), без да научава самоличността на пациентите (която е уникална за всяка болница).
Той разделя способността да се учи от необходимостта да се вижда.
Защита в дълбочина: SMPC и диференциална поверителност
Параноичните инженери по сигурността (като нас в Dweve) ще попитат: „Но не можете ли да възстановите данните на пациентите от актуализацията на модела?"
Това е основателно притеснение. На теория, ако една актуализация на модела е много специфична, злонамерен централен сървър би могъл да заключи, че „пациент X в болницата в Берлин вероятно е имал състояние Y".
За да предотврати това, Dweve добавя два допълнителни криптографски слоя върху федеративното обучение:
1. Сигурно многостранно изчисление (SMPC)
Това е криптографски протокол, който позволява на централния сървър да изчисли сумата от актуализациите, без никога да вижда отделните актуализации.
Представете си трима души, които искат да изчислят средната си заплата, но никой не иска да разкрие заплатата си пред останалите. SMPC им позволява да направят това. Сървърът вижда обобщения резултат, но математически не може да го разложи обратно до отделните входни данни. Сървърът буквално не знае коя болница е изпратила коя актуализация.
2. Диференциална поверителност (DP)
Както обсъдихме в статията ни за поверителността, добавяме статистически шум към локалните актуализации, преди да напуснат болницата. Това „размива" приноса на всеки отделен пациент, което прави възможна математически доказана анонимност.
Реално въздействие
В момента внедряваме тази технология с консорциум от европейски онкологични центрове. Те обучават модел за откриване на тумори през граници (Германия, Франция, Нидерландия), без да нарушават нито един регламент за поверителност. Те решават проблема с трансфера на данни „Schrems II“, като просто не трансферират данни.
Това е бъдещето на медицинските изследвания. То отключва огромната, затворена стойност на здравните данни по света. Позволява ни да се борим с болестите като глобален колективен вид, като същевременно зачитаме поверителността на индивида.
Не е нужно да избираме между поверителност и здраве. Не е нужно да избираме между индивида и колектива. С федеративното обучение можем да имаме и двете.
Готови ли сте да отключите силата на вашите здравни данни, без да компрометирате поверителността на пациентите? Федеративната инфраструктура на Dweve позволява пробив в медицинския ИИ през институционални граници, като същевременно поддържа пълно съответствие с GDPR и HIPAA. Свържете се с нас, за да научите как съвместният ИИ може да трансформира вашите изследователски възможности.