Dweve

Apprentissage fédéré pour la santé : guérir le cancer sans partager les données

Les hôpitaux disposent des données pour guérir des maladies, mais les lois sur la confidentialité les empêchent de les partager. L'apprentissage fédéré...

Apprentissage fédéré pour la santé : guérir le cancer sans partager les données

La tragédie des silos de données

Imaginez cinq grands hôpitaux de recherche en Europe : à Berlin, Paris, Amsterdam, Milan et Madrid. Chaque hôpital compte 1 000 patients atteints d'une forme spécifique et rare de leucémie pédiatrique. Un échantillon de 1 000 patients est trop petit pour entraîner un modèle de Deep Learning fiable capable de détecter la maladie à un stade précoce. Le modèle surajuste ; il apprend les particularités du scanner de Berlin plutôt que la pathologie du cancer.

Cependant, si l'on pouvait combiner les ensembles de données, on disposerait de 5 000 patients : un ensemble suffisamment grand pour entraîner une IA diagnostique révolutionnaire qui pourrait sauver des milliers de vies.

Dans l'ancien monde, cela était impossible. Le RGPD en Europe, la HIPAA aux États-Unis et des règles strictes de confidentialité des patients interdisent formellement d'envoyer des dossiers médicaux bruts d'un hôpital A à un hôpital B, ou de les téléverser sur un serveur cloud central appartenant à un géant de la technologie.

Les données restent donc cloisonnées. L'IA n'est jamais entraînée. Le schéma reste non découvert. Des patients meurent.

Telle est la tragédie de la confidentialité des données face au progrès médical. C'est une impasse. Mais c'est une impasse que nous pouvons briser grâce aux mathématiques.

Entraînement IA traditionnel vs Apprentissage fédéréTraditionnel (centralisé)Hôpital AHôpital BHôpital CCloud centralDonnées patients téléversées ✗Apprentissage fédéréHôpital AHôpital BHôpital CCoordinateurSeules les mises à jour du modèle sont envoyées ✓Processus d'apprentissage fédéré1. DistribuerModèle → Hôpitaux2. Entraîner localementLes données restent sur place3. Envoyer les mises à jourMaths uniquement, pas de données4. AgrégerMoyenne → GlobalLes données des patients ne quittent JAMAIS l'hôpital. Seules des mises à jour mathématiques sont partagées.
La tragédie n'est pas que les hôpitaux protègent leurs patients. C'est que l'ancien schéma d'entraînement exige une base de données partagée avant que le modèle puisse apprendre.

L'apprentissage fédéré : l'inversion de l'entraînement

L'apprentissage fédéré (FL) inverse complètement le paradigme standard de l'entraînement de l'IA.

L'approche standard (centralisée) : Rassembler toutes les données de toutes les sources dans un immense lac de données central. Entraîner le modèle sur ce lac.

L'approche fédérée (décentralisée) : Laisser les données là où elles sont. Envoyer le modèle aux données.

Voici comment cela fonctionne en pratique, étape par étape :

  1. Initialisation : Un serveur central (le coordinateur) crée un modèle global « vierge » ou pré-entraîné.
  2. Distribution : Le serveur envoie une copie de ce modèle à chacun des 5 hôpitaux.
  3. Entraînement local : Chaque hôpital entraîne le modèle localement sur ses propres données patients privées. Cet entraînement se déroule sur les serveurs sécurisés de l'hôpital, derrière son pare-feu. Les données patients brutes ne quittent jamais le sous-sol.
  4. Génération de la mise à jour : Le processus d'entraînement local produit une « mise à jour du modèle » : un ensemble d'ajustements mathématiques appliqués aux poids (synapses) du réseau de neurones. Cela revient essentiellement à dire : « Pour mieux reconnaître le cancer, augmenter le neurone n° 45 de 0,1 et diminuer le neurone n° 92 de 0,05. »
  5. Agrégation : L'hôpital renvoie uniquement cette mise à jour du modèle (les calculs) au serveur central. Pas de noms de patients, pas de radiographies, pas de résultats d'analyses sanguines. Juste un fichier de nombres à virgule flottante.
  6. Moyenne : Le serveur central collecte les mises à jour des 5 hôpitaux. Il en fait la moyenne (à l'aide d'un algorithme comme Federated Averaging) pour créer un nouveau modèle global, plus intelligent.
  7. Répétition : Le nouveau modèle global est renvoyé aux hôpitaux, et le cycle se répète.
L'apprentissage fédéré inverse le mouvement dangereux : le calcul franchit les frontières institutionnelles tandis que les dossiers patients restent derrière le pare-feu.

La magie mathématique

La magie de ce processus, c'est que le modèle global devient plus intelligent comme s'il avait été entraîné sur les 5 000 patients, alors même qu'il n'en a jamais réellement « vu » aucun directement. Il apprend les schémas de la maladie (communs à tous les hôpitaux) sans apprendre l'identité des patients (unique à chaque hôpital).

Il dissocie la capacité d'apprendre de la nécessité de voir.

Défense en profondeur de Dweve : les couches de confidentialitéCouche 1 : apprentissage fédéréLes données ne quittent jamais l'hôpital. Seules les mises à jour du modèle sont transmises.Résout : les restrictions de transfert de données, la conformité au RGPD, la souveraineté institutionnelleCouche 2 : calcul multipartite sécurisé (SMPC)Le serveur calcule l'agrégat sans voir les mises à jour individuelles des hôpitaux.Résout : les attaques d'un coordinateur malveillant, les attaques par inférence sur les mises à jourCouche 3 : confidentialité différentielle (DP)Un bruit statistique est ajouté aux mises à jour, ce qui borne mathématiquement la perte de confidentialité.Résout : la ré-identification à partir de motifs, les attaques par inférence d'appartenanceRésultat : des garanties de confidentialité prouvées mathématiquement (confidentialité différentielle ε)

Défense en profondeur : SMPC et confidentialité différentielle

Les ingénieurs en sécurité paranoïaques (comme nous chez Dweve) demanderont : « Mais ne pouvez-vous pas déduire les données des patients à partir de la mise à jour du modèle ? »

C'est une préoccupation légitime. En théorie, si une mise à jour du modèle est très spécifique, un serveur central malveillant pourrait être en mesure de déduire que « le patient X de l'hôpital de Berlin a dû présenter la condition Y ».

Pour empêcher cela, Dweve superpose deux technologies cryptographiques supplémentaires à l'apprentissage fédéré :

1. Calcul multipartite sécurisé (SMPC)

Il s'agit d'un protocole cryptographique qui permet au serveur central de calculer la somme des mises à jour sans jamais voir les mises à jour individuelles.

Imaginez trois personnes qui veulent calculer leur salaire moyen, mais personne ne veut révéler son salaire aux autres. Le SMPC leur permet de le faire. Le serveur voit le résultat agrégé, mais ne peut mathématiquement pas le décomposer pour retrouver les entrées individuelles. Le serveur ne sait littéralement pas quel hôpital a envoyé quelle mise à jour.

2. Confidentialité différentielle (DP)

Comme indiqué dans notre article sur la confidentialité, nous ajoutons un bruit statistique aux mises à jour locales avant qu'elles ne quittent l'hôpital. Cela « brouille » la contribution de chaque patient, rendant possible un anonymat prouvé mathématiquement.

Le coordinateur doit connaître la direction globale du modèle, et non savoir quel hôpital ou quel patient l'a fait évoluer dans ce sens.

Impact concret

Nous déployons actuellement cette technologie avec un consortium de centres d'oncologie européens. Ils entraînent un modèle de détection de tumeurs au-delà des frontières (Allemagne, France, Pays-Bas) sans enfreindre une seule réglementation sur la vie privée. Ils résolvent le problème du transfert de données posé par l'arrêt « Schrems II » en ne transférant tout simplement pas les données.

C'est l'avenir de la recherche médicale. Cela libère la valeur immense et inexploitée des données de santé mondiales. Cela nous permet de lutter contre la maladie en tant qu'espèce collective mondiale, tout en respectant la vie privée de chacun.

Nous n'avons pas à choisir entre la vie privée et la santé. Nous n'avons pas à choisir entre l'individu et le collectif. Avec l'apprentissage fédéré, nous pouvons avoir les deux.

Prêt à exploiter la puissance de vos données de santé sans compromettre la confidentialité des patients ? L'infrastructure d'apprentissage fédéré de Dweve permet des avancées en IA médicale au-delà des frontières institutionnelles, tout en garantissant une conformité totale au RGPD et à la HIPAA. Contactez-nous pour découvrir comment l'IA collaborative peut transformer vos capacités de recherche.

Le gain concret est une collaboration clinique avec une cible de conformité plus restreinte : un apprentissage partagé, et non le partage de dossiers bruts.