En résumé
Linkr n’est pas un logiciel de gestion d’entrepôt : il ne gère ni l’alimentation de l’EDS, ni les comptes d’accès, ni la création des extractions. Il s’installe dans l’environnement sécurisé d’un projet (SPE), à côté de RStudio ou Jupyter, et sert à faire passer le datamart du projet du niveau silver (données nettoyées) au niveau gold (données prêtes à l’analyse). Une instance globale, hors projets, peut en plus centraliser les alignements et les scripts de l’établissement.
Les couches d’un entrepôt de données de santé
Un entrepôt de données de santé (EDS) n’est pas un bloc unique. Entre le logiciel de soin et le résultat d’une étude, la donnée traverse plusieurs couches, portées par des équipes différentes. L’article Les entrepôts de données de santé décrit le système d’information hospitalier et l’ETL ; cette page se concentre sur ce qui vient ensuite, et sur la place qu’y tient Linkr.
1 · Système d’information hospitalier
SoinDossier patient informatisé, biologie, pharmacie, PMSI… chaque logiciel avec sa propre base.
2 · Alimentation et entrepôt — bronze, silver
Ingénierie de l’EDSL’ETL copie les données du SIH, les pseudonymise et les nettoie, dans un data warehouse ou un data lake.
3 · Datamart du projet
Plateforme de l’EDSPour une étude validée, un sous-ensemble de l’entrepôt : les patients, les variables et la période nécessaires.
4 · Environnement sécurisé du projet (SPE) — silver → gold
Linkr, RStudio, Jupyter…L’équipe de recherche travaille sur son datamart : qualité, standardisation, cohortes, variables, analyses. C’est ici que se place Linkr.
L’architecture médaillon : bronze, silver, gold
Beaucoup d’entrepôts récents, en particulier ceux construits sur un data lake, organisent leurs données en trois niveaux de raffinement — c’est l’architecture médaillon. Le vocabulaire vient de l’ingénierie des données, mais la logique vaut aussi pour un entrepôt classique.
1 · Bronze
Copie brute
Les données des logiciels de soin, telles quelles, pseudonymisées.
Entrepôt · équipe EDS
2 · Silver
Nettoyée et harmonisée
Doublons et valeurs aberrantes écartés, sources réunies — parfois déjà au format OMOP.
Entrepôt · équipe EDS
3 · Gold
Fiable pour un projet
Le datamart d’une étude, contrôlé et standardisé pour sa question de recherche.
SPE · équipe du projet
- Bronze — la copie brute des sources, telle qu’elle arrive du SIH, sans autre transformation que la pseudonymisation, généralement exigée avant toute intégration dans l’entrepôt. On la garde pour pouvoir tout rejouer si une règle de transformation change.
- Silver — une première mise en qualité, pour tout l’entrepôt : types corrigés, doublons supprimés, valeurs manifestement aberrantes écartées (une date de naissance en 2050), tables des différentes sources réunies dans un même modèle. Certains établissements convertissent dès ce niveau l’ensemble de l’entrepôt au modèle OMOP. C’est une donnée fiable, mais générique : les règles appliquées valent pour toutes les études, sans être pensées pour aucune en particulier.
- Gold — la donnée mise en qualité pour un projet précis. Elle reste au format de l’entrepôt — des tables d’événements, au format long —, mais elle a été contrôlée et standardisée au regard d’une question de recherche : les bornes de plausibilité d’un paramètre, les codes locaux à aligner, les unités à harmoniser dépendent de ce que l’étude va mesurer.
Bronze et silver sont le travail de l’équipe de l’EDS, pour tout l’établissement. Le gold se construit projet par projet, dans le SPE : c’est là, au contact de la question de recherche, que la mise en qualité se fait vraiment.
Et le format large ?
Passer à une table avec une ligne par patient et les variables de l’étude — le passage du format long au format large — vient après le gold : c’est la préparation des variables, décrite dans Le pipeline de données. Certaines présentations de l’architecture médaillon rangent ces tables d’analyse dans le gold ; ici, on garde au gold le format de l’entrepôt.
Le datamart du projet
Une étude n’accède jamais à l’entrepôt entier. Une fois le projet validé — protocole, avis du comité scientifique et éthique, formalités réglementaires —, la plateforme de l’EDS en extrait un datamart (on parle aussi d’extraction ou de jeu de données du projet) : les seuls patients, variables et périodes nécessaires.
Extraire le datamart réglementaire d’un projet, gérer les comptes d’accès à l’entrepôt : tout cela relève d’une plateforme de gestion de l’EDS, pas de Linkr. Linkr sait en revanche, en mode serveur, dériver d’une cohorte une sous-base restreinte à ses patients, à partir d’une base qu’il lit déjà — utile pour resserrer un périmètre à l’intérieur du SPE. Voir Sous-bases dérivées.
L’environnement sécurisé du projet
Le datamart est mis à disposition dans un environnement sécurisé de traitement — en anglais Secure Processing Environment, ou SPE. C’est un espace isolé, dédié au projet :
- Coupé d’internet et du reste du système d’information.
- Accessible par double authentification, aux seules personnes habilitées pour le projet.
- Sans sortie directe : un résultat ne quitte le SPE qu’après validation, par un circuit d’export contrôlé.
Le SPE fournit des outils d’analyse : RStudio, Jupyter, et Linkr. Linkr est donc un outil parmi d’autres dans le SPE — il travaille sur les mêmes données que les scripts R ou Python de l’équipe, et ne les remplace pas.
Linkr hérite de la sécurité du SPE
La double authentification, l’isolement réseau, le chiffrement et le contrôle des exports sont assurés par le SPE, pas par Linkr. Les rôles et permissions de Linkr servent à organiser le travail d’une équipe — qui modifie quoi dans un projet —, pas à cloisonner des données réglementaires. Déployez donc une instance Linkr par SPE, plutôt qu’une instance partagée entre plusieurs projets de recherche.
Ce que fait Linkr dans le SPE : du silver au gold
Dans le SPE, Linkr se connecte au datamart du projet. Il sert d’abord à en faire un datamart gold :
- Contrôler la qualité — des jeux de règles de qualité vérifient le datamart avant toute analyse : valeurs hors bornes, dates incohérentes, données manquantes.
- Standardiser — si le datamart est livré dans le format local de l’établissement, un pipeline ETL le convertit au modèle OMOP, pour réutiliser les outils et les analyses de la communauté.
- Aligner les terminologies — l’alignement de concepts relie les codes locaux (examens de biologie, médicaments, paramètres de surveillance) aux vocabulaires standards.
- Réutiliser des requêtes — les collections de scripts SQL rassemblent les requêtes éprouvées de l’établissement.
Puis, à partir du gold, il accompagne l’équipe jusqu’à l’analyse :
- Construire des cohortes — sélectionner les patients de l’étude par critères, dans le datamart. Voir Cohortes.
- Préparer les variables et analyser — passer du format long au format large, puis analyser et restituer dans des tableaux de bord. Voir Le pipeline de données.
Pas de changement d'identifiants pour une cohorte
Une cohorte construite dans Linkr, à partir du datamart d’un SPE, garde les identifiants du datamart : on travaille déjà dans le périmètre d’un projet précis, dans son SPE.
Une instance globale pour l’établissement
À côté des instances installées dans chaque SPE, un établissement peut faire tourner une instance globale de Linkr, hors de tout projet de recherche. Elle ne sert pas à analyser des données patients : elle centralise le savoir-faire accumulé sur l’entrepôt.
- Les alignements de concepts — l’alignement des codes locaux vers les vocabulaires standards, construit une fois et réutilisé par tous les projets.
- Les collections de scripts SQL et les jeux de règles de qualité — les requêtes et les contrôles validés pour l’entrepôt de l’établissement.
- Les pipelines ETL — la conversion du format local vers OMOP.
- Le wiki — la connaissance de l’entrepôt : ce que contient chaque table, les particularités du codage local, les pièges connus, les conventions de l’établissement. Centralisé, il évite que chaque projet redécouvre les mêmes subtilités, et il s’enrichit de l’expérience de tous.
Ces éléments passent de l’instance globale aux instances des SPE par import et export ou par versioning git, selon ce que permet le circuit de l’établissement. Dans l’autre sens, une amélioration faite pendant un projet — un alignement complété, un contrôle de qualité ajouté — peut remonter vers l’instance globale, à condition de ne contenir aucune donnée patient et de passer par le circuit d’export du SPE.
Instance globale de l'établissement
Aucune donnée patient : le savoir-faire sur l'entrepôt.
SPE — étude A
Linkr, RStudio, Jupyter sur le datamart
SPE — étude B
Linkr, RStudio, Jupyter sur le datamart
SPE — étude C
Linkr, RStudio, Jupyter sur le datamart
Ce que Linkr ne fait pas
Pour lever toute ambiguïté, voici quelle brique de l’infrastructure prend en charge chaque besoin :
| Besoin | Brique de l’infrastructure |
|---|---|
| Alimenter l’entrepôt depuis le SIH (bronze, silver) | Chaîne d’alimentation de l’EDS (ETL) |
| Pseudonymiser les données de l’entrepôt | Chaîne d’alimentation de l’EDS (ETL) |
| Gérer les comptes et les habilitations d’accès à l’EDS | Plateforme de gestion de l’EDS |
| Extraire le datamart réglementaire d’un projet | Plateforme de gestion de l’EDS |
| Double authentification, isolement réseau, chiffrement | SPE |
| Valider et contrôler les exports hors du SPE | Circuit d’export du SPE |
| Qualité, standardisation, alignement, cohortes, variables, analyses sur le datamart | Linkr, avec les autres outils du SPE |
Pour aller plus loin
- Les entrepôts de données de santé — le SIH, l’ETL et les modèles de données communs, expliqués depuis le début.
- Modes de déploiement — choisir entre le mode client-only et le mode full-stack pour une installation dans un SPE.
- Espaces de travail et projets — comment Linkr organise le travail une fois installé.
- Alignement de concepts — le travail que l’instance globale permet de mutualiser.