Linkr
Accueil Ressources Outils Documentation Blog Démo
EN
  • Qu'est-ce que Linkr ?
  • Modes de déploiement
  • Démarrage rapide
  • Installation locale
  • Avec Docker
  • Installation manuelle
  • Client-only
  • Votre premier projet
  • Espaces de travail et projets
  • Le pipeline de données
  • Entités et partage
  • Versioning et collaboration
  • Vue d'ensemble
  • Projets
  • Wiki
  • Plugins
  • Membres et rôles
  • Paramètres
  • Schémas
  • Bases de données
  • Sous-bases dérivées
  • Qualité des données
  • Catalogue de données
  • Collections de scripts SQL
  • Pipelines ETL
  • Présentation
  • Projets d'alignement
  • Vue d'ensemble
  • Concepts cibles
  • Éditeur d'alignements
  • Suggestions
  • Évaluation
  • Export
  • Vue d'ensemble
  • Concepts
  • Cohortes
  • Données individuelles
  • Pipeline
  • Jeux de données
  • IDE
  • Applications web
  • Versioning
  • Vue d'ensemble
  • Onglets et widgets
  • Widgets intégrés
  • Widgets d'analyse
  • Cartes de contrôle (SPC)
  • Questionnaires et eCRF
  • Code R et Python
  • Filtres, paramètres et export
  • Vue d'ensemble
  • Mode présentation
  • Exporter un rapport
  • Agents
  • Fournisseurs de modèles
  • Skills
  • Créer du contenu via MCP
  • Import et export
  • Versioning git
  • Catalogue communautaire
  • Publier du contenu
  • Installation en production
  • Configuration
  • Authentification et permissions
  • Fichiers sur le serveur
  • Sauvegarde et restauration
  • Glossaire
  • Raccourcis clavier
  • Notes de version
Documentation Entrepôt de données Catalogue de données

Catalogue de données

Décrire publiquement ce que contient un entrepôt, sans en exposer les données : comptages, anonymisation et export Health-DCAT-AP.

En résumé

Un catalogue de données décrit ce que contient une base — quels concepts, sur quelles périodes, pour combien de patients — sans jamais publier de donnée individuelle. Un seuil d’anonymisation retire les lignes portant trop peu de patients, et le résultat s’exporte en page HTML autonome accompagnée de métadonnées Health-DCAT-AP.

Client Disponible en mode client-only — tout fonctionne dans le navigateur, sans backend. Backend Disponible avec le backend FastAPI.

Deux « catalogues » à ne pas confondre

Le catalogue de données, décrit ici, répond à : « que contient cet entrepôt ? ». Il décrit vos données pour que d’autres équipes sachent si elles valent la peine d’être demandées.

Le catalogue communautaire répond à une tout autre question : « quels schémas, plugins ou projets puis-je installer ? ». Il indexe des entités Linkr publiées, pas des données.

Le problème : annoncer sans exposer

Un entrepôt hospitalier est invisible de l’extérieur. Une équipe qui cherche une cohorte de patients septiques ne peut pas savoir si vous en avez, ni combien, ni sur quelles années — sauf à demander, attendre, et souvent découvrir que la réponse était non.

Publier les données est hors de question. Mais publier leur description — les concepts présents, leur volumétrie, leur répartition dans le temps — ne présente pas le même risque, à condition que les comptages soient trop grossiers pour réidentifier qui que ce soit.

C’est exactement ce que produit un catalogue : un inventaire chiffré, anonymisé, publiable.

Construire un catalogue

1. Choisir la base

Un catalogue décrit une base, choisie dans l’onglet Source.

La base doit avoir un schéma

Sans mapping de schéma, Linkr ne sait pas ce qu’est un patient ni un séjour : il n’y a rien à compter. Voir Schémas.

2. Configurer ce qu’on compte

Trois réglages, dans l’onglet Configuration :

Classification des concepts

Quelles colonnes du dictionnaire servent de catégorie et de sous-catégorie. En OMOP, typiquement le domaine et la classe de concept — c’est ce qui rend l’inventaire navigable plutôt qu’une liste de dix mille codes.

Dimensions

Les axes démographiques de la ventilation — le sexe, l’âge. Ils enrichissent l’inventaire sans jamais descendre à l’individu.

Périodes

Une ligne par mois, trimestre ou année, avec patients et hospitalisations, et éventuellement une ventilation par service. Désactivé, le catalogue se contente de compter les concepts.

3. Calculer

Le calcul parcourt la base et compte. Sur un entrepôt volumineux, c’est long — l’opération est donc interruptible : on peut la mettre en pause, la reprendre, ou tout recalculer depuis le début. La progression s’affiche période par période.

Le résultat est conservé avec sa date. Les onglets Données, Anonymisation et Publier restent vides tant qu’aucun calcul n’a eu lieu.

Changer de base invalide le calcul

Les comptages décrivent une base précise. Si vous en changez, les résultats existants ne veulent plus rien dire : il faut relancer le calcul.

4. Anonymiser

C’est l’étape qui rend la publication acceptable. On fixe un nombre minimum de patients par ligne ; les lignes en dessous sont retirées de l’export.

Une ligne « 2 patients, service de néonatologie, mars 2024 » n’est pas une statistique, c’est une désignation. Le seuil l’élimine.

Linkr signale quand le découpage est trop fin

Si trop de cellules sont masquées, un avertissement invite à élargir la granularité — passer du mois au trimestre, du trimestre à l’année. Un catalogue dont la moitié des lignes ont disparu n’informe plus personne : mieux vaut des périodes plus larges et des chiffres qui subsistent.

Publier

Deux formats de sortie, tous deux produits depuis l’onglet Publier.

Une page HTML autonome

Un seul fichier, à ouvrir ou à déposer sur un site.

Il contient des graphiques, un tableau filtrable, et les métadonnées Health-DCAT-AP embarquées en JSON-LD — donc lisibles par un moteur de recherche ou un portail de données, sans rien installer.

Une archive ZIP

Les mêmes informations, séparées et réutilisables.

catalog.html, concepts.csv, dimensions.csv et metadata.jsonld. C’est la forme à retenir pour alimenter un catalogue institutionnel existant.

Un aperçu permet de voir la page avant de la produire, et un décompte indique combien de lignes ont été retirées par l’anonymisation — le chiffre à regarder avant de diffuser quoi que ce soit.

Health-DCAT-AP, en deux mots

C’est le vocabulaire européen de description des jeux de données de santé : éditeur, licence, contact, couverture temporelle, thématiques. L’utiliser signifie qu’un portail de données peut moissonner votre catalogue et l’afficher à côté d’autres, sans conversion.

Ce qui ne sort jamais

Un catalogue ne contient que des comptages agrégés. Aucune ligne patient, aucun identifiant, aucune date d’événement individuelle — et, sous le seuil d’anonymisation, pas même un comptage.

C’est la même logique que pour les bases : ce qui part de l’établissement décrit les données sans les emporter.

Pour aller plus loin

  • Schémas — indispensable pour que le calcul sache quoi compter.
  • Bases de données — la source d’un catalogue.
  • Catalogue communautaire — l’autre catalogue, celui des entités publiées.
  • Publier du contenu — diffuser au-delà de votre établissement.
PrécédentQualité des donnéesSuivantCollections de scripts SQL

Produit

  • Accueil
  • Démo

Ressources

  • Documentation
  • Ressources
  • Outils
  • Blog

Communauté

  • Code source Framagit
  • Code source Github

À propos

  • InterHop.org
  • Contact

2021–2026 InterHop — CC BY-NC-SA 4.0 (site) · GPLv3 (logiciel)