Linkr
Accueil Ressources Outils Documentation Blog Démo
EN
Apprendre la programmation
  • Pourquoi apprendre à coder ?
  • Les bases de la programmation
  • Introduction au SQL
5/5
12 min Boris Delange, Martin Castan, Lou Vignais · 02/07/2026

Introduction à Python

À quoi sert Python, le langage polyvalent de la data science. pandas, matplotlib, les notebooks Jupyter, et des ressources gratuites pour débuter.

En résumé

Python est un langage généraliste très lisible, devenu un standard de la data science. Comme R, il sert à nettoyer, analyser et visualiser des données une fois extraites en SQL — grâce aux librairies pandas (tableaux de données) et matplotlib (graphiques). C’est aussi le langage dominant en machine learning. On l’utilise souvent dans des notebooks Jupyter.

Cet article prolonge Pourquoi apprendre à coder ? et l’introduction à R. Python et R font largement les mêmes choses pour l’analyse de données ; leurs concepts se transposent d’un langage à l’autre.

Pourquoi Python

Python n’a pas été conçu pour les statistiques, mais pour être un langage généraliste et lisible. Cela lui donne des atouts complémentaires de ceux de R :

  • Polyvalence : au-delà de l’analyse de données, Python sert à automatiser des tâches, manipuler des fichiers, interroger des sites web, construire des applications.
  • Machine learning : les grandes librairies d’apprentissage automatique et d’intelligence artificielle (scikit-learn, PyTorch…) sont en Python. C’est incontournable dès qu’on s’oriente vers la modélisation prédictive.
  • Lisibilité : sa syntaxe épurée en fait un bon premier langage, y compris pour qui n’a jamais programmé.

R ou Python ?

Les deux sont d’excellents choix pour débuter. R brille en biostatistique et en visualisation statistique ; Python est plus polyvalent et incontournable en machine learning. Le plus efficace : commencer par celui qu’utilisent vos encadrants, puis découvrir l’autre quand le besoin se présente.

Les notebooks Jupyter

En data science, on écrit souvent Python dans des notebooks Jupyter : un document qui alterne des cellules de code, leurs résultats (tableaux, graphiques) et du texte explicatif. C’est idéal pour explorer des données pas à pas et partager une analyse commentée. Des environnements gratuits comme Google Colab permettent d’utiliser des notebooks directement dans le navigateur, sans rien installer.

pandas : manipuler des tableaux

pandas est la librairie centrale pour manipuler des données tabulaires en Python. Elle organise les données dans un objet appelé DataFrame — un tableau avec des lignes et des colonnes nommées, comme une feuille de calcul.

Python
import pandas as pd

# Un tableau de patients (sexe, age, creatinine)
patients = pd.DataFrame({
  "sexe":       ["F", "M", "F", "F", "M", "F"],
  "age":        [72, 45, 34, 78, 60, 69],
  "creatinine": [142, 88, 71, 156, 97, 168],
})

# Filtrer les femmes de plus de 65 ans
femmes_agees = patients[(patients["sexe"] == "F") & (patients["age"] > 65)]

# Créatinine moyenne par sexe
patients.groupby("sexe")["creatinine"].mean()
Résultat
sexe
F    134.25
M     92.50
Name: creatinine, dtype: float64

Si vous avez lu les articles SQL et R, vous reconnaissez la même logique : filtrer les lignes, regrouper, résumer. Seule la syntaxe change. En pratique, on charge souvent les données depuis un fichier CSV (un tableau texte où les colonnes sont séparées par des virgules) avec pd.read_csv("patients.csv"), format d’échange très courant.

matplotlib : visualiser

matplotlib est la librairie de base pour tracer des graphiques. La plupart des tracés tiennent en quelques lignes.

Python
import matplotlib.pyplot as plt

plt.scatter(patients["age"], patients["creatinine"])
plt.xlabel("Âge (années)")
plt.ylabel("Créatinine (µmol/L)")
plt.title("Créatinine selon l'âge")
plt.show()
Résultat
Nuage de points de la créatinine selon l'âge, produit par matplotlib Nuage de points de la créatinine selon l'âge, produit par matplotlib

Explorer un jeu de données

Comme en R, quelques commandes reviennent au tout début d’une analyse pour comprendre les données :

patients.shape       # (nombre de lignes, nombre de colonnes)
patients.info()      # type et nombre de valeurs non manquantes par colonne
patients.describe()  # min, max, moyenne, quartiles des colonnes numériques

Ces trois lignes donnent une première image de la structure et de la qualité des données.

Ressources pour se former

OpenClassrooms — Apprenez les bases du langage Python
Type : Cours en ligne Langue : Français Coût : Gratuit (lecture) Durée : ~10 h Niveau : Grand débutant Prérequis : Aucun

Ce que vous allez apprendre

  • Les fondations du langage : variables, conditions, boucles, fonctions.
  • Parcours francophone accessible aux débutants complets, recommandé par nos étudiants.
  • Prévoyez plutôt une dizaine d’heures que les six annoncées si vous partez de zéro.
pandas — Getting started
Type : Tutoriels officiels Langue : Anglais Coût : Gratuit Durée : ~4 h Niveau : Débutant à intermédiaire Prérequis : Bases de Python

Ce que vous allez apprendre

  • Manipuler des tableaux (DataFrames) : sélectionner, filtrer, regrouper, calculer des statistiques.
  • Des tutoriels orientés cas d’usage (« comment sélectionner un sous-ensemble », « comment calculer des statistiques »).
matplotlib — Tutorials
Type : Tutoriels officiels Langue : Anglais Coût : Gratuit Durée : ~2 h Niveau : Débutant Prérequis : Bases de Python

Ce que vous allez apprendre

  • Construire ses premiers graphiques : nuages de points, courbes, histogrammes.
  • De nombreux exemples prêts à adapter à vos propres données.

Parcours conseillé pour Python

1. Apprenez le langage avec le cours OpenClassrooms (~10 h), en écrivant le code dans Google Colab (rien à installer). 2. Enchaînez sur pandas pour manipuler des tableaux, puis matplotlib pour visualiser. 3. Le machine learning viendra plus tard, dans la section dédiée à l’IA en santé — les cours d’introduction (comme celui d’Andrew Ng sur Coursera) suffisent largement pour commencer.

Python et Linkr

Une fois vos données extraites d’un entrepôt — au format OMOP par exemple —, Python et pandas sont un excellent choix pour prolonger l’analyse au-delà de ce que le Study Designer génère automatiquement. Les deux approches sont complémentaires : l’outil pour concevoir et cadrer, le code pour explorer sans limite.

  • Python est un langage généraliste et lisible, standard de la data science et dominant en machine learning.
  • pandas manipule des tableaux (DataFrames) ; matplotlib trace des graphiques — même logique que SQL et R, syntaxe différente.
  • On travaille souvent dans des notebooks Jupyter (ou Google Colab, dans le navigateur).
  • Ressources : le cours OpenClassrooms pour les bases, puis les tutoriels officiels pandas et matplotlib.
  • Les bases du code d'abord ; le machine learning ensuite, dans la section dédiée.
Aller plus loin : L'intelligence artificielle en santé

À propos de l'auteur

Voir le profil
Boris Delange
Boris Delange

Médecin réanimateur · AHU en informatique médicale

Médecin en Médecine Intensive - Réanimation de formation, j'exerce depuis 2023 comme Assistant Hospitalo-Universitaire en informatique médicale au Centre de Données Cliniques (CDC) du CHU de Rennes. Je suis également chercheur au LTSI (Université de Rennes), dans l'équipe DOMASIA (DOnnées MAssives et Systèmes d'Information Apprenants en santé).

À la jonction du soin et de la data science, j'ai créé Linkr pour relier cliniciens, data scientists, ingénieurs et étudiants en santé autour de l'analyse des données de santé.

Voir le profil LinkedIn Voir le profil ResearchGate

Produit

  • Accueil
  • Démo

Ressources

  • Documentation
  • Ressources
  • Outils
  • Blog

Communauté

  • Code source Framagit
  • Code source Github

À propos

  • InterHop.org
  • Contact

2021–2026 InterHop — CC BY-NC-SA 4.0 (site) · GPLv3 (logiciel)