En résumé
Programmer, c’est écrire une suite d’instructions qu’un ordinateur exécute pas à pas. Avant d’aborder un langage précis, quelques notions universelles suffisent : la variable (une étiquette sur une valeur), la fonction (une action réutilisable), la condition et la boucle. Cet article explique aussi où l’on écrit du code, avec quels logiciels, et comment on l’exécute. Aucune connaissance préalable n’est nécessaire.
Cet article s’adresse à celles et ceux qui n’ont jamais écrit une ligne de code. Si vous avez déjà quelques notions, vous pouvez passer directement à l’introduction au SQL. Sinon, prenez le temps de lire ce qui suit : les concepts présentés ici se retrouvent à l’identique en SQL, R et Python.
Qu’est-ce que « programmer » ?
Programmer, c’est donner des instructions à un ordinateur, dans un langage qu’il comprend, pour qu’il réalise une tâche à votre place. Une recette de cuisine en est une bonne image : une liste d’étapes, exécutées dans l’ordre, qui transforment des ingrédients en plat.
La différence avec un logiciel classique (comme un tableur) : au lieu de cliquer sur des boutons, vous écrivez les étapes. L’ordinateur les exécute exactement comme vous les avez écrites — ni plus, ni moins. C’est déroutant au début, mais c’est aussi ce qui rend le code reproductible : la même recette redonne toujours le même plat.
Un ordinateur est très obéissant, mais pas malin
Il fait précisément ce qu’on lui dit. Une virgule oubliée ou un mot mal orthographié, et il s’arrête avec un message d’erreur. Ce n’est pas grave : lire les erreurs et corriger fait partie du métier.
Le vocabulaire de base
Quatre notions reviennent dans tous les langages. Les exemples ci-dessous sont écrits en Python parce que sa syntaxe est proche du langage courant, mais l’idée est la même partout.
La variable
Une variable est une étiquette que l’on colle sur une valeur pour la réutiliser. On la crée en lui donnant un nom et une valeur.
age = 72 # on range 72 dans une variable nommée "age"
nom = "Dupont" # une variable peut contenir du texte
age = age + 1 # on peut la modifier : age vaut maintenant 73
Le nom est libre (choisissez-le parlant : age, creatinine, nb_patients). Le signe = ne veut pas dire « égal » au sens mathématique, mais « range la valeur de droite dans la variable de gauche ».
La fonction
Une fonction est une action réutilisable, à laquelle on donne des valeurs (les arguments) et qui renvoie un résultat. Vous en utiliserez bien plus que vous n’en écrirez.
# "round" est une fonction fournie par le langage : elle arrondit un nombre
resultat = round(3.14159, 2) # on lui donne 3.14159 et 2 (décimales)
print(resultat) # affiche 3.14
Ici round(...) et print(...) sont des fonctions. On reconnaît une fonction à ses parenthèses, qui contiennent ce qu’on lui donne. print sert à afficher un résultat à l’écran.
La condition
Une condition exécute du code seulement si quelque chose est vrai. C’est le mot if (« si »).
temperature = 38.6
if temperature >= 38:
print("Fièvre")
else:
print("Pas de fièvre")
La boucle
Une boucle répète une action sur chaque élément d’une liste, sans avoir à réécrire le code. C’est le mot for (« pour chaque »).
ages = [72, 45, 34, 78]
for a in ages: # pour chaque valeur de la liste...
print(a) # ...on l'affiche
Vous n'écrirez pas beaucoup de boucles
En analyse de données, on manipule des tableaux entiers d’un coup (« calcule la moyenne de cette colonne ») plutôt que ligne par ligne. Les boucles restent utiles à connaître, mais les langages comme SQL, R et Python vous évitent d’en écrire pour la plupart des tâches courantes.
Où écrit-on du code ?
Une question qui déroute souvent les débutants : concrètement, je tape ça où ? Deux endroits, complémentaires.
La console (ou terminal)
La console est une zone où l’on tape une instruction à la fois ; elle s’exécute dès qu’on appuie sur Entrée, et le résultat s’affiche juste en dessous. Idéale pour tester rapidement une idée ou explorer des données.
Le script
Un script est un fichier qui contient toute la suite d’instructions, sauvegardée. On l’écrit dans un éditeur, puis on l’exécute en entier (ou morceau par morceau). C’est ce qu’on garde, ce qu’on partage, ce qu’on relance à l’identique — le cœur de la reproductibilité.
Console pour explorer, script pour garder
En pratique, on tâtonne dans la console, puis on recopie ce qui marche dans un script pour le conserver. Un projet d’analyse, c’est un ou plusieurs scripts qu’on peut rejouer du début à la fin.
Avec quels logiciels ?
On écrit rarement du code dans un simple bloc-notes. On utilise un environnement de développement, ou IDE (de l’anglais Integrated Development Environment) : un logiciel qui réunit dans une même fenêtre l’éditeur de scripts, la console, l’affichage des résultats et de l’aide. Selon le langage :
Pour le SQL
Un outil connecté à la base (DBeaver, l’interface de PostgreSQL…) ou, pour s’entraîner, un tutoriel dans le navigateur — comme nos tutoriels OMOP.
Pour le R
RStudio, gratuit, est l’environnement de référence. Éditeur, console, graphiques et aide dans une seule fenêtre. Son éditeur, Posit, propose aussi Positron, un environnement plus récent qui gère R et Python.
Pour le Python
Un notebook Jupyter ou l’éditeur VS Code.
Le notebook : code, résultats et texte au même endroit
Un notebook (Jupyter) est un document qui alterne des cellules de code, leurs résultats (tableaux, graphiques) et du texte explicatif. On exécute une cellule d’un raccourci clavier et le résultat s’affiche juste en dessous. C’est le format le plus confortable pour débuter et pour partager une analyse commentée.
Comment installer et exécuter ?
Deux chemins, du plus simple au plus complet :
- Sans rien installer. Des environnements en ligne exécutent le code dans votre navigateur, comme les tutoriels interactifs pour SQL. Parfait pour les premiers pas. La démo en ligne de Linkr en fait partie : depuis l’IDE d’un projet, vous écrivez et exécutez du R, du Python ou du SQL directement sur des données de santé d’exemple.
- En installant sur votre ordinateur. On installe le langage (R, ou Python) puis son environnement (RStudio, VS Code). C’est indispensable dès qu’on travaille sur ses propres données. Les articles suivants indiquent les ressources pour chaque installation.
Pour exécuter du code, le geste est presque toujours le même : placer le curseur sur une ligne ou sélectionner un bloc, puis appuyer sur Ctrl + Entrée (ou ⌘ + Entrée sur Mac). Le résultat apparaît dans la console ou sous la cellule.
Et les données, dans tout ça ?
Programmer pour la data science, c’est surtout manipuler des tableaux de données. Il est donc utile de comprendre comment ces données sont organisées avant de les coder : lignes, colonnes, tables reliées entre elles, format long et format large. Nous détaillons tout cela dans l’article Comment sont organisées ces données — une lecture complémentaire idéale avant d’attaquer le SQL.
Une ressource pour s’initier en douceur
Si vous voulez un vrai premier cours pas à pas avant de continuer, celui-ci reprend les notions de cet article sans s’attacher à un langage particulier. Les articles suivants (SQL, R, Python) proposent d’autres ressources ciblées par langage.
Ce que vous allez apprendre
- La logique de programmation, indépendamment de tout langage : variables, conditions, boucles, fonctions.
- Les types de données et les structures qui les contiennent (listes, tableaux).
- La dernière partie (tri, complexité, récursivité) va au-delà de ce qu’il faut pour analyser des données : elle est facultative.
- Programmer, c'est écrire des instructions exécutées pas à pas ; l'ordinateur fait exactement ce qu'on lui dit.
- Quatre notions universelles : la variable (une étiquette sur une valeur), la fonction (une action réutilisable), la condition (
if) et la boucle (for). - On écrit du code dans une console (une instruction à la fois, pour explorer) et dans un script (un fichier qu'on garde et qu'on rejoue).
- On utilise un environnement adapté : RStudio pour R, un notebook Jupyter ou VS Code pour Python.
- On peut commencer sans rien installer grâce aux environnements en ligne, puis installer les outils sur son ordinateur.
- Comprendre l'organisation des données est le complément naturel de ces bases.