Flux ETL

Un flux ETL (Extract, Transform, Load) est l’ensemble automatisé des étapes qui permettent de faire circuler des données depuis leur source brute jusqu’à un système cible prêt à les utiliser par exemple pour l’analyse, la visualisation ou l’entraînement d’un modèle d’IA.

Il se déroule en trois phases :

  1. Extract (Extraire)
    → Récupérer les données depuis une ou plusieurs sources : bases de données, fichiers (CSV, JSON, XML), APIs, capteurs, logs, etc.
  2. Transform (Transformer)
    → Nettoyer, reformater, enrichir, relier, valider ou agréger les données.
    Exemples : corriger les fautes, uniformiser les dates, lier à Wikidata, anonymiser, convertir en RDF.
  3. Load (Charger)
    → Insérer les données transformées dans un système cible : entrepôt de données, base analytique, modèle d’IA, tableau de bord, CMS documentaire, etc.

Le mot « flux » souligne que ces opérations ne sont pas ponctuelles, mais souvent régulières, planifiées ou déclenchées automatiquement (ex. : chaque nuit, à chaque nouvelle ressource ajoutée).

Analogie simple

Un flux ETL, c’est comme préparer un repas à partir d’ingrédients bruts :

  • Tu vas au marché (extraction)
  • Tu laves, épluches, coupes, mélanges (transformation)
  • Tu sers le plat à table (chargement)
    Sans ce processus, les ingrédients restent inutilisables pour un repas cohérent.
Les contenus de définition restent publics. Les ressources (outils, grilles, supports) liées à cette fiche sont disponibles dans l’espace membre.