Un flux ETL (Extract, Transform, Load) est l’ensemble automatisé des étapes qui permettent de faire circuler des données depuis leur source brute jusqu’à un système cible prêt à les utiliser par exemple pour l’analyse, la visualisation ou l’entraînement d’un modèle d’IA.
Il se déroule en trois phases :
- Extract (Extraire)
→ Récupérer les données depuis une ou plusieurs sources : bases de données, fichiers (CSV, JSON, XML), APIs, capteurs, logs, etc. - Transform (Transformer)
→ Nettoyer, reformater, enrichir, relier, valider ou agréger les données.
Exemples : corriger les fautes, uniformiser les dates, lier à Wikidata, anonymiser, convertir en RDF. - Load (Charger)
→ Insérer les données transformées dans un système cible : entrepôt de données, base analytique, modèle d’IA, tableau de bord, CMS documentaire, etc.
Le mot « flux » souligne que ces opérations ne sont pas ponctuelles, mais souvent régulières, planifiées ou déclenchées automatiquement (ex. : chaque nuit, à chaque nouvelle ressource ajoutée).
Analogie simple
Un flux ETL, c’est comme préparer un repas à partir d’ingrédients bruts :
- Tu vas au marché (extraction)
- Tu laves, épluches, coupes, mélanges (transformation)
- Tu sers le plat à table (chargement)
Sans ce processus, les ingrédients restent inutilisables pour un repas cohérent.