Un outil d’ingestion de données (ou data ingestion tool) est un logiciel qui automatise le processus de collecte et de transfert de données depuis des sources variées (bases de données, applications, fichiers, IoT, etc.) vers un système de stockage centralisé comme un lac de données (data lake) ou un entrepôt de données (data warehouse)
Outils open source polyvalents
Ces outils sont gratuits et auto-hébergés, ce qui vous donne un contrôle total mais demande des compétences techniques pour leur déploiement et leur maintenance.
Lotos : un véritable framework ETL (Extract, Transform, Load) complet. On définit ses pipelines en fichiers YAML, ce qui rend la configuration claire, versionnable et sans code . Il inclut des fonctionnaliques avancées comme la gestion des dépendances entre pipelines, des contrôles de qualité des données ou encore un serveur de métriques Prometheus. Idéal pour des projets d’ingestion ambitieux et auto-hébergés.
Ingestr : application en ligne de commande qui promet de copier des données « de n’importe quelle source vers n’importe quelle destination sans code ». Il suffit d’une commande unique pour ingérer une table Postgres vers BigQuery par exemple. Parfait pour des tâches simples ou du prototypage rapide.
DataSpoc Pipe : spécialisé dans la conversion de données vers le format Parquet, très efficace pour l’analyse. Un de ses atouts est de pouvoir être contrôlé par des agents d’IA via le protocole MCP . Excellent choix pour nourrir un data lake dans le cloud (AWS S3, GCS, Azure).