Discipline : Data engineering et analytics décisionnel
Valorisation éthique du patrimoine informationnel via collecte responsable, structuration sémantique (Clean Data) et indicateurs actionnables pour l’IA.
Clean Data, gouvernance des données, analytics décisionnel, data quality, JSON-LD, données multilingues, Omeka S
-
Data Warehouse – entrepôt de données
Système centralisé conçu pour stocker, organiser et historiser de grandes quantités de données structurées provenant de sources multiples, afin de faciliter l’analyse décisionnelle et la Business Intelligence (BI). Un Data Warehouse (ou entrepôt de données) est une architecture de stockage orientée sujet, intégrée, non volatile et historisée, spécifiquement conçue pour répondre aux besoins d’analyse stratégique…
-
Dataset FAIR
Données conçues pour être trouvées, comprises et réutilisées par des humains et des machines sans dépendre d’un intermédiaire centralisé. Un dataset FAIR n’est pas une théorie abstraite : c’est une manière pratique de préparer, documenter et partager des données pour qu’elles soient immédiatement utiles à vous, à vos collègues, à une API, ou à un…
-
Datavisualiseur
Un datavisualiseur est un outil ou une plateforme de visualisation de données orientées utilisateur, conçue pour transformer des ensembles de chiffres en graphiques clairs, accessibles et esthétiquement professionnels, sans nécessiter de compétences en codage. Il intègre nativement les bonnes pratiques de design informationnel (haut ratio data-encre, contraste adapté, hiérarchie visuelle) et respectent les normes d’accessibilité…
-
Données non-structurées
Données sans organisation prédéfinie ni modèle fixe. Elles ne se prêtent pas naturellement à une représentation tabulaire. Formats typiques Textes libres, images, vidéos, fichiers audio, PDF scannés, posts sur les réseaux sociaux. Exemples Avantages Très riches en information humaine, proches de l’usage réel. Inconvénients Difficiles à indexer, analyser ou relier sans outils spécialisés (NLP, vision…
-
Données numériques
Informations codées sous forme binaire, exploitables par des systèmes informatiques.
-
Données semi-structurées
Données qui contiennent des balises ou des marqueurs pour séparer les éléments, mais sans schéma imposé. Elles sont auto-descriptives. Formats typiques JSON, XML, YAML, fichiers de logs, emails au format MIME. Exemple JSON Avantages Flexibles, faciles à échanger entre systèmes (API web, microservices), adaptées aux données hiérarchiques ou évolutives. Inconvénients Moins optimisées pour les requêtes…
-
Données sensibles
Selon le Règlement Général sur la Protection des Données (RGPD), les données sensibles (ou données à caractère personnel « spécial ») sont des informations personnelles dont le traitement présente un risque élevé de discrimination ou d’atteinte aux droits fondamentaux de la personne. Elles sont définies à l’article 9 du RGPD et bénéficient d’un régime protecteur…
-
ETL
Abréviation pour Extract, Transform, Load (extraire, transformer, charger), soit les trois actions pour déplacer, migrer des données d’un système à un autre. Ce processus sert également à préparer les données collectées depuis un certain nombre de sources, les nettoyer , supprimer les doublons et les transformer avant de les centraliser sur le cloud ou un…
-
Flux ETL
Un flux ETL (Extract, Transform, Load) est l’ensemble automatisé des étapes qui permettent de faire circuler des données depuis leur source brute jusqu’à un système cible prêt à les utiliser par exemple pour l’analyse, la visualisation ou l’entraînement d’un modèle d’IA. Il se déroule en trois phases : Le mot « flux » souligne que…
-
Gouvernance des données
Ensemble de règles, processus, rôles et normes qui encadrent la qualité, la sécurité, la disponibilité, l’usage et le cycle de vie des données au sein d’une organisation. La gouvernance des données, c’est « la manière dont une organisation décide ce qu’elle fait de ses données ». Elle répond à des questions essentielles : Elle ne…