Données, information et contenus

Lexique de la data – Données brutes, informations structurées, contenus éditorialisés : ces trois niveaux forment l’épine dorsale de tout système numérique. Cette thématique explore comment l’information est capturée, nommée, liée, publiée et rendue utile — ou au contraire, exploitée. Elle met l’accent sur la structuration sémantique, la réutilisabilité et la souveraineté des contenus.

Définitions associées

  • Data lake

    Un data lake (« lac de données ») est une architecture de stockage à faible coût, hautement scalable et orientée données brutes. Contrairement aux entrepôts de données (data warehouses), qui imposent un schéma rigide dès l’ingestion, le data lake stocke les données « telles quelles », sans transformation préalable, permettant ainsi une exploration ouverte, des…

  • Data mining – exploration de données

    Processus d’analyse automatisée ou semi-automatisée de grands volumes de données brutes afin d’y détecter des structures cachées, des corrélations, des tendances, des anomalies ou des modèles exploitables. Le data mining (ou exploration de données) est une discipline à l’intersection de la statistique, de l’informatique et de l’intelligence artificielle. Il consiste à appliquer des algorithmes d’apprentissage…

  • Data Science

    La data science (ou science des données) est une discipline interdisciplinaire qui vise à extraire, analyser, interpréter et communiquer des connaissances à partir de données, souvent massives ou complexes. Elle combine des méthodes statistiques, des techniques d’apprentissage automatique (machine learning), de la programmation (Python, R, SQL, etc.) et une compréhension du domaine métier pour transformer…

  • Data Scientist

    Le data scientist est un expert qui utilise des techniques avancées de machine learning et de deep learning pour développer des modèles prédictifs complexes, met en place des automatisations de processus d’analyse C’est un scientifique avec une solide compréhension des statistiques, de la programmation et des domaines spécifiques de l’analyse des données. Voir aussi :…

  • Data Warehouse – entrepôt de données

    Système centralisé conçu pour stocker, organiser et historiser de grandes quantités de données structurées provenant de sources multiples, afin de faciliter l’analyse décisionnelle et la Business Intelligence (BI). Un Data Warehouse (ou entrepôt de données) est une architecture de stockage orientée sujet, intégrée, non volatile et historisée, spécifiquement conçue pour répondre aux besoins d’analyse stratégique…

  • Données numériques

    Informations codées sous forme binaire, exploitables par des systèmes informatiques. Explorer les thématiques : Données, information & contenus

  • Données semi-structurées

    Données qui contiennent des balises ou des marqueurs pour séparer les éléments, mais sans schéma imposé. Elles sont auto-descriptives. Formats typiques JSON, XML, YAML, fichiers de logs, emails au format MIME. Exemple JSON Avantages Flexibles, faciles à échanger entre systèmes (API web, microservices), adaptées aux données hiérarchiques ou évolutives. Inconvénients Moins optimisées pour les requêtes…

  • Données sensibles

    Selon le Règlement Général sur la Protection des Données (RGPD), les données sensibles (ou données à caractère personnel « spécial ») sont des informations personnelles dont le traitement présente un risque élevé de discrimination ou d’atteinte aux droits fondamentaux de la personne. Elles sont définies à l’article 9 du RGPD et bénéficient d’un régime protecteur…

  • Enrichissement de données

    L’enrichissement de données est le processus qui consiste à compléter, corriger ou créer de nouvelles données. Explorer les thématiques : Données, information & contenus

  • ETL

    Abréviation pour Extract, Transform, Load (extraire, transformer, charger), soit les trois actions pour déplacer, migrer des données d’un système à un autre. Ce processus sert également à préparer les données collectées depuis un certain nombre de sources, les nettoyer , supprimer les doublons et les transformer avant de les centraliser sur le cloud ou un…

À quoi ça sert / Pour qui

À transformer des flux chaotiques en ressources documentaires exploitables, interopérables et pérennes.
Pour les documentalistes, archivistes numériques, concepteur·rices de bases de connaissances, équipes culturelles, développeur·ses sensibles au web sémantique, ou toute personne travaillant à la description ou à la diffusion de savoirs.

Repères

  • Domaines concernés : Data & analytics, Architecture de l’information, Expérience utilisateur, Écoconception
  • Types de concepts associés :
    • Concept (ex. Donnée, Information, Contenu, Métadonnée)
    • Format (ex. JSON-LD, XML, CSV, RDF)
    • Technologie (ex. Knowledge graph, API de contenu)
    • Pratique (ex. Documentation sémantique, Enrichissement contextuel)
    • Méthode (ex. Modélisation d’ontologie, Cartographie documentaire)
  • Rôles liés :
    • Gestionnaire de contenu
    • Documentaliste numérique
    • Architecte de l’information
    • Développeur·se sémantique
    • Référent·e données ouvertes
  • Niveau d’appropriation recommandé :
    Découverte → Compréhension → Application → Structuration → Maîtrise opérationnelle

Aller plus loin

Thématiques proches

• Web sémantique et données liées
• Gestion documentaire résiliente
• Architecture de l’information
• Sobriété documentaire

Domaines liés

• Data & analytics
• Architecture de l’information
• Expérience utilisateur
• Écoconception

Définitions connexes

• Donnée – Concept
• Métadonnée – Concept
• JSON-LD – Format
• Knowledge graph – Technologie
• CMS – Plateforme
• Ontologie – Modèle
• Schema.org – Standard
• Enrichissement sémantique – Pratique

FAQ

Pourquoi structurer les contenus avec JSON-LD plutôt que laisser faire Google ?

Parce que structurer soi-même, c’est garder la main sur le sens donné à ses contenus. JSON-LD permet de décrire explicitement qui, quoi, où, quand — sans dépendre des algorithmes opaques de reconnaissance automatique.

Un knowledge graph, c’est réservé aux géants du web ?

Non. Un graph de connaissances peut être petit, local et maîtrisé : un musée, une association, un projet pédagogique peuvent modéliser leurs entités (personnes, œuvres, lieux) et leurs relations pour permettre une navigation intelligible et non linéaire.