Discipline : Data engineering et analytics décisionnel

Valorisation éthique du patrimoine informationnel via collecte responsable, structuration sémantique (Clean Data) et indicateurs actionnables pour l’IA.
Clean Data, gouvernance des données, analytics décisionnel, data quality, JSON-LD, données multilingues, Omeka S

  • Pipeline ETL

    Un pipeline ETL (Extract, Transform, Load) est un processus automatisé qui permet de : Un pipeline ETL devient sophistiqué lorsqu’il intègre : Fonctionnalité Explication Gestion de schémas évolutifs Adapte la transformation même si les sources changent (ex. : nouveau champ dans une API) Nettoyage intelligent Corrige les fautes, normalise les formats (dates, noms de lieux),…

  • Ploty

    Ploty une bibliothèque open source utilisée pour créer des visualisations de données interactives et dynamiques Il peut être intégré avec plusieurs langages de programmation, notamment Python, R, MATLAB, et JavaScript Ploty offre également Dash, un framework basé sur Plotly pour créer des applications web analytiques interactives avec Python. Dash Ploty Ploty

  • Propriété

    Une propriété est un attribut ou caractéristique spécifique d’un objet numérique, utilisée pour décrire, classer, relier ou manipuler cet objet dans un système d’information (CRM, CMS, base de données, ontologie, graphes de connaissances, etc.). Elle se présente sous forme de paire clé-valeur : Dans les systèmes modernes : En web sémantique ou documentation numérique, les…

  • Protection des données personnelles

    La protection des données est l’ensemble des mesures techniques et organisationnelles mises en place pour protéger les données personnelles des individus contre les accès, les modifications, la destruction ou la divulgation non autorisés. Exemple de mesures : Anglais : Data protection; protection of personal data Lexique de la CNIL

  • Rapid API

    Hub donnant l’accès à plus de 40 000 APIs. Rapid Studio Rapidapi.com/learn

  • Streaming de données

    Mode de traitement informatique où les données sont analysées et utilisées au fur et à mesure qu’elles arrivent, sans être stockées au préalable contrairement au traitement par lots (batch). Imaginons un robinet d’eau qui coule en continu. Dans le numérique, cela signifie qu’on capte, filtre, enrichit et réagit à des données en temps réel, dès…

  • Système de fichiers distribué

    Un système de fichiers distribué est un moyen de gérer du stockage à grande échelle de façon fiable et collaborative, en répartissant les données sur un réseau d’ordinateurs Un système de fichiers distribué est comme une bibliothèque géante dont les livres sont répartis dans plusieurs bâtiments, mais que vous pouvez consulter depuis un seul endroit.…

  • Text mining

    Le text mining est le processus d’exploration et d’analyse de grands volumes de données textuelles afin d’en extraire des informations, des tendances et des relations significatives. Panorama d’outils couramment utilisés en text-mining Bibliothèques Python pour le text mining Modèles de traitement de langage naturel Plateformes d’analyse Synonyme : text analytics, fouille de texte, extraction de…

  • TMS

    Un système de gestion de balises, Tag Management System en anglais est une outil externe qui permet à partir d’un seul script JavaScript intégré sur vos pages Web d’insérer un ensemble d’autres scripts. Ces scripts de webanalyse (Google Analytics,…), suivi de conversion (Mautic, Floodlight…), média (Ad-Roll, Criteo..), A-B testing( Kameleoon, AB Tasty, Google Optimize…), marketing…

  • Webdata analyse

    La webdata analyse est l’analyse des données provenant de diverses sources sur le web :  sites web, réseaux sociaux, de forums, blogs, de médias en ligne. Elle peut nécessiter l’utilisation de techniques d’exploration de données, de webscraping, de fouille de texte avec le text mining ou text analytics, de bases de données avec le datamining,…