Intelligibilité IA

L’Intelligibilité Algorithmique ou Intelligibilité IA), en particulier dans le contexte du traitement de l’information et du Web sémantique, désigne la capacité d’un système informatique ou d’un grand modèle de langage (LLM) à saisir le sens profond, la structure logique et l’intention d’un contenu, au-delà de sa simple capture technique.

L’intelligibilité repose sur la capacité de l’algorithme à résoudre trois défis majeurs de la science du langage et de l’architecture de l’information :

1. La désambiguïsation sémantique

Une machine face à un mot polysémique (qui a plusieurs sens) doit déterminer le bon sens grâce à l’environnement textuel.

Exemple : Si le texte mentionne le mot « Avocat », l’algorithme doit analyser les mots limitrophes (« tribunal », « plaidoirie » vs « salade », « crevette ») pour attribuer le bon concept. Une haute intelligibilité algorithmique empêche le contresens.

2. La reconnaissance et le liage d’Entités Nommées (NER / NEL)

Il ne s’agit plus seulement de voir des chaînes de caractères (des strings), mais de reconnaître des entités du monde réel (des things).

Reconnaissance : identifier que « Lyon », « Pierre » ou « Gutenberg » ne sont pas des noms communs.

Liage (Linking) : connecter ces mots à un nœud précis d’un graphe de connaissances (comme Wikidata). Savoir que « Lyon » dans le texte fait référence à la ville en France (Q3564) et non à la ville de Lyon dans le Mississippi.

3. La captation du contexte (sémantique globale)

C’est la capacité de l’algorithme à maintenir une cohérence tout au long d’un document ou d’une session. Cela inclut la résolution des anaphores (comprendre à quoi renvoie le pronom « il » ou « celle-ci » trois phrases plus bas) et la détection du ton (ironie, jargon professionnel, rigueur scientifique).

Avant de choisir un outil

Avant de choisir un outil, la règle d’or de l’intelligibilité est de parler la même langue que les algorithmes.

  • Le format standard : JSON-LD (JavaScript Object Notation for Linked Data). C’est le format recommandé par Google et le W3C. Il s’agit d’un bloc de code invisible pour l’humain, injecté dans la page, qui liste les entités et leurs relations.
  • Le dictionnaire de référence : Schema.org. Une ontologie collaborative qui fournit les étiquettes standardisées (par exemple, pour dire « Auteur », on utilise explicitement la propriété author).

Pour un site Web

Dans un CMS moderne orienté contenu, l’objectif est d’automatiser la structure de base tout en gardant un contrôle chirurgical sur les entités complexes.

Les Outils

  • Les extensions SEO avancées (Rank Math, SEOPress, Yoast) : Idéales pour générer automatiquement le schéma de base (Articles, Organisation, Fil d’Ariane, FAQ).
  • Les extensions dédiées au Schéma (ex: Schema & Structured Data for WP, ou injection manuelle) : pour l’approche « Gutenberg-First », ces outils permettent d’associer des blocs de contenu visuels à des blocs de données JSON-LD spécifiques (Recettes, Événements, Certifications).
  • Les champs personnalisés (ACF – Advanced Custom Fields) : Pour créer des gabarits de données stricts (par exemple, un type de contenu « Livre » avec des champs fixes pour l’éditeur).

Comment le mettre en place ?

  1. Cartographier l’arbre des entités : Ne pas se contenter de baliser un texte comme un simple « Article ». Qui l’a écrit ? (Entité Person). De quoi parle-t-il ? (Propriété about liée à une autre entité).
  2. Utiliser la propriété sameAs (Le liage d’entités) : C’est l’étape cruciale pour la désambiguïsation sémantique. Dans votre JSON-LD, chaque fois que vous nommez une entité ambiguë, liez-la à son identifiant unique universel (généralement son URL Wikidata ou Wikipedia).

Pour un projet d’archivage ou de bibliothèque numérique (ex: Omeka S)

Si l’enjeu est la préservation culturelle, la documentation ou la gestion de catalogues complexes, les CMS classiques atteignent leurs limites. Il faut passer à une plateforme nativement sémantique.

L’Outil Roi : Omeka S

Contrairement à d’autres plateformes, Omeka S a été conçu dès le départ pour le Web sémantique (Linked Open Data). Il n’ajoute pas une couche sémantique par-dessus le code ; il stocke la donnée directement sous forme de triplets RDF (Ressource -> Propriété -> Valeur) et expose nativement son API en JSON-LD.

Comment le mettre en place ?

  1. Sélectionner les vocabulaires (Ontologies) : À l’installation, activez les standards internationaux adaptés à votre domaine :
    • Dublin Core (pour les propriétés générales : titre, créateur, date).
    • Bibo (pour les données bibliographiques).
    • FOAF (Friend of a Friend, pour décrire les personnes et leurs relations).
  2. Créer des Modèles de Ressources (Resource Templates) : Configurez des masques de saisie stricts pour vos contributeurs. Par exemple, pour un document d’archive, imposez l’utilisation de dcterms:creator pour l’auteur et interdisez le texte libre là où une entité liée est requise.
  3. Exploiter les modules de suggestion et d’autocomplétion (ex: Value Suggest ou Data Type RDF) : Ces modules permettent, lors de la saisie d’un nom propre par un archiviste, de requêter en temps réel des référentiels d’autorité extérieurs (IdRef, GeoNames, Wikidata) pour lier directement la ressource au Web de données.

Comment valider l’intelligibilité IA ?

Une fois la structure en place, il faut vérifier si les robots la comprennent correctement. N’attendez pas que les crawlers passent pour savoir si le travail est bien fait.

  • Validator.schema.org : L’outil officiel de la communauté pour tester la pureté syntaxique et logique de votre code sémantique. Il affiche l’arbre des entités tel qu’un algorithme le perçoit.
  • L’outil de test des résultats enrichis de Google (Rich Results Test) : Pour vérifier la conformité du balisage vis-à-vis des exigences spécifiques des moteurs de recherche.
  • La console de développement de votre navigateur (DevTools) : Pour inspecter si vos scripts JSON-LD s’injectent proprement au bon moment, notamment lors d’architectures basées sur des blocs dynamiques.
Les contenus de définition restent publics. Les ressources (outils, grilles, supports) liées à cette fiche sont disponibles dans l’espace membre.