Dans le contexte de l’IA, le terme « contexte » désigne l’ensemble des informations fournies à un modèle au moment où il génère une réponse. C’est la mémoire de travail immédiate du modèle : tout ce qu’il « voit » et « sait » à l’instant T pour produire sa sortie.
Cette notion est centrale, car un LLM n’a pas de mémoire persistante : il ne se souvient de rien entre deux appels. Tout ce qu’il doit savoir pour répondre doit être injecté dans son contexte.
Les composants du contexte
Le contexte d’un modèle d’IA est constitué de plusieurs éléments qui s’empilent dans la fenêtre de contexte :
- L’instruction système : les consignes générales qui définissent le rôle, le ton et les limites du modèle (ex : « Tu es un assistant juridique, réponds de manière formelle »).
- L’historique de conversation : les échanges précédents entre l’utilisateur et le modèle, qui permettent de maintenir la cohérence du dialogue.
- Le prompt actuel : la question ou la demande de l’utilisateur au moment présent.
- Les documents joints : les fichiers, extraits de texte ou données que l’utilisateur a fournis pour que le modèle s’appuie dessus (RAG, analyse de PDF, etc.).
- Les exemples : des démonstrations de ce qui est attendu (few-shot prompting).
La fenêtre de contexte
La fenêtre de contexte (ou context window) est la quantité maximale d’informations que le modèle peut traiter en une seule fois, mesurée en tokens. C’est une limite technique fondamentale :
Un modèle avec une fenêtre de 8 000 tokens ne peut traiter que l’équivalent d’environ 6 000 mots à la fois.
Les modèles récents (Claude, Gemini, GPT-4) offrent des fenêtres de 200 000 à 1 million de tokens, permettant d’analyser des livres entiers ou de longues bases de code.
Si le contexte dépasse la fenêtre, les informations les plus anciennes sont tronquées ou perdues, ce qui peut entraîner des erreurs ou des incohérences.
Le problème du « contexte perdu »
Un phénomène bien documenté est le « lost in the middle » : les modèles ont tendance à mieux se souvenir des informations situées au début et à la fin du contexte, et à ignorer celles du milieu. Cela signifie que placer une information cruciale au milieu d’un long contexte peut réduire ses chances d’être prise en compte.
L’impact économique
Le contexte a un coût direct : la plupart des API facturent par token d’entrée (le contexte) et par token de sortie (la réponse). Un contexte long coûte donc plus cher, et chaque échange dans une conversation rallonge le contexte, augmentant progressivement le coût de chaque nouvelle requête.
Analogie
Le contexte d’un modèle d’IA, c’est comme le bureau d’un employé qui n’a aucune mémoire à long terme. Chaque matin, on lui pose sur son bureau tous les documents dont il a besoin pour travailler : la note de service (instruction système), le dossier en cours (historique de conversation), la demande du client (prompt actuel), et les pièces jointes (documents fournis). Il ne peut travailler qu’avec ce qu’il voit sur son bureau. Si le bureau est trop petit, certains documents tombent par terre (troncature). Et si on empile trop de papiers, il risque de ne plus voir l’information importante cachée au milieu de la pile.
À retenir
Le contexte est l’espace de travail immédiat d’un modèle d’IA : c’est tout ce qu’il « voit » au moment de répondre. Sa taille est limitée (fenêtre de contexte), son contenu est facturé, et sa gestion est cruciale pour la qualité des réponses. Bien gérer le contexte (le rendre concis, pertinent et bien organisé) est devenu une compétence clé, appelée ingénierie de contexte (context engineering), complémentaire du prompt engineering.