Token de pensée

Un token de pensée (ou « thinking token ») est un token généré par un modèle de raisonnement (LRM) lors de sa phase de réflexion interne, avant qu’il ne produise sa réponse finale visible.

C’est un élément central du fonctionnement des modèles comme o1 ou Claude, qui « réfléchissent » en générant une chaîne de raisonnement intermédiaire, souvent masquée à l’utilisateur mais facturée comme des tokens de sortie.

Caractéristiques principales

Nature et fonction : ces tokens servent à « réfléchir » à voix haute : reformuler le problème, explorer des pistes, vérifier des résultats intermédiaires, abandonner des impasses, ou marquer des transitions. Ils sont produits avant la réponse finale et font partie intégrante du processus de raisonnement du modèle.

Invisibilité et facturation : sur la plupart des interfaces, ces tokens ne sont pas visibles pour l’utilisateur, ou seulement sous forme de résumé. Cependant, ils sont facturés comme des tokens de sortie, car ils consomment des ressources de calcul. Un modèle de raisonnement peut générer des milliers de tokens de pensée pour une seule requête, contre quelques centaines pour un modèle classique .

Contrôle du budget : les développeurs peuvent contrôler le nombre de tokens de pensée alloués via des paramètres comme reasoning.max_tokens ou budget_tokens. Cela permet d’ajuster le compromis entre profondeur de raisonnement, coût et latence.

Ce que la recherche révèle

Des études récentes montrent que tous les tokens de pensée ne se valent pas :

Tokens de « réflexion profonde » : certains tokens, comme « Attends », « Hmm », « Donc », ou « So », marquent des moments de révision significative dans les couches profondes du modèle. Ces « deep-thinking tokens » sont bien plus corrélés à l’exactitude de la réponse finale que le simple nombre de tokens générés .

Indicateurs précoces de difficulté : l’entropie du tout premier token d’une étape de raisonnement peut prédire sa difficulté, ce qui permet de router les étapes simples vers des modèles légers et de réserver les modèles plus puissants aux étapes complexes .

Analogie

Un token de pensée, c’est comme une phrase que vous murmurez pour vous-même en réfléchissant à un problème complexe. Vous ne dites pas encore la réponse à voix haute, mais vous essayez des pistes, vous vous corrigez, vous vous dites « attends, vérifions ce calcul ». Ces murmures ne sont pas la réponse finale, mais ils sont indispensables pour y arriver. Le modèle fait la même chose : il génère ces tokens de réflexion pour lui-même, avant de formuler sa réponse.

À retenir

Les tokens de pensée sont le mécanisme central des modèles de raisonnement. Ils permettent au modèle de « penser » avant de répondre, améliorant ainsi la qualité sur les tâches complexes. Leur coût est réel (ils sont facturés), mais ils sont de plus en plus étudiés pour optimiser le compromis entre performance, latence et dépense.

Les contenus de définition restent publics. Les ressources (outils, grilles, supports) liées à cette fiche sont disponibles dans l’espace membre.