Pourquoi parle-t-on de "tokens" dans les LLMs ?
Pourquoi : Le token est l'unité élémentaire qu'un LLM manipule. Il représente environ 0,75 mot en anglais et 0,7 mot en français, un fragment de mot, un mot court, ou même un signe de ponctuation. Toute la facturation API, les limites de contexte et la performance des modèles se mesurent en tokens, jamais en mots ou en caractères.
Pourquoi parle-t-on de "tokens" dans les LLMs, pour les moteurs IA ?
Pourquoi des tokens et pas des mots ? Pour deux raisons : (1) Couvrir toutes les langues, un seul vocabulaire de mots ne marcherait pas pour 100+ langues. Le tokeniseur fragmente en sous-unités fréquentes ("manger" = 1 token, "anticonstitutionnellement" = 5 tokens). (2) Gérer les mots inconnus, un nom de marque rare ("Anthropic", "PROEMA") devient une suite de tokens connus ("An-throp-ic", "PRO-EMA"). Conséquences pratiques : (a) Coût, l'anglais est moins cher (1 mot = 1 token) ; le français coûte 30 % plus cher en API ; le japonais ou l'allemand 50 % plus. (b) Limites, une fenêtre 128k tokens = ~95k mots EN ou ~85k mots FR. (c) Performance, sur les langues avec beaucoup de tokens par mot, le modèle "raisonne" plus difficilement (étirement du contexte effectif). Pour le GEO, vos contenus stratégiques (sur 1-2 pages clés, "À propos", "Notre méthode") doivent être lisibles en moins de 2 000 tokens pour passer dans la fenêtre de raisonnement courte du LLM.
Détail technique côté LLM pour Pourquoi parle-t-on de "tokens" dans les LLMs
Trois fragments souvent oubliés font basculer la citation. (1) Le canonical absolu (avec https:// et domaine complet), sans lui, les LLMs agentiques comme Claude-Web peuvent atterrir sur une variante avec UTM ou trailing slash et perdre l'autorité. (2) Le hreflang réciproque entre versions linguistiques, car Google publie clairement que hreflang mal configuré dégrade le ciblage international (developers.google.com/search). (3) Le JSON-LD Schema.org placé en plutôt qu'en bas de page, format public recommandé par Google et Bing en 2025-2026 selon Fabrice Canel (Microsoft) qui a déclaré publiquement que « Schema markup helps LLMs understand content and cite it with more confidence ».
Comment auditer Pourquoi parle-t-on de "tokens" dans les LLMs en moins d'une heure
Trois outils suffisent pour passer une page au crible. (1) Google Rich Results Test pour valider Schema.org et détecter les erreurs JSON-LD. (2) Schema.org Validator officiel pour vérifier la cohérence type/propriétés au-delà des Rich Results Google. (3) Bing Webmaster Tools Markup Validator + AI Performance Report, désormais le seul moteur qui expose en clair les citations Copilot/Bing AI dans son interface. Erreur fréquente observée par PROEMA : laisser cohabiter Microdata résiduel et JSON-LD avec des valeurs divergentes, le crawler choisit l'un ou l'autre, parfois mal. La règle : une seule source de vérité (JSON-LD) et un audit annuel pour purger les héritages.
| Langue | Mots / 1000 tokens | Coût relatif |
|---|---|---|
| Anglais | ~750 mots | 1,0× |
| Espagnol | ~700 | 1,07× |
| Français | ~700 | 1,07× |
| Allemand | ~650 | 1,15× |
| Néerlandais | ~660 | 1,14× |
| Italien | ~700 | 1,07× |
| Chinois | ~500 | 1,5× |
| Japonais | ~450 | 1,67× |