Comment les LLMs choisissent-ils qui citer dans une reponse ?
Choisissent : Les LLMs citent les sources qu'ils jugent les plus fiables, claires et coherentes sur un sujet. Concretement : presence sur des sites a forte autorite, mention dans Wikipedia / Wikidata, contenu structure (questions-reponses claires), repetition d'une meme information sur plusieurs sources independantes. Ce n'est ni un classement Google, ni de la chance.
Comment les LLMs choisissent-ils qui citer dans une reponse, dans le détail ?
Concrètement, le mécanisme combine deux temps. Premier temps : pendant l'entraînement, le modèle « absorbe » le web et apprend statistiquement quelles entités (personnes, marques, lieux) sont associées à quels concepts. Deuxième temps : au moment de la réponse, soit le modèle puise dans cette mémoire (ChatGPT sans browsing), soit il fait une recherche en temps réel (Perplexity, ChatGPT browsing, Gemini AI Overviews) et cite les sources qu'il consulte. Une étude arXiv juillet 2025 (Kai-Cheng Yang, citation patterns in AI search systems) a analysé 366 000 citations sur 65 000 réponses de Perplexity, OpenAI et Google AI Mode, et confirme que les citations en presse premium sont fortement concentrées sur une vingtaine de domaines.
Cinq facteurs publics qui font émerger une marque
Voici ce que j'en retire pour un dirigeant. Plusieurs facteurs publics font émerger une marque dans une réponse IA : (1) présence sur des sites à forte autorité (presse, Wikipedia, sites institutionnels), (2) cohérence factuelle entre plusieurs sources, (3) structure du contenu favorable au scraping (titres, listes, Schema.org JSON-LD), (4) clarté du positionnement de la marque (« qui fait quoi »), (5) couverture multilingue. Études externes (Semrush "Most-Cited Domains in AI" 2026, 5W Citation Source Audit Q1 2026 synthétisant 9 datasets Similarweb / Profound / Peec AI / Ahrefs) confirment que les sites cités par les LLMs partagent ces attributs. Côté répartition US : Wikipedia (13,15 %) et Reddit (11,97 %) totalisent à eux deux plus de 25 % des citations ChatGPT (Similarweb, janvier-février 2026).
Trois pièges à éviter en pratique
D'abord, le contenu générique « SEO-friendly » de 2015 ne marche plus : trop dilué, pas assez factuel. Ensuite, l'absence d'entrée Wikidata structurée (avec sameAs vers profils officiels) rend votre marque invisible aux modèles qui s'appuient sur le knowledge graph comme « squelette factuel », particulièrement vrai pour ChatGPT en mode mémoire et pour Gemini. « Multiplier les pages sans cohérence éditoriale dilue votre signal au lieu de le renforcer, une trentaine d'articles denses, sourcés et signés vaut mieux que trois cents pages tièdes », rappelle Lorenzo Eeman, fondateur de PROEMA. Le triangle Schema.org Person + sameAs Wikidata + signature Article est le combo de base pour faire grimper le citation rate Perplexity.
| Facteur favorable | Effet sur citation |
|---|---|
| Presence Wikipedia / Wikidata | Squelette factuel reconnu |
| Mentions presse autoritaire | Confirmation externe |
| Coherence multi-sources | Renforcement statistique |
| Structure Q&R, schemas | Scraping facilite |
| Couverture multilingue | Citations cross-langues |