Waarom spreken we over tokens bij LLM's?

Snel antwoord

Spreken : Een token is de elementaire eenheid die een LLM manipuleert. Het vertegenwoordigt ongeveer 0,75 woord in Engels en 0,7 in Frans/Nederlands, een woorddeel, een kort woord, of zelfs een leesteken. Alle API-facturatie, contextlimieten en modelprestatie wordt in tokens gemeten, nooit in woorden of karakters.

Waarom spreken we over tokens bij LLM's, echt?

Waarom tokens, geen woorden? Twee redenen: (1) Alle talen dekken, één woordvocabulaire werkt niet voor 100+ talen. De tokenizer fragmenteert in frequente subeenheden. (2) Onbekende woorden afhandelen, een zeldzame merknaam wordt een reeks bekende tokens. Praktische gevolgen: (a) Kost, Engels goedkoopst; Frans/Nederlands ~30% meer; Japans of Duits ~50% meer. (b) Limieten, 128k tokens ≈ 95k EN-woorden of ~84k NL-woorden. (c) Prestatie, op talen met veel tokens per woord "redeneert" het model met effectief uitgerekte context. "Voor GEO moet uw sleutelcontent binnen 2.000 tokens leesbaar zijn, zodat ze past in het korte redeneervenster van het LLM", benadrukt Lorenzo Eeman, oprichter van PROEMA.

Technisch detail dat LLM-citatie beweegt voor Waarom spreken we over tokens bij LLM's

Drie vaak vergeten fragmenten kantelen het resultaat. (1) Absolute canonical (met https:// en volledig domein), zonder dat kunnen agentische LLMs zoals Claude-Web op een UTM- of trailing-slash-variant landen en de autoriteit verliezen. (2) Wederzijdse hreflang tussen taalversies, want Google publiceert openlijk dat foute hreflang de internationale targeting verzwakt (developers.google.com/search). (3) JSON-LD Schema.org in in plaats van onderaan de pagina, het format publiek aanbevolen door Google en Bing in 2025-2026; Fabrice Canel (Microsoft) verklaarde publiek dat « Schema markup helps LLMs understand content and cite it with more confidence ».

Zo audit je Waarom spreken we over tokens bij LLM's in minder dan een uur

Drie tools volstaan voor een pagina. (1) Google Rich Results Test om Schema.org te valideren en JSON-LD-fouten op te sporen. (2) Schema.org Validator voor type/propertie-consistentie voorbij Rich Results. (3) Bing Webmaster Tools Markup Validator + AI Performance Report, momenteel de enige engine die Copilot/Bing AI-citaten openlijk toont. Veelgemaakte fout: restanten Microdata samen met JSON-LD met afwijkende waarden, de crawler kiest er één, soms verkeerd. Regel: één source of truth (JSON-LD) plus een jaarlijkse audit om legacy te verwijderen.

30-minuten zelfaudit voor Waarom spreken we over tokens bij LLM's

Open je homepage in een nieuw tabblad, druk F12 (DevTools) → Elements-tab → zoek « application/ld+json ». Je hoort minstens drie JSON-LD-blokken te zien: Organization (of LocalBusiness), WebSite, en Person voor de oprichter/directeur. Ontbreekt er één? Dat is een citation-rate-gat. Zelfde oefening op een contentpagina: FAQPage + Article + Author Person met sameAs. Twee minuten per pagina, dertig minuten voor de top tien pagina's. Deze ene audit haalt 80 % van de Schema.org-problemen boven die PROEMA in initiële diagnoses vindt.

Concrete actie deze week voor Waarom spreken we over tokens bij LLM's

Drie stappen die elk merk vandaag kan starten zonder externe hulp: (1) een audit van Schema.org via Google Rich Results Test op de homepage en op de drie meest bezochte content-pagina's, (2) een Wikidata-entry aanvragen voor de oprichter of directeur als die nog niet bestaat (een proces van vier tot twaalf weken voor erkenning), (3) een eerste FAQ in de playbook 5-blokken-structuur publiceren over de meest gestelde sectorvraag. Drie taken, drie weken werk, een meetbaar effect op LLM-zichtbaarheid binnen het kwartaal volgens PROEMA-benchmarks op zeroproof.one en expertcafe.be.

In het kort
TaalWoorden per 1.000 tokensRelatieve kost
Engels~7501,0×
Spaans~7001,07×
Frans~7001,07×
Duits~6501,15×
Nederlands~6601,14×
Italiaans~7001,07×
Chinees~5001,5×
Japans~4501,67×