Intelligence Artificielle

Qu’est-ce que Tokenisation (NLP) ?

Processus qui découpe le texte brut en unités (tokens) comprises par le modèle — étape préalable à l’embedding et à la génération dans les pipelines de langage ; distinct du « token » billing API mais liée par le même découpage.

tokenization

Définition simple

C'est comme découper une baguette en morceaux de tailles variables selon le guide du fabricant : ce n’est pas forcément chaque « mot » au sens école. Les tokenizer BPE/SentencePiece fusionnent syllabes fréquentes pour limiter vocabulaire tout en couvrant texte ouvert. La qualité tokenisation influence coût ([token](/lexique/token-llm)), fuites caractères rares et rend multilingue. Pour recherche classique hors LLM, on tokenise aussi différemment (stemming, n-grams) — ne pas tout confondre.

Comment ça marche ?

Normalisation unicode ; application vocabulaire appris ; IDs entiers ; masques spéciaux ; gestion inconnus. Multilingue : mêmes tokenizer peuvent partager sous-mots entre langues proches.

Impact business

Mauvaise anticipation tokens gonfle budgets et dépasse fenêtres contexte — pipelines qui pré-résument ou segmentent documents avant appel modèle économisent souvent 15 % à 40 % tokens sur corpus longs selon redondance.

Bonnes pratiques

  • Utiliser tokenizer officiel du checkpoint ; tests unitaires tokens sur corpus métier ; surveillance outliers longueur suite ; pipelines prétraitement documentaires pour [RAG](/lexique/rag-retrieval-augmented-generation).

Erreurs communes

  • Comparer longueurs prompts entre modèles sans tokenizer aligné. Ignorer cas emoji ou fuites PII dans tokens fragments.

Prompt IA

Contexte : français juridique avec accents rares. Liste trois effets tokenizer sous-optimal ; mitigation (normalisation unicode, découpage phrases).

QUESTIONS FRÉQUENTES

Aller plus loin sur Tokenisation (NLP).

Certaines fuites splitées fragmentent données sensibles dans logs — filtrer amont et éviter logs prompts complets en prod publique.