Intelligence Artificielle
Qu’est-ce que Tokenisation (NLP) ?
Processus qui découpe le texte brut en unités (tokens) comprises par le modèle — étape préalable à l’embedding et à la génération dans les pipelines de langage ; distinct du « token » billing API mais liée par le même découpage.
Définition simple
C'est comme découper une baguette en morceaux de tailles variables selon le guide du fabricant : ce n’est pas forcément chaque « mot » au sens école. Les tokenizer BPE/SentencePiece fusionnent syllabes fréquentes pour limiter vocabulaire tout en couvrant texte ouvert. La qualité tokenisation influence coût ([token](/lexique/token-llm)), fuites caractères rares et rend multilingue. Pour recherche classique hors LLM, on tokenise aussi différemment (stemming, n-grams) — ne pas tout confondre.
Comment ça marche ?
Normalisation unicode ; application vocabulaire appris ; IDs entiers ; masques spéciaux ; gestion inconnus. Multilingue : mêmes tokenizer peuvent partager sous-mots entre langues proches.
Impact business
Mauvaise anticipation tokens gonfle budgets et dépasse fenêtres contexte — pipelines qui pré-résument ou segmentent documents avant appel modèle économisent souvent 15 % à 40 % tokens sur corpus longs selon redondance.
Bonnes pratiques
- Utiliser tokenizer officiel du checkpoint ; tests unitaires tokens sur corpus métier ; surveillance outliers longueur suite ; pipelines prétraitement documentaires pour [RAG](/lexique/rag-retrieval-augmented-generation).
Erreurs communes
- Comparer longueurs prompts entre modèles sans tokenizer aligné. Ignorer cas emoji ou fuites PII dans tokens fragments.
Prompt IA
Contexte : français juridique avec accents rares. Liste trois effets tokenizer sous-optimal ; mitigation (normalisation unicode, découpage phrases).
SERVICE LIÉ
Passer de la définition à un projet concret.
Automatisation & IA
Approfondir ce sujet dans le cadre d’un accompagnement adapté à votre contexte.
À LIRE AUSSI
Guides plus complets sur le blog.
QUESTIONS FRÉQUENTES
Aller plus loin sur Tokenisation (NLP).
Certaines fuites splitées fragmentent données sensibles dans logs — filtrer amont et éviter logs prompts complets en prod publique.
Ratios tokens/français vs anglais diffèrent — budgétiser contexte par locale réelle utilisateurs.
Rare pour applis généralistes ; domaines très jargon peut pousser augmentations vocab ou fine-tuning tokenizer — coût technique élevé.
