Tokenization (tokenisation)
La tokenisation est le processus de découpage du texte en unités plus petites, les tokens. Un token peut être un mot entier, une partie de mot ou un seul caractère. Cette tokenisation est une étape de prétraitement nécessaire avant qu'un modèle de langage puisse traiter du texte, et détermine en partie la façon dont les contenus sont saisis ainsi que le calcul des coûts et de la longueur de contexte.
Également connu sous : tokenisation, tokenization, tokeniseur
Qu'est-ce que la tokenisation ?
La tokenisation décrit le découpage du texte en éléments qu’un Modèle de langage peut traiter. Ces éléments s’appellent Token et peuvent, selon la méthode, être de tailles diverses : des caractères isolés aux mots entiers en passant par des parties de mots. Les modèles ne travaillent pas directement avec des lettres ou des mots au sens humain mais avec ces tokens.
La tokenisation est ainsi le pont entre la langue humaine et la représentation interne du modèle. Chaque texte d'entrée est d'abord converti en tokens, qui sont ensuite transformés en représentations numériques et traités par le modèle.
Le composant qui effectue ce découpage s'appelle le tokeniseur. Il dispose d'un vocabulaire fixé de tokens connus et d'un ensemble de règles selon lesquelles un texte inconnu est traduit dans ce vocabulaire. Vocabulaire et règles sont développés avec le modèle et restent cohérents sur toute sa durée de vie, afin que l'entraînement et l'usage ultérieur parlent la même langue.
Comment fonctionne la tokenisation ?
Les modèles de langage modernes emploient le plus souvent des méthodes qui découpent les mots en parties fréquentes. Les mots courants sont alors souvent représentés par un seul token, tandis que les termes plus rares ou composés se scindent en plusieurs sous-tokens. Une grande diversité linguistique se couvre ainsi même avec un vocabulaire maîtrisable.
Un exemple parlant : un mot court et fréquent peut correspondre exactement à un token, tandis qu'un long terme technique se scinde en plusieurs. Espaces, ponctuation et caractères spéciaux sont aussi pris en compte dans la tokenisation. La méthode concrète employée par un modèle fait partie de son architecture et influence l'efficacité du traitement des différentes langues.
Le grand avantage de ce découpage en parties de mots tient à ce que des termes totalement inconnus peuvent aussi être traités. Même si un mot n'est jamais apparu, il se compose à partir de briques connues. Le vocabulaire reste ainsi d'une taille maniable, sans que le modèle bute sur des mots rares ou nouvellement formés, par exemple des noms propres, termes techniques ou mots composés.
Tokenisation, coûts et longueur de contexte
Les tokens sont l'unité de calcul de beaucoup de modèles de langage. L'entrée comme la sortie se mesurent en tokens, et c'est souvent là-dessus que se fonde la facturation des modèles commerciaux. Qui comprend la tokenisation peut mieux estimer les besoins en ressources d'une application.
Également la longueur de contexte d’un modèle est indiquée en tokens. La fenêtre de contexte détermine combien de tokens un modèle peut prendre en compte à la fois. Des textes longs ou des langues tokenisées de façon inefficace consomment plus de tokens et donc plus du contexte disponible. Une tokenisation efficace importe donc autant pour les coûts que pour la longueur de texte utilisable.
En pratique, il vaut la peine de piloter sciemment la consommation de tokens. Des entrées formulées de façon concise et claire, l'absence de répétitions inutiles et une structuration réfléchie de documents volumineux peuvent nettement la réduire. Sur des applications à fort volume, ces économies s'additionnent, de sorte qu'une conception efficace des entrées pèse directement sur la rentabilité.
La tokenisation de différentes langues
Toutes les langues ne se tokenisent pas avec la même efficacité. Comme beaucoup de tokeniseurs sont développés sur des corpus où certaines langues sont plus représentées, celles-ci se codent souvent avec moins de tokens par mot. D'autres langues, plus rares dans le matériel d'entraînement, se décomposent plus souvent en de nombreux petits sous-tokens.
Pour l'allemand, la tendance aux mots longs et composés joue aussi un rôle. Les composés sont le plus souvent découpés par le tokeniseur en plusieurs briques, ce qui peut accroître la consommation de tokens par rapport à des termes plus courts. Qui prévoit des applications multilingues devrait tenir compte de ces différences, qui agissent sur les coûts, la vitesse et la longueur de contexte utilisable.
Ce savoir est particulièrement pertinent quand des contenus doivent être traités en plusieurs langues. Un texte de sens identique peut exiger un nombre de tokens différent selon la langue. Une estimation réaliste du besoin en tokens pour les langues réellement utilisées aide à planifier budgets et limites de contexte de façon fiable.
Pourquoi la tokenisation compte en pratique
Pour les utilisateurs, la tokenisation est surtout pertinente parce qu'elle agit directement sur les coûts, la vitesse et la quantité maximale de texte traitable. Qui traite de grands documents ou automatise de nombreuses requêtes a intérêt à garder la consommation de tokens en vue.
La tokenisation explique en outre certaines particularités des modèles de langage. Un modèle peut par exemple avoir des difficultés à compter des lettres, parce qu'il perçoit le texte non en caractères isolés mais en tokens. Une compréhension de base de la tokenisation aide donc à mieux situer le fonctionnement et les limites de tels modèles.
Dans la conception de solutions appuyées par l'IA, nous intégrons chez Elisabit la tokenisation dès le départ. En structurant les entrées efficacement et en calculant de façon réaliste le besoin en tokens, nous créons des applications à la fois performantes et économiquement viables, justement là où de grandes quantités de texte ou de nombreuses requêtes se présentent.
Questions fréquentes
Qu'est-ce qu'un token dans la tokenisation ?
Un token est la plus petite unité de traitement d'un modèle de langage et peut être un mot entier, une partie de mot ou un caractère. La tokenisation découpe le texte en de tels tokens avant que le modèle le traite.
Pourquoi la tokenisation compte pour les coûts ?
Beaucoup de modèles de langage facturent au nombre de tokens traités, tant en entrée qu'en sortie. Une tokenisation efficace peut donc influencer sensiblement la consommation de tokens et, partant, les coûts d'une application.
Comment la tokenisation est-elle liée à la longueur de contexte ?
La longueur de contexte d'un modèle est donnée en tokens et fixe la quantité de texte prise en compte à la fois. Les textes découpés en beaucoup de tokens consomment plus de la fenêtre disponible.
Toutes les langues sont-elles tokenisées de la même façon ?
Non. Selon le matériel d'entraînement, certaines langues sont représentées plus efficacement que d'autres. L'allemand, avec ses longs mots composés, peut nécessiter plus de tokens par mot, ce qui influence les coûts et la longueur de contexte.
Pourquoi les modèles n'arrivent-ils parfois pas à compter des lettres ?
Les modèles de langage perçoivent le texte non en lettres mais en tokens. Comme un token couvre souvent plusieurs caractères, il est plus difficile aux modèles de compter correctement les lettres dans un mot.
Termes associés
Un token est la plus petite unité de traitement d'un modèle de langage — les morceaux en lesquels le texte est découpé.
Un LLM est un modèle de langage qui comprend et produit du texte en prédisant le mot suivant le plus probable.
La fenêtre de contexte est le nombre maximal de tokens qu'un modèle de langage peut prendre en compte simultanément.
Un embedding est une représentation vectorielle numérique du sens, qui place les contenus similaires à proximité les uns des autres.
Le transformer est une architecture d'IA qui saisit les relations dans un texte grâce au mécanisme d'attention.
Mettre l'IA au service de votre entreprise ?
Nous vous aidons à intégrer l'intelligence artificielle dans vos processus, votre marketing et votre site — de manière stratégique et sûre.

Votre interlocuteur
Stefan
J'ai hâte de découvrir votre projet et de trouver ensemble la meilleure solution.