Attention mechanism (attention)
Le mécanisme d'attention est le mécanisme central de l'architecture transformer et donc des modèles de langage modernes. Il pondère la pertinence des tokens d'une séquence les uns pour les autres et permet au modèle de considérer le contexte de chaque mot par rapport à tous les autres. Via query, key et value, la self-attention calcule ces relations, souvent en parallèle dans plusieurs têtes (multi-head attention).
Également connu sous : attention, self-attention, mécanisme d'attention, multi-head attention
Qu'est-ce que le mécanisme d'attention ?
Le mécanisme d’attention est un procédé par lequel un Modèle de langage décide quelles parties d’une entrée comptent pour le traitement d’un Tokens sont particulièrement importants. Plutôt que de considérer chaque mot isolément, l’attention établit des relations entre tous les tokens d’une séquence et les pondère selon leur pertinence.
Ce mécanisme a été une percée décisive, parce qu'il permet aux modèles de saisir des liens sur de grandes distances dans le texte. Un pronom peut ainsi se rattacher correctement à un substantif éloigné. L'attention fonde ainsi la compréhension du contexte des modèles de langage modernes.
L'attention se décrit bien comme un focus dynamique : pour chaque mot qu'il traite, le modèle porte son attention avec plus ou moins de force sur tous les autres mots de l'entrée. Ce focus n'est pas figé mais recalculé pour chaque position, de sorte que le modèle établit avec souplesse, selon la tâche et le contexte, les liens pertinents.
Comment fonctionne la self-attention ?
Dans la self-attention, chaque token est traduit en trois vecteurs : query, key et value. En simplifiant, la query représente la question « à quoi dois-je prêter attention ? », la key décrit « qu'est-ce que je propose ? » et la value contient l'information proprement dite qui est transmise.
Le modèle compare chaque query à toutes les keys et en tire des poids, qui indiquent la force des relations entre les tokens. Ces poids sont ensuite appliqués aux vecteurs value. Le résultat est, pour chaque token, une représentation enrichie par le contexte, qui tient compte de l'environnement linguistique.
Pour que les valeurs de comparaison brutes deviennent des poids utiles, une normalisation intervient, qui les convertit en une distribution dont les parts forment un tout. Naît ainsi, pour chaque token, un mélange pondéré des informations de tous les autres. C'est précisément cette étape qui donne à la self-attention sa capacité à mettre en avant les contenus pertinents et à reléguer les autres.
Multi-head attention : plusieurs perspectives
En pratique, on utilise Transformer non pas un mais plusieurs calculs d’attention en parallèle, ce qu’on appelle les têtes (heads). Chacune de ces têtes peut se concentrer sur d’autres types de relations dans le texte, par exemple des structures grammaticales, des liens sémantiques ou des renvois sur de longues sections.
Par cette multi-head attention, le modèle considère le texte simultanément sous différentes perspectives. Les résultats de chaque tête sont ensuite réunis. Cette démarche parallèle accroît considérablement la puissance d'expression du modèle et contribue largement à la qualité des modèles de langage modernes.
L'avantage de cette diversité tient à ce que le sens linguistique se réduit rarement à un seul niveau de relation. Tandis qu'une tête saisit peut-être le lien syntaxique entre sujet et verbe, une autre peut suivre des liens thématiques sur plusieurs phrases. La combinaison de ces points de vue spécialisés permet une compréhension nuancée de la langue, inaccessible avec un unique motif d'attention.
L'attention et l'information de position
Une particularité de l'attention est qu'elle considère d'abord tous les tokens de façon équivalente, indépendamment de leur ordre. Pour le langage, la position d'un mot est pourtant centrale, les mêmes mots donnant dans un autre ordre un autre énoncé. Pour que le modèle ne perde pas l'ordre, l'information de position est introduite spécialement dans l'entrée.
Cet encodage de position assortit chaque token d'une indication de sa place dans la séquence. Ce n'est que par l'association de la représentation de contenu et de l'information de position que l'attention peut saisir à la fois de quoi il s'agit et dans quel ordre les éléments se présentent. Ordre des mots, construction de phrase et enchaînement logique se prennent ainsi en compte de façon fiable.
Cette interaction explique pourquoi les transformers traitent le langage avec autant de souplesse. Ils combinent la pondération libre et indépendante de la distance qu'apporte l'attention avec un ordre explicite des tokens. Il en résulte un modèle capable d'établir des liens proches comme éloignés, sans perdre de vue le fil de la séquence.
Importance pour les modèles de langage modernes
Le mécanisme d'attention est indissociable de l'architecture transformer, qui fonde pratiquement tous les grands modèles de langage actuels. Sans l'attention, le niveau atteint aujourd'hui en compréhension et en génération de texte serait difficilement concevable.
Un aspect pratique important concerne la charge de calcul : comme l'attention considère les relations entre tous les tokens, l'effort croît fortement avec la longueur de la séquence. Cela influence la longueur de contexte qu'un modèle peut traiter efficacement et constitue un champ actif d'optimisations techniques visant à rendre l'attention plus économe.
Pour développer des applications appuyées par l’IA, une compréhension de base de ce mécanisme est précieuse, car il explique comment les modèles pondèrent le contexte et pourquoi la longueur de l’entrée influence coûts et vitesse. Chez Elisabit, nous tenons compte de ces liens quand nous Solutions IA concevoir de sorte qu’elles soient à la fois précises et économiquement viables.
Questions fréquentes
Qu'est-ce que le mécanisme d'attention simplement expliqué ?
Le mécanisme d'attention est un procédé par lequel un modèle de langage détermine quels mots d'une entrée sont particulièrement importants pour le traitement d'un mot donné. Le modèle peut ainsi pondérer les liens dans le texte de façon ciblée et tenir compte du contexte.
Que signifient query, key et value ?
Query, key et value sont trois vecteurs calculés pour chaque token. La query pose la question des contenus pertinents, la key décrit ce qu'un token propose et la value contient l'information transmise en cas de forte pertinence.
Qu'est-ce que la multi-head attention ?
La multi-head attention désigne l'exécution en parallèle de plusieurs calculs d'attention. Chaque tête se concentre sur d'autres types de relations dans le texte, ce qui permet au modèle de saisir le contexte sous plusieurs angles à la fois.
Comment le modèle connaît-il l'ordre des mots ?
Comme l'attention elle-même ignore l'ordre, une information de position est ajoutée à chaque token. Cet encodage de position fait que le modèle tient compte à la fois du contenu et de l'agencement des mots.
Pourquoi l'attention est-elle si importante pour les LLM ?
L'attention fonde l'architecture transformer sur laquelle reposent presque tous les grands modèles de langage actuels. Elle permet une compréhension profonde du contexte et est donc décisive pour la qualité du traitement du texte.
Termes associés
Le transformer est une architecture d'IA qui saisit les relations dans un texte grâce au mécanisme d'attention.
Un LLM est un modèle de langage qui comprend et produit du texte en prédisant le mot suivant le plus probable.
L'apprentissage profond utilise des réseaux de neurones profonds pour détecter automatiquement des motifs complexes dans de grands volumes de données.
Un réseau de neurones est un modèle de calcul inspiré du cerveau, composé de neurones reliés entre eux, qui apprend à partir de données.
Un token est la plus petite unité de traitement d'un modèle de langage — les morceaux en lesquels le texte est découpé.
Mettre l'IA au service de votre entreprise ?
Nous vous aidons à intégrer l'intelligence artificielle dans vos processus, votre marketing et votre site — de manière stratégique et sûre.

Votre interlocuteur
Stefan
J'ai hâte de découvrir votre projet et de trouver ensemble la meilleure solution.