Mémoire attentionnelle (mécanisme d’attention)
Le mécanisme d’attention permet à un modèle de langage de déterminer dynamiquement quels mots d’une séquence méritent le plus d’attention pour interpréter chaque autre mot, plutôt que de traiter le texte élément par élément dans l’ordre comme les anciens réseaux récurrents (LSTM). Chaque mot génère trois vecteurs (requête, clé, valeur) qui permettent au modèle de « regarder » tous les autres mots simultanément et de pondérer leur pertinence.
Introduit en 2017 dans l’architecture Transformer, ce mécanisme a résolu un problème ancien : la perte de contexte sur de longues séquences. Contrairement à un LSTM qui « oublie » progressivement le début d’un texte long, l’attention relie n’importe quel mot à n’importe quel autre, quelle que soit la distance qui les sépare — c’est ce qui permet à un LLM de conserver la cohérence sur des documents entiers.
En RH, cette technique explique pourquoi les LLM modernes analysent efficacement un CV long ou un compte rendu d’entretien détaillé sans perdre le fil : le modèle relie une compétence mentionnée en début de document à une expérience citée en fin de document, sans dégradation.
Retrouvez tous les termes dans le lexique SIRH et IA de yapluqua.com.
Sources : DataCamp (17/04/2026), littérature académique (arXiv, Vaswani et al. 2017).