Word2Vec

Word2Vec est une technique de NLP développée par des chercheurs de Google qui apprend des représentations vectorielles de mots (word embeddings) à partir de leur contexte, via un réseau de neurones peu profond entraîné sur de grands volumes de texte. Principe central : des mots qui apparaissent dans des contextes similaires obtiennent des vecteurs proches — « roi » et « reine » se retrouvent proches dans l’espace vectoriel, car tous deux liés à la royauté, sans qu’on ait explicitement défini cette relation.

Deux architectures composent Word2Vec. CBOW (Continuous Bag of Words) prédit un mot cible à partir des mots qui l’entourent. Skip-gram fait l’inverse : à partir d’un mot donné, il prédit les mots susceptibles de l’entourer. Contrairement aux méthodes de vectorisation plus simples (Bag of Words, TF-IDF) qui comptent seulement des occurrences, Word2Vec capture de véritables relations sémantiques et syntaxiques entre les mots — une avancée significative pour son époque, aujourd’hui dépassée par les embeddings contextuels de BERT et des Transformers, qui adaptent le vecteur d’un mot selon la phrase précise où il apparaît.

En RH, Word2Vec a constitué une brique historique pour la recherche sémantique dans les ATS et la détection de synonymes entre compétences formulées différemment (par exemple, relier « gestion de projet » et « management de projet »). Largement remplacé aujourd’hui par des modèles contextuels plus performants, mais son principe reste la porte d’entrée pédagogique pour comprendre le concept d’embedding.

Retrouvez tous les termes dans le lexique SIRH et IA de yapluqua.com.


Sources : H2O.ai, GeeksforGeeks (23/07/2025).

Ne manquez rien de nos contenus exclusifs !

Recevez nos conseils et actualités directement dans votre boîte mail.
Pas de spam, juste l’essentiel pour rester informé.

Nous ne spammons pas ! Consultez notre politique de confidentialité pour plus d’informations.