XGBoost

XGBoost est une implémentation optimisée et à haute performance du gradient boosting, développée par Tianqi Chen à l’Université de Washington. C’est un algorithme d’apprentissage ensembliste basé sur des arbres de décision entraînés séquentiellement, chaque nouvel arbre corrigeant les erreurs résiduelles de l’ensemble précédent — le principe même du gradient boosting, mais avec des optimisations techniques qui en font une référence dans la discipline.

Son succès repose sur plusieurs innovations documentées : une gestion efficace des données manquantes (le modèle apprend lui-même la meilleure imputation pendant l’entraînement), une régularisation intégrée (L1 et L2) qui limite le surapprentissage, et une architecture optimisée pour le calcul parallèle et les gros volumes de données. Preuve de son adoption : 17 des 29 solutions gagnantes publiées sur la plateforme Kaggle en 2015 utilisaient XGBoost, et toutes les équipes du top 10 du KDD Cup 2015 s’en servaient. Revers documenté : contrairement à un arbre de décision isolé, facile à lire, XGBoost reste difficile à interpréter à première vue — un compromis précision/explicabilité classique des méthodes ensemblistes.

En RH, XGBoost figure parmi les algorithmes les plus utilisés en pratique pour le scoring sur données structurées : prédiction de turnover, tri de candidatures, estimation de risque d’absentéisme. Sur des données tabulaires classiques (fichiers RH, tableurs), les algorithmes basés sur des arbres comme XGBoost restent aujourd’hui considérés comme la référence, devant les réseaux de neurones plus adaptés aux données non structurées (texte, image).

Retrouvez tous les termes dans le lexique SIRH et IA de yapluqua.com.


Sources : Chen & Guestrin 2016 (arXiv), MLexpertise.com.

Ne manquez rien de nos contenus exclusifs !

Recevez nos conseils et actualités directement dans votre boîte mail.
Pas de spam, juste l’essentiel pour rester informé.

Nous ne spammons pas ! Consultez notre politique de confidentialité pour plus d’informations.