Random forest (forêt aléatoire)

Le random forest est un algorithme d’apprentissage ensembliste qui combine de nombreux arbres de décision entraînés en parallèle sur des sous-échantillons aléatoires des données, pour produire une prédiction plus fiable qu’un arbre unique. Proposé par Leo Breiman et Adèle Cutler en 2001, il applique le principe du bagging : chaque arbre s’entraîne sur un tirage aléatoire des observations et des variables, ce qui garantit leur diversité.

Pour une nouvelle donnée, chaque arbre de la forêt produit sa propre prédiction ; le résultat final combine ces votes — la catégorie majoritaire en classification, la moyenne en régression. Cette « concertation » entre arbres réduit le surapprentissage propre à un arbre de décision isolé et améliore la robustesse générale. Revers documenté : la lisibilité — un arbre unique s’interprète nœud par nœud, une forêt de centaines d’arbres devient une black box, plus difficile à expliquer.

En RH, le random forest figure parmi les algorithmes les plus utilisés pour le scoring : prédiction de turnover, tri de candidatures, estimation de risque d’absentéisme. Son bon compromis performance/robustesse en fait un choix « out-of-the-box » fréquent — au prix d’un arbitrage avec l’explicabilité, sensible dès qu’une décision RH automatisée doit être justifiée à un salarié ou un candidat.

Retrouvez tous les termes dans le lexique SIRH et IA de yapluqua.com.


Sources : Devoteam (04/02/2025, Breiman 2001), Data Analytics Post (08/02/2024).

Ne manquez rien de nos contenus exclusifs !

Recevez nos conseils et actualités directement dans votre boîte mail.
Pas de spam, juste l’essentiel pour rester informé.

Nous ne spammons pas ! Consultez notre politique de confidentialité pour plus d’informations.