Overfitting

Le surapprentissage désigne un modèle qui colle trop précisément aux données d’entraînement, au point de mémoriser leurs particularités et leur bruit statistique plutôt que d’apprendre des schémas généralisables. Résultat : le modèle affiche d’excellentes performances sur les données qu’il connaît, mais échoue à prédire correctement sur des données nouvelles — l’inverse même de ce qu’on attend d’un modèle prédictif.

Le phénomène survient surtout avec des modèles trop complexes appliqués à des problèmes simples ou bruités, ou quand le jeu de données d’entraînement est trop restreint. Les correctifs classiques : arrêter l’entraînement au bon moment (early stopping), utiliser la cross-validation pour détecter le problème, recourir à l’augmentation de données, ou simplifier le modèle. Son opposé, le sous-apprentissage (underfitting), survient quand le modèle est trop simple pour capter les schémas réels des données.

En RH, un modèle de scoring de CV ou de prédiction de turnover en surapprentissage peut sembler très précis sur les recrutements passés, tout en se révélant peu fiable — voire trompeur — sur de nouveaux candidats ou une nouvelle situation RH. La CNIL souligne ce risque : un système d’IA en overfitting ne permet pas une utilisation fiable en production.

Retrouvez tous les termes dans le lexique SIRH et IA de yapluqua.com.


Sources : CNIL, Wikipédia FR (04/04/2025).

Ne manquez rien de nos contenus exclusifs !

Recevez nos conseils et actualités directement dans votre boîte mail.
Pas de spam, juste l’essentiel pour rester informé.

Nous ne spammons pas ! Consultez notre politique de confidentialité pour plus d’informations.