Augmentation de données
L’augmentation de données est une technique qui accroît artificiellement la taille d’un jeu de données d’entraînement, en générant de nouvelles variantes à partir des données existantes plutôt qu’en collectant de nouvelles données réelles. Objectif : améliorer la capacité de généralisation d’un modèle et réduire le surapprentissage.
Cette technique se distingue des données synthétiques, générées sans aucune référence réelle. L’augmentation, elle, part toujours de données existantes légèrement modifiées.
En RH, intérêt direct sur le RGPD : quand les données salariés sont limitées ou sensibles, l’augmentation permet d’entraîner un modèle prédictif (turnover, matching) sans multiplier l’exposition de données personnelles réelles.
Limite à connaître : mal calibrée, elle introduit du bruit et dégrade la performance du modèle plutôt que de l’améliorer.
Retrouvez tous les termes dans le lexique SIRH et IA de yapluqua.com.
Sources : Mohamed-zaraa.com, Datascientest.