Salut, Habr !
Nous chez «Rexoft» avons traduit en français un article . Nous espérons que cela sera utile à tous ceux qui s'intéressent au sujet.
Dans le monde réel, les données ne sont pas toujours aussi propres que le pensent parfois les clients d'affaires. C'est pourquoi l'analyse intelligente des données (data mining et data wrangling) est très demandée. Elle aide à identifier les valeurs manquantes et les motifs dans les données structurées grâce à des requêtes que l'homme ne peut pas déterminer. Pour trouver et utiliser ces motifs afin de prédire les résultats à l'aide des relations détectées dans les données, l'apprentissage automatique (Machine Learning) sera utile.
Pour comprendre n'importe quel algorithme, il est nécessaire d'examiner toutes les variables dans les données et de déterminer ce que ces variables représentent. C'est extrêmement important, car l'interprétation des résultats repose sur la compréhension des données. Si les données contiennent 5 ou même 50 variables, on peut les analyser toutes. Mais que faire s'il y en a 200 ? Alors, il n'y aura tout simplement pas assez de temps pour examiner chaque variable individuelle. De plus, certains algorithmes ne fonctionnent pas pour les données catégorielles, et il faudra alors convertir toutes les colonnes catégorielles en variables quantitatives (elles peuvent sembler quantitatives, mais les métriques montreront qu'elles sont catégorielles) pour les intégrer dans le modèle. Ainsi, le nombre de variables augmente, et il y en a environ 500. Que faire maintenant ? On pourrait penser que la solution serait la réduction de dimensionnalité. Les algorithmes de réduction de dimensionnalité diminuent le nombre de paramètres, mais nuisent à l'interprétabilité. Que faire s'il existe d'autres techniques qui excluent certaines caractéristiques tout en permettant de comprendre et d'interpréter facilement les restantes ?
Selon que l'analyse est basée sur la régression ou la classification, les algorithmes de sélection de fonctionnalités peuvent différer, mais la principale idée de leur mise en œuvre reste la même.
Variables fortement corrélées
Des variables fortement corrélées entre elles fournissent à un modèle la même information, il n'est donc pas nécessaire de toutes les utiliser pour l'analyse. Par exemple, si un ensemble de données (dataset) contient les caractéristiques « Temps en ligne » et « Trafic utilisé », on peut supposer qu'elles seront en corrélation dans une certaine mesure, et nous observerons une forte corrélation, même si nous choisissons un échantillon de données impartial. Dans ce cas, le modèle n'a besoin que d'une seule de ces variables. Si les deux sont utilisées, le modèle risque de surajuster (overfit) et d'être biaisé par rapport à une caractéristique particulière.
P-valeurs
Dans des algorithmes tels que la régression linéaire, commencer par un modèle statistique initial est toujours une bonne idée. Cela aide à montrer l'importance des caractéristiques à l'aide de leurs p-valeurs, qui ont été obtenues par ce modèle. En fixant un niveau de signification, nous vérifions les p-valeurs obtenues, et si une valeur se révèle inférieure au niveau de signification donné, cette caractéristique est déclarée significative, c'est-à-dire qu'un changement de sa valeur entraînera probablement un changement de la valeur cible.
Sélection directe
La sélection directe est une technique qui consiste à utiliser la régression pas à pas. La construction du modèle commence à partir de zéro, c'est-à-dire d'un modèle vide, puis à chaque itération, une variable est ajoutée, apportant une amélioration au modèle en cours de construction. La variable ajoutée au modèle est déterminée par son importance. Cela peut être calculé à l'aide de différentes métriques. La méthode la plus courante consiste à appliquer les p-valeurs obtenues dans le modèle statistique initial utilisant toutes les variables. Parfois, la sélection directe peut mener à un surajustement du modèle, car des variables fortement corrélées peuvent se retrouver dans le modèle, même si elles fournissent la même information au modèle (mais le modèle montre tout de même une amélioration).
Sélection inverse
La sélection inverse consiste également en une exclusion progressive des caractéristiques, mais dans la direction opposée par rapport à la sélection directe. Dans ce cas, le modèle initial comprend toutes les variables indépendantes. Ensuite, les variables sont exclues (une à la fois à chaque itération) si elles n'apportent pas de valeur au nouveau modèle de régression à chaque itération. À la base de l'exclusion des caractéristiques se trouvent les valeurs p du modèle initial. Cette méthode présente également une incertitude lors de la suppression de variables fortement corrélées.
Exclusion récurrente de caractéristiques
L'RFE est une technique/algorithme largement utilisé pour sélectionner un nombre précis de caractéristiques significatives. Parfois, la méthode est utilisée pour expliquer un certain nombre des « caractéristiques les plus importantes » influençant les résultats ; et parfois pour réduire un très grand nombre de variables (environ 200 à 400), et ne conserver que celles qui contribuent d'une manière ou d'une autre au modèle, tandis que toutes les autres sont exclues. L'RFE utilise un système de classement. Les caractéristiques dans l'ensemble de données se voient attribuer des rangs. Ces rangs sont ensuite utilisés pour l'exclusion récursive de caractéristiques en fonction de la colinéarité entre elles et de l'importance de ces caractéristiques dans le modèle. En plus du classement des caractéristiques, l'RFE peut indiquer si ces caractéristiques sont importantes ou non même pour un nombre donné de caractéristiques (car il est très probable que le nombre choisi de caractéristiques puisse ne pas être optimal, et le nombre optimal de caractéristiques peut être supérieur ou inférieur au nombre choisi).
Diagramme d'importance des caractéristiques
Lorsqu'on parle d'interprétation des algorithmes d'apprentissage automatique, on discute généralement des régressions linéaires (qui permettent d'analyser l'importance des caractéristiques à l'aide de valeurs p) et des arbres de décision (qui montrent littéralement l'importance des caractéristiques sous forme d'arbre, ainsi que leur hiérarchie). D'un autre côté, dans des algorithmes tels que Random Forest, LightGBM et XG Boost, on utilise souvent un diagramme de l'importance des caractéristiques, c'est-à-dire qu'un diagramme des variables et de leur « importance » est construit. Cela est particulièrement utile lorsque vous devez fournir une justification structurée de l'importance des caractéristiques du point de vue de leur impact sur les affaires.
Régularisation
La régularisation est essentielle pour contrôler l'équilibre entre le biais et la variance. Le biais indique dans quelle mesure le modèle est surajusté sur l'ensemble d'entraînement. La variance montre à quel point les prédictions diffèrent entre les ensembles de données d'entraînement et de test. Idéalement, le biais et la variance doivent être faibles. C'est là qu'intervient la régularisation ! Il existe deux techniques principales :
Régularisation L1 — Lasso : Lasso pénalise les coefficients de poids du modèle pour ajuster leur importance et peut même les amener à zéro (c'est-à-dire exclure ces variables du modèle final). En général, Lasso est utilisé lorsque l'ensemble de données contient un grand nombre de variables et qu'il est nécessaire d'en exclure certaines pour mieux comprendre comment les caractéristiques importantes influencent le modèle (c'est-à-dire celles choisies par Lasso et dont l'importance est établie).
Régularisation L2 — méthode Ridge : L'objectif de Ridge est de conserver toutes les variables tout en leur attribuant de l'importance en fonction de leur contribution à l'efficacité du modèle. Ridge est un bon choix lorsque l'ensemble de données contient un petit nombre de variables et que toutes sont nécessaires pour interpréter les conclusions et les résultats obtenus.
Étant donné que Ridge conserve toutes les variables, tandis que Lasso établit mieux leur importance, un algorithme a été développé pour combiner les meilleures caractéristiques des deux régularisations, connu sous le nom d'Elastic-Net.
Il existe de nombreuses autres méthodes de sélection de caractéristiques pour l'apprentissage automatique, mais l'idée principale reste la même : démontrer l'importance des variables et ensuite en exclure certaines en fonction de leur importance obtenue. L'importance est un terme très subjectif, car ce n'est pas une seule mesure, mais plutôt un ensemble de métriques et de graphiques qui peuvent être utilisés pour identifier les caractéristiques clés.
Merci de votre lecture ! Bon apprentissage !
Source : habr.com
