Selección de características en el aprendizaje automático

¡Hola, Habr!

En «Rexsoft» hemos traducido al español un artículo Selección de características en el aprendizaje automático. Esperamos que sea útil para todos los interesados en el tema.

En el mundo real, los datos no siempre son tan limpios como a veces piensan los solicitantes de negocios. Es por eso que se demanda el análisis inteligente de datos (data mining y data wrangling). Esto ayuda a identificar valores faltantes y patrones en datos estructurados a través de consultas que un humano no puede determinar. Para encontrar y usar estos patrones para predecir resultados mediante las relaciones descubiertas en los datos, se requiere el aprendizaje automático (Machine Learning).

Para comprender cualquier algoritmo, es necesario revisar todas las variables en los datos y entender qué representan. Esto es crucial porque la justificación de los resultados se basa en la comprensión de los datos. Si los datos contienen 5 o incluso 50 variables, se pueden estudiar todas. Pero, ¿qué pasa si hay 200? Entonces simplemente no habrá suficiente tiempo para analizar cada variable individualmente. Además, algunos algoritmos no funcionan con datos categóricos, y es necesario transformar todas las columnas categóricas en variables cuantitativas (pueden parecer cuantitativas, pero las métricas mostrarán que son categóricas) para incluirlas en el modelo. De esta forma, el número de variables aumenta y se vuelve alrededor de 500. ¿Qué hacer ahora? Podría pensarse que la respuesta sería la reducción de dimensionalidad. Los algoritmos de reducción de dimensionalidad disminuyen el número de parámetros, pero afectan negativamente la interpretabilidad. ¿Qué pasaría si existieran otras técnicas que excluyan características y, al mismo tiempo, permitan entender e interpretar fácilmente las que quedan?

Dependiendo de si el análisis se basa en regresión o clasificación, los algoritmos de selección de características pueden diferir, pero la idea principal de su implementación sigue siendo la misma.

Variables altamente correlacionadas

Las variables que están fuertemente correlacionadas entre sí proporcionan la misma información al modelo, por lo tanto, no es necesario usar todas para el análisis. Por ejemplo, si un conjunto de datos (dataset) contiene características como "Tiempo en línea" y "Tráfico utilizado", se puede suponer que están correlacionadas hasta cierto punto, y veremos una fuerte correlación incluso si seleccionamos una muestra de datos imparcial. En este caso, solo se necesita una de estas variables en el modelo. Si usamos ambas, el modelo estará sobreajustado (overfit) y sesgado hacia una característica específica.

p-valores

En algoritmos como la regresión lineal, siempre es una buena idea contar con un modelo estadístico inicial. Este ayuda a mostrar la importancia de las características a través de sus p-valores, que fueron obtenidos por dicho modelo. Al establecer un nivel de significancia, evaluamos los p-valores obtenidos, y si algún valor resulta ser inferior al nivel de significancia establecido, se declara esa característica como significativa, lo que significa que un cambio en su valor probablemente conducirá a un cambio en el valor del objetivo (target).

Selección directa

La selección directa es una técnica que implica el uso de regresión paso a paso. La construcción del modelo comienza desde cero, es decir, con un modelo vacío, y luego en cada iteración se añade una variable que mejora el modelo en desarrollo. La variable que se añade al modelo se determina por su significancia. Esto puede calcularse utilizando diversas métricas. La forma más común es aplicar los p-valores obtenidos en el modelo estadístico inicial utilizando todas las variables. A veces, la selección directa puede conducir al sobreajuste del modelo, porque pueden incluirse variables que están fuertemente correlacionadas, incluso si proporcionan la misma información al modelo (y aun así el modelo muestra una mejora).

Selección inversa

La selección reversa también implica la exclusión paso a paso de características, pero en la dirección opuesta en comparación con la selección directa. En este caso, el modelo inicial incluye todas las variables independientes. Luego, las variables se excluyen (una por iteración) si no aportan valor al nuevo modelo de regresión en cada iteración. La exclusión de características se basa en los valores p del modelo inicial. Este método también presenta incertidumbre al eliminar variables altamente correlacionadas.

Exclusión recursiva de características

RFE es una técnica / algoritmo ampliamente utilizado para seleccionar un número exacto de características significativas. A veces, se utiliza el método para explicar algunas de las "más importantes" características que influyen en los resultados; otras veces, se usa para reducir un gran número de variables (alrededor de 200-400), manteniéndose solo aquellas que aportan algún valor al modelo, y excluyendo todas las demás. RFE utiliza un sistema de clasificación. Se asignan rangos a las características en el conjunto de datos. Luego, estos rangos se utilizan para la exclusión recursiva de características dependiendo de la colinealidad entre ellas y la importancia de esas características en el modelo. Además de clasificar características, RFE puede mostrar si estas características son importantes o no incluso para un número dado de características (porque es muy probable que el número de características seleccionado no sea óptimo, y el número óptimo de características podría ser mayor o menor que el elegido).

Gráfico de importancia de características

Al hablar de la interpretabilidad de los algoritmos de aprendizaje automático, generalmente se discuten las regresiones lineales (que permiten analizar la importancia de las características a través de valores p) y los árboles de decisión (que muestran literalmente la importancia de las características en forma de árbol, así como su jerarquía). Por otro lado, en algoritmos como Random Forest, LightGBM y XG Boost, se utiliza a menudo un gráfico de importancia de características, es decir, se construye un gráfico de variables y "su nivel de importancia". Esto es especialmente útil cuando es necesario proporcionar una justificación estructurada de la importancia de las características desde la perspectiva de su influencia en el negocio.

Regularización

La regularización se realiza para controlar el equilibrio entre el sesgo (bias) y la varianza (variance). El sesgo muestra cuánto ha sobreadaptado (overfit) el modelo al conjunto de datos de entrenamiento. La varianza indica cuán diferentes fueron las predicciones entre los conjuntos de datos de entrenamiento y de prueba. Idealmente, tanto el sesgo como la varianza deberían ser bajos. ¡Aquí es donde entra en juego la regularización! Existen dos técnicas principales:

Regularización L1 - Lasso: Lasso penaliza los coeficientes del modelo para alterar su importancia en el modelo y puede incluso anularlos (es decir, eliminar estas variables del modelo final). Generalmente, Lasso se utiliza cuando el conjunto de datos contiene un gran número de variables y es necesario excluir algunas de ellas para entender mejor cómo influyen las características importantes en el modelo (es decir, aquellas características seleccionadas por Lasso y cuya importancia se ha establecido).

Regularización L2 - Método Ridge: La tarea de Ridge es conservar todas las variables y, al mismo tiempo, asignarles importancia basada en su contribución a la eficacia del modelo. Ridge será una buena opción si el conjunto de datos contiene un pequeño número de variables y todas son necesarias para interpretar las conclusiones y los resultados obtenidos.

Dado que Ridge conserva todas las variables y Lasso establece mejor su importancia, se ha desarrollado un algoritmo que combina las mejores características de ambas regularizaciones y se conoce como Elastic-Net.

Existen muchos otros métodos de selección de características para el aprendizaje automático, pero la idea principal siempre permanece igual: demostrar la importancia de las variables y luego excluir algunas de ellas basándose en la importancia obtenida. La importancia es un término muy subjetivo, ya que no es uno, sino un conjunto completo de métricas y gráficos que pueden utilizarse para encontrar las características clave.

¡Gracias por leer! ¡Feliz aprendizaje!

Fuente: habr.com

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster