{"id":93155,"date":"2020-09-03T13:42:13","date_gmt":"2020-09-03T11:42:13","guid":{"rendered":"https:\/\/prohoster.info\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii"},"modified":"2020-09-03T13:42:13","modified_gmt":"2020-09-03T11:42:13","slug":"otbor-priznakov-v-mashinnom-obuchenii","status":"publish","type":"post","link":"https:\/\/prohoster.info\/es\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii","title":{"rendered":"Selecci\u00f3n de caracter\u00edsticas en el aprendizaje autom\u00e1tico","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p>\u00a1Hola, Habr!<\/p>\n<p>En \u00abRexsoft\u00bb hemos traducido al espa\u00f1ol un art\u00edculo <noindex><a rel=\"nofollow\" href=\"\/es\/Feature%20Selection%20in%20Machine%20Learning\/\">Selecci\u00f3n de caracter\u00edsticas en el aprendizaje autom\u00e1tico<\/a><\/noindex>. Esperamos que sea \u00fatil para todos los interesados en el tema.<\/p>\n<p>En el mundo real, los datos no siempre son tan limpios como a veces piensan los solicitantes de negocios. Es por eso que se demanda el an\u00e1lisis inteligente de datos (data mining y data wrangling). Esto ayuda a identificar valores faltantes y patrones en datos estructurados a trav\u00e9s de consultas que un humano no puede determinar. Para encontrar y usar estos patrones para predecir resultados mediante las relaciones descubiertas en los datos, se requiere el aprendizaje autom\u00e1tico (Machine Learning).<\/p>\n<p>Para comprender cualquier algoritmo, es necesario revisar todas las variables en los datos y entender qu\u00e9 representan. Esto es crucial porque la justificaci\u00f3n de los resultados se basa en la comprensi\u00f3n de los datos. Si los datos contienen 5 o incluso 50 variables, se pueden estudiar todas. Pero, \u00bfqu\u00e9 pasa si hay 200? Entonces simplemente no habr\u00e1 suficiente tiempo para analizar cada variable individualmente. Adem\u00e1s, algunos algoritmos no funcionan con datos categ\u00f3ricos, y es necesario transformar todas las columnas categ\u00f3ricas en variables cuantitativas (pueden parecer cuantitativas, pero las m\u00e9tricas mostrar\u00e1n que son categ\u00f3ricas) para incluirlas en el modelo. De esta forma, el n\u00famero de variables aumenta y se vuelve alrededor de 500. \u00bfQu\u00e9 hacer ahora? Podr\u00eda pensarse que la respuesta ser\u00eda la reducci\u00f3n de dimensionalidad. Los algoritmos de reducci\u00f3n de dimensionalidad disminuyen el n\u00famero de par\u00e1metros, pero afectan negativamente la interpretabilidad. \u00bfQu\u00e9 pasar\u00eda si existieran otras t\u00e9cnicas que excluyan caracter\u00edsticas y, al mismo tiempo, permitan entender e interpretar f\u00e1cilmente las que quedan?<\/p>\n<p>Dependiendo de si el an\u00e1lisis se basa en regresi\u00f3n o clasificaci\u00f3n, los algoritmos de selecci\u00f3n de caracter\u00edsticas pueden diferir, pero la idea principal de su implementaci\u00f3n sigue siendo la misma.<\/p>\n<h3>Variables altamente correlacionadas<\/h3>\n<p>Las variables que est\u00e1n fuertemente correlacionadas entre s\u00ed proporcionan la misma informaci\u00f3n al modelo, por lo tanto, no es necesario usar todas para el an\u00e1lisis. Por ejemplo, si un conjunto de datos (dataset) contiene caracter\u00edsticas como \"Tiempo en l\u00ednea\" y \"Tr\u00e1fico utilizado\", se puede suponer que est\u00e1n correlacionadas hasta cierto punto, y veremos una fuerte correlaci\u00f3n incluso si seleccionamos una muestra de datos imparcial. En este caso, solo se necesita una de estas variables en el modelo. Si usamos ambas, el modelo estar\u00e1 sobreajustado (overfit) y sesgado hacia una caracter\u00edstica espec\u00edfica.<\/p>\n<h3>p-valores<\/h3>\n<p>En algoritmos como la regresi\u00f3n lineal, siempre es una buena idea contar con un modelo estad\u00edstico inicial. Este ayuda a mostrar la importancia de las caracter\u00edsticas a trav\u00e9s de sus p-valores, que fueron obtenidos por dicho modelo. Al establecer un nivel de significancia, evaluamos los p-valores obtenidos, y si alg\u00fan valor resulta ser inferior al nivel de significancia establecido, se declara esa caracter\u00edstica como significativa, lo que significa que un cambio en su valor probablemente conducir\u00e1 a un cambio en el valor del objetivo (target).<\/p>\n<h3>Selecci\u00f3n directa<\/h3>\n<p>La selecci\u00f3n directa es una t\u00e9cnica que implica el uso de regresi\u00f3n paso a paso. La construcci\u00f3n del modelo comienza desde cero, es decir, con un modelo vac\u00edo, y luego en cada iteraci\u00f3n se a\u00f1ade una variable que mejora el modelo en desarrollo. La variable que se a\u00f1ade al modelo se determina por su significancia. Esto puede calcularse utilizando diversas m\u00e9tricas. La forma m\u00e1s com\u00fan es aplicar los p-valores obtenidos en el modelo estad\u00edstico inicial utilizando todas las variables. A veces, la selecci\u00f3n directa puede conducir al sobreajuste del modelo, porque pueden incluirse variables que est\u00e1n fuertemente correlacionadas, incluso si proporcionan la misma informaci\u00f3n al modelo (y aun as\u00ed el modelo muestra una mejora).<\/p>\n<h3>Selecci\u00f3n inversa<\/h3>\n<p>La selecci\u00f3n reversa tambi\u00e9n implica la exclusi\u00f3n paso a paso de caracter\u00edsticas, pero en la direcci\u00f3n opuesta en comparaci\u00f3n con la selecci\u00f3n directa. En este caso, el modelo inicial incluye todas las variables independientes. Luego, las variables se excluyen (una por iteraci\u00f3n) si no aportan valor al nuevo modelo de regresi\u00f3n en cada iteraci\u00f3n. La exclusi\u00f3n de caracter\u00edsticas se basa en los valores p del modelo inicial. Este m\u00e9todo tambi\u00e9n presenta incertidumbre al eliminar variables altamente correlacionadas.<\/p>\n<h3>Exclusi\u00f3n recursiva de caracter\u00edsticas<\/h3>\n<p>RFE es una t\u00e9cnica \/ algoritmo ampliamente utilizado para seleccionar un n\u00famero exacto de caracter\u00edsticas significativas. A veces, se utiliza el m\u00e9todo para explicar algunas de las \"m\u00e1s importantes\" caracter\u00edsticas que influyen en los resultados; otras veces, se usa para reducir un gran n\u00famero de variables (alrededor de 200-400), manteni\u00e9ndose solo aquellas que aportan alg\u00fan valor al modelo, y excluyendo todas las dem\u00e1s. RFE utiliza un sistema de clasificaci\u00f3n. Se asignan rangos a las caracter\u00edsticas en el conjunto de datos. Luego, estos rangos se utilizan para la exclusi\u00f3n recursiva de caracter\u00edsticas dependiendo de la colinealidad entre ellas y la importancia de esas caracter\u00edsticas en el modelo. Adem\u00e1s de clasificar caracter\u00edsticas, RFE puede mostrar si estas caracter\u00edsticas son importantes o no incluso para un n\u00famero dado de caracter\u00edsticas (porque es muy probable que el n\u00famero de caracter\u00edsticas seleccionado no sea \u00f3ptimo, y el n\u00famero \u00f3ptimo de caracter\u00edsticas podr\u00eda ser mayor o menor que el elegido).<\/p>\n<h3>Gr\u00e1fico de importancia de caracter\u00edsticas<\/h3>\n<p>Al hablar de la interpretabilidad de los algoritmos de aprendizaje autom\u00e1tico, generalmente se discuten las regresiones lineales (que permiten analizar la importancia de las caracter\u00edsticas a trav\u00e9s de valores p) y los \u00e1rboles de decisi\u00f3n (que muestran literalmente la importancia de las caracter\u00edsticas en forma de \u00e1rbol, as\u00ed como su jerarqu\u00eda). Por otro lado, en algoritmos como Random Forest, LightGBM y XG Boost, se utiliza a menudo un gr\u00e1fico de importancia de caracter\u00edsticas, es decir, se construye un gr\u00e1fico de variables y \"su nivel de importancia\". Esto es especialmente \u00fatil cuando es necesario proporcionar una justificaci\u00f3n estructurada de la importancia de las caracter\u00edsticas desde la perspectiva de su influencia en el negocio.<\/p>\n<h3>Regularizaci\u00f3n<\/h3>\n<p>La regularizaci\u00f3n se realiza para controlar el equilibrio entre el sesgo (bias) y la varianza (variance). El sesgo muestra cu\u00e1nto ha sobreadaptado (overfit) el modelo al conjunto de datos de entrenamiento. La varianza indica cu\u00e1n diferentes fueron las predicciones entre los conjuntos de datos de entrenamiento y de prueba. Idealmente, tanto el sesgo como la varianza deber\u00edan ser bajos. \u00a1Aqu\u00ed es donde entra en juego la regularizaci\u00f3n! Existen dos t\u00e9cnicas principales:<\/p>\n<p>Regularizaci\u00f3n L1 - Lasso: Lasso penaliza los coeficientes del modelo para alterar su importancia en el modelo y puede incluso anularlos (es decir, eliminar estas variables del modelo final). Generalmente, Lasso se utiliza cuando el conjunto de datos contiene un gran n\u00famero de variables y es necesario excluir algunas de ellas para entender mejor c\u00f3mo influyen las caracter\u00edsticas importantes en el modelo (es decir, aquellas caracter\u00edsticas seleccionadas por Lasso y cuya importancia se ha establecido).<\/p>\n<p>Regularizaci\u00f3n L2 - M\u00e9todo Ridge: La tarea de Ridge es conservar todas las variables y, al mismo tiempo, asignarles importancia basada en su contribuci\u00f3n a la eficacia del modelo. Ridge ser\u00e1 una buena opci\u00f3n si el conjunto de datos contiene un peque\u00f1o n\u00famero de variables y todas son necesarias para interpretar las conclusiones y los resultados obtenidos.<\/p>\n<p>Dado que Ridge conserva todas las variables y Lasso establece mejor su importancia, se ha desarrollado un algoritmo que combina las mejores caracter\u00edsticas de ambas regularizaciones y se conoce como Elastic-Net.<\/p>\n<p>Existen muchos otros m\u00e9todos de selecci\u00f3n de caracter\u00edsticas para el aprendizaje autom\u00e1tico, pero la idea principal siempre permanece igual: demostrar la importancia de las variables y luego excluir algunas de ellas bas\u00e1ndose en la importancia obtenida. La importancia es un t\u00e9rmino muy subjetivo, ya que no es uno, sino un conjunto completo de m\u00e9tricas y gr\u00e1ficos que pueden utilizarse para encontrar las caracter\u00edsticas clave.<\/p>\n<p>\u00a1Gracias por leer! \u00a1Feliz aprendizaje!<\/p>\n<p>Fuente: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/post\/517386\/\">habr.com<\/a> <\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>\u041f\u0440\u0438\u0432\u0435\u0442, \u0425\u0430\u0431\u0440! \u041c\u044b \u0432 \u00ab\u0420\u0435\u043a\u0441\u043e\u0444\u0442\u00bb \u043f\u0435\u0440\u0435\u0432\u0435\u043b\u0438 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u0438\u0439 \u044f\u0437\u044b\u043a \u0441\u0442\u0430\u0442\u044c\u044e Feature Selection in Machine Learning. \u041d\u0430\u0434\u0435\u0435\u043c\u0441\u044f, \u0431\u0443\u0434\u0435\u0442 \u043f\u043e\u043b\u0435\u0437\u043d\u043e \u0432\u0441\u0435\u043c, \u043a\u0442\u043e \u043d\u0435\u0440\u0430\u0432\u043d\u043e\u0434\u0443\u0448\u0435\u043d \u043a \u0442\u0435\u043c\u0435. \u0412 \u0440\u0435\u0430\u043b\u044c\u043d\u043e\u043c \u043c\u0438\u0440\u0435 \u0434\u0430\u043d\u043d\u044b\u0435 \u043d\u0435 \u0432\u0441\u0435\u0433\u0434\u0430 \u0442\u0430\u043a\u0438\u0435 \u0447\u0438\u0441\u0442\u044b\u0435, \u043a\u0430\u043a \u043f\u043e\u0440\u043e\u0439 \u0434\u0443\u043c\u0430\u044e\u0442 \u0431\u0438\u0437\u043d\u0435\u0441-\u0437\u0430\u043a\u0430\u0437\u0447\u0438\u043a\u0438. \u0418\u043c\u0435\u043d\u043d\u043e \u043f\u043e\u044d\u0442\u043e\u043c\u0443 \u0432\u043e\u0441\u0442\u0440\u0435\u0431\u043e\u0432\u0430\u043d \u0438\u043d\u0442\u0435\u043b\u043b\u0435\u043a\u0442\u0443\u0430\u043b\u044c\u043d\u044b\u0439 \u0430\u043d\u0430\u043b\u0438\u0437 \u0434\u0430\u043d\u043d\u044b\u0445 (data mining \u0438 data wrangling). \u041e\u043d \u043f\u043e\u043c\u043e\u0433\u0430\u0435\u0442 \u0432\u044b\u044f\u0432\u043b\u044f\u0442\u044c \u043d\u0435\u0434\u043e\u0441\u0442\u0430\u044e\u0449\u0438\u0435 \u0437\u043d\u0430\u0447\u0435\u043d\u0438\u044f \u0438 \u043f\u0430\u0442\u0442\u0435\u0440\u043d\u044b \u0432 \u0441\u0442\u0440\u0443\u043a\u0442\u0443\u0440\u0438\u0440\u043e\u0432\u0430\u043d\u043d\u044b\u0445 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-93155","post","type-post","status-publish","format-standard","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 5.0.2 - aioseo.com -->\n\t<meta name=\"description\" content=\"\u041f\u0440\u0438\u0432\u0435\u0442, \u0425\u0430\u0431\u0440!\u041c\u044b \u0432 \u00ab\u0420\u0435\u043a\u0441\u043e\u0444\u0442\u00bb \u043f\u0435\u0440\u0435\u0432\u0435\u043b\u0438 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u0438\u0439 \u044f\u0437\u044b\u043a \u0441\u0442\u0430\u0442\u044c\u044e Feature Selection in Machine.\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/es\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 5.0.2\" \/>\n\t\t<meta property=\"og:locale\" content=\"es_ES\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u041e\u0442\u0431\u043e\u0440 \u043f\u0440\u0438\u0437\u043d\u0430\u043a\u043e\u0432 \u0432 \u043c\u0430\u0448\u0438\u043d\u043d\u043e\u043c \u043e\u0431\u0443\u0447\u0435\u043d\u0438\u0438 | ProHoster\" \/>\n\t\t<meta property=\"og:description\" content=\"\u041f\u0440\u0438\u0432\u0435\u0442, \u0425\u0430\u0431\u0440!\u041c\u044b \u0432 \u00ab\u0420\u0435\u043a\u0441\u043e\u0444\u0442\u00bb \u043f\u0435\u0440\u0435\u0432\u0435\u043b\u0438 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u0438\u0439 \u044f\u0437\u044b\u043a \u0441\u0442\u0430\u0442\u044c\u044e Feature Selection in Machine.\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/es\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-09-03T11:42:13+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-09-03T11:42:13+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Selecci\u00f3n de caracter\u00edsticas en el aprendizaje autom\u00e1tico | ProHoster","description":"\u00a1Hola, Habr! En 'Rexoft' hemos traducido al espa\u00f1ol el art\u00edculo Feature Selection in Machine.","canonical_url":"https:\/\/prohoster.info\/es\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"es_ES","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u041e\u0442\u0431\u043e\u0440 \u043f\u0440\u0438\u0437\u043d\u0430\u043a\u043e\u0432 \u0432 \u043c\u0430\u0448\u0438\u043d\u043d\u043e\u043c \u043e\u0431\u0443\u0447\u0435\u043d\u0438\u0438 | ProHoster","og:description":"\u041f\u0440\u0438\u0432\u0435\u0442, \u0425\u0430\u0431\u0440!\u041c\u044b \u0432 \u00ab\u0420\u0435\u043a\u0441\u043e\u0444\u0442\u00bb \u043f\u0435\u0440\u0435\u0432\u0435\u043b\u0438 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u0438\u0439 \u044f\u0437\u044b\u043a \u0441\u0442\u0430\u0442\u044c\u044e Feature Selection in Machine.","og:url":"https:\/\/prohoster.info\/es\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-09-03T11:42:13+00:00","article:modified_time":"2020-09-03T11:42:13+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"93155","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 11:54:00","updated":"2022-09-30 17:42:24","focus_keyword":null,"additional_keywords":null,"truseo_locale":null},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/posts\/93155","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/comments?post=93155"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/posts\/93155\/revisions"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/media?parent=93155"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/categories?post=93155"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/es\/wp-json\/wp\/v2\/tags?post=93155"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}