{"id":93155,"date":"2020-09-03T13:42:13","date_gmt":"2020-09-03T11:42:13","guid":{"rendered":"https:\/\/prohoster.info\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii"},"modified":"2020-09-03T13:42:13","modified_gmt":"2020-09-03T11:42:13","slug":"otbor-priznakov-v-mashinnom-obuchenii","status":"publish","type":"post","link":"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii","title":{"rendered":"Selezione delle caratteristiche nel machine learning","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p>Ciao, Habr!<\/p>\n<p>Noi di \u00abRexoft\u00bb abbiamo tradotto in russo un articolo <noindex><a rel=\"nofollow\" href=\"\/it\/Feature%20Selection%20in%20Machine%20Learning\/\">Selezione delle Caratteristiche nel Machine Learning<\/a><\/noindex>. Speriamo che sia utile a tutti coloro che sono interessati all'argomento.<\/p>\n<p>Nel mondo reale, i dati non sono sempre cos\u00ec puliti come spesso pensano i clienti aziendali. \u00c8 per questo che \u00e8 richiesta l'analisi intelligente dei dati (data mining e data wrangling). Essa aiuta a identificare valori mancanti e pattern nei dati strutturati tramite query che un essere umano non riesce a determinare. Per trovare e utilizzare questi pattern per prevedere i risultati attraverso le relazioni scoperte nei dati, \u00e8 utile il machine learning.<\/p>\n<p>Per comprendere qualsiasi algoritmo, \u00e8 necessario esaminare tutte le variabili nei dati e scoprire cosa rappresentano queste variabili. Questo \u00e8 estremamente importante, poich\u00e9 la giustificazione dei risultati si basa sulla comprensione dei dati. Se i dati contengono 5 o anche 50 variabili, si possono esaminare tutte. E se sono 200? Allora non sar\u00e0 semplicemente sufficiente il tempo per esaminare ogni singola variabile. Inoltre, alcuni algoritmi non funzionano per i dati categoriali, e quindi sar\u00e0 necessario convertire tutte le colonne categoriali in variabili quantitative (possono apparire quantitative, ma le metriche mostreranno che sono categoriali), per poterle inserire nel modello. In questo modo, il numero di variabili cresce e si arriva a circa 500. Cosa fare adesso? Si potrebbe pensare che la risposta sia la riduzione della dimensionalit\u00e0. Gli algoritmi di riduzione della dimensionalit\u00e0 riducono il numero di parametri, ma influenzano negativamente l'interpretazione. E se ci fossero altre tecniche che escludono le caratteristiche ma permettono di capire e interpretare facilmente quelle rimaste?<\/p>\n<p>A seconda che l'analisi si basi sulla regressione o sulla classificazione, gli algoritmi di selezione delle caratteristiche possono variare, ma l'idea principale della loro implementazione rimane la stessa.<\/p>\n<h3>Variabili fortemente correlate<\/h3>\n<p>Variabili fortemente correlate tra loro forniscono alla modello la stessa informazione, quindi non \u00e8 necessario utilizzarle tutte per l'analisi. Ad esempio, se il set di dati contiene le caratteristiche \"Tempo online\" e \"Traffico utilizzato\", si pu\u00f2 ipotizzare che siano correlate in qualche misura e vedremo una forte correlazione, anche se scegliamo un campione di dati imparziale. In questo caso, nel modello \u00e8 necessaria solo una di queste variabili. Se utilizziamo entrambe, il modello risulter\u00e0 sovradattato (overfit) e parziale rispetto a una singola caratteristica.<\/p>\n<h3>Valori p<\/h3>\n<p>In algoritmi come la regressione lineare, un modello statistico iniziale \u00e8 sempre una buona idea. Aiuta a mostrare l'importanza delle caratteristiche attraverso i loro valori p, ottenuti da questo modello. Stabilendo il livello di significativit\u00e0, verifichiamo i valori p ottenuti e se un valore si trova al di sotto del livello di significativit\u00e0 stabilito, quella caratteristica viene dichiarata significativa, ovvero la modifica del suo valore probabilmente porter\u00e0 a una modifica del valore dell'obiettivo (target).<\/p>\n<h3>Selezione diretta<\/h3>\n<p>La selezione diretta \u00e8 una tecnica che implica l'uso della regressione passo-passo. La costruzione del modello inizia da zero, cio\u00e8 da un modello vuoto, e poi ad ogni iterazione viene aggiunta una variabile che apporta un miglioramento al modello in costruzione. La variabile da aggiungere al modello \u00e8 determinata dalla sua importanza. Ci\u00f2 pu\u00f2 essere calcolato utilizzando diverse metriche. Il metodo pi\u00f9 comune consiste nell'applicare i valori p ottenuti dal modello statistico iniziale utilizzando tutte le variabili. A volte la selezione diretta pu\u00f2 portare a un sovradattamento del modello, poich\u00e9 nel modello possono trovarsi variabili fortemente correlate, anche se forniscono la stessa informazione al modello (ma il modello mostra comunque un miglioramento).<\/p>\n<h3>Selezione inversa<\/h3>\n<p>La selezione inversa consiste anche nell'esclusione passo dopo passo delle variabili, ma nella direzione opposta rispetto a quella diretta. In questo caso, il modello iniziale include tutte le variabili indipendenti. Successivamente, le variabili vengono escluse (una alla volta per iterazione) se non apportano valore al nuovo modello di regressione in ciascuna iterazione. Alla base dell'esclusione delle variabili ci sono i valori p del modello iniziale. Anche in questo metodo \u00e8 presente incertezza nell'eliminazione di variabili altamente correlate.<\/p>\n<h3>Esclusione ricorsiva delle variabili<\/h3>\n<p>RFE \u00e8 una tecnica\/algoritmo ampiamente utilizzato per selezionare un numero preciso di variabili significative. A volte il metodo viene utilizzato per spiegare un certo numero di \"variabili pi\u00f9 importanti\" che influenzano i risultati; altre volte per ridurre un numero molto elevato di variabili (circa 200-400) e lasciare solo quelle che danno un qualche contributo al modello, escludendo tutte le altre. RFE utilizza un sistema di ranking. Vengono assegnati dei punteggi alle variabili nel set di dati. Questi punteggi vengono quindi utilizzati per l'esclusione ricorsiva delle variabili in base alla collinearit\u00e0 tra di esse e alla loro importanza nel modello. Oltre al ranking delle variabili, RFE pu\u00f2 mostrare se queste variabili siano importanti o meno, anche per un numero predefinito di variabili (poich\u00e9 \u00e8 molto probabile che il numero scelto di variabili possa non essere ottimale, e il numero ottimale di variabili potrebbe essere sia maggiore che minore rispetto a quello scelto).<\/p>\n<h3>Diagramma dell'importanza delle variabili<\/h3>\n<p>Quando si parla di interpretabilit\u00e0 degli algoritmi di machine learning, si discutono generalmente le regressioni lineari (che consentono di analizzare l'importanza delle variabili tramite valori p) e gli alberi decisionali (che mostrano letteralmente l'importanza delle variabili sotto forma di albero, cos\u00ec come la loro gerarchia). D'altra parte, in algoritmi come Random Forest, LightGBM e XG Boost, viene spesso utilizzato un diagramma di importanza delle variabili, cio\u00e8 viene costruito un diagramma delle variabili e \"della loro importanza complessiva\". Questo \u00e8 particolarmente utile quando \u00e8 necessario fornire una giustificazione strutturata dell'importanza delle variabili in relazione al loro impatto sul business.<\/p>\n<h3>Regolarizzazione<\/h3>\n<p>La regolarizzazione viene effettuata per controllare l'equilibrio tra il bias e la varianza. Il bias indica quanto un modello si \u00e8 adattato (overfit) al set di dati di addestramento. La varianza mostra quanto siano diverse le previsioni tra i set di dati di addestramento e di test. Idealmente, sia il bias che la varianza dovrebbero essere piccoli. Qui entra in gioco la regolarizzazione! Esistono due tecniche principali:<\/p>\n<p>Regolarizzazione L1 \u2014 Lasso: Lasso penalizza i coefficienti di peso del modello per modificare la loro importanza e pu\u00f2 persino annullarli (cio\u00e8 rimuovere queste variabili dal modello finale). Di solito, Lasso viene utilizzato se il set di dati contiene un gran numero di variabili e si devono escludere alcune di esse per comprendere meglio come le caratteristiche importanti influenzano il modello (cio\u00e8 quelle caratteristiche selezionate da Lasso e con importanza stabilita).<\/p>\n<p>Regolarizzazione L2 \u2014 metodo Ridge: L'obiettivo del Ridge \u00e8 mantenere tutte le variabili e allo stesso tempo assegnare loro un'importanza in base al contributo all'efficacia del modello. Il Ridge sar\u00e0 una buona scelta se il set di dati contiene un numero ridotto di variabili e tutte sono necessarie per interpretare le conclusioni e i risultati ottenuti.<\/p>\n<p>Poich\u00e9 il Ridge mantiene tutte le variabili, mentre il Lasso stabilisce meglio la loro importanza, \u00e8 stato sviluppato un algoritmo che combina i migliori aspetti di entrambe le regolarizzazioni, noto come Elastic-Net.<\/p>\n<p>Esistono ancora molti altri modi di selezione delle caratteristiche per il machine learning, ma l'idea principale rimane sempre la stessa: dimostrare l'importanza delle variabili e poi escluderne alcune in base all'importanza ottenuta. L'importanza \u00e8 un termine molto soggettivo, poich\u00e9 non \u00e8 un solo indicatore, ma un insieme di metriche e diagrammi che possono essere utilizzati per trovare le caratteristiche chiave.<\/p>\n<p>Grazie per la lettura! Buono studio!<\/p>\n<p>Fonte: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/post\/517386\/\">habr.com<\/a> <\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>\u041f\u0440\u0438\u0432\u0435\u0442, \u0425\u0430\u0431\u0440! \u041c\u044b \u0432 \u00ab\u0420\u0435\u043a\u0441\u043e\u0444\u0442\u00bb \u043f\u0435\u0440\u0435\u0432\u0435\u043b\u0438 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u0438\u0439 \u044f\u0437\u044b\u043a \u0441\u0442\u0430\u0442\u044c\u044e Feature Selection in Machine Learning. \u041d\u0430\u0434\u0435\u0435\u043c\u0441\u044f, \u0431\u0443\u0434\u0435\u0442 \u043f\u043e\u043b\u0435\u0437\u043d\u043e \u0432\u0441\u0435\u043c, \u043a\u0442\u043e \u043d\u0435\u0440\u0430\u0432\u043d\u043e\u0434\u0443\u0448\u0435\u043d \u043a \u0442\u0435\u043c\u0435. \u0412 \u0440\u0435\u0430\u043b\u044c\u043d\u043e\u043c \u043c\u0438\u0440\u0435 \u0434\u0430\u043d\u043d\u044b\u0435 \u043d\u0435 \u0432\u0441\u0435\u0433\u0434\u0430 \u0442\u0430\u043a\u0438\u0435 \u0447\u0438\u0441\u0442\u044b\u0435, \u043a\u0430\u043a \u043f\u043e\u0440\u043e\u0439 \u0434\u0443\u043c\u0430\u044e\u0442 \u0431\u0438\u0437\u043d\u0435\u0441-\u0437\u0430\u043a\u0430\u0437\u0447\u0438\u043a\u0438. \u0418\u043c\u0435\u043d\u043d\u043e \u043f\u043e\u044d\u0442\u043e\u043c\u0443 \u0432\u043e\u0441\u0442\u0440\u0435\u0431\u043e\u0432\u0430\u043d \u0438\u043d\u0442\u0435\u043b\u043b\u0435\u043a\u0442\u0443\u0430\u043b\u044c\u043d\u044b\u0439 \u0430\u043d\u0430\u043b\u0438\u0437 \u0434\u0430\u043d\u043d\u044b\u0445 (data mining \u0438 data wrangling). \u041e\u043d \u043f\u043e\u043c\u043e\u0433\u0430\u0435\u0442 \u0432\u044b\u044f\u0432\u043b\u044f\u0442\u044c \u043d\u0435\u0434\u043e\u0441\u0442\u0430\u044e\u0449\u0438\u0435 \u0437\u043d\u0430\u0447\u0435\u043d\u0438\u044f \u0438 \u043f\u0430\u0442\u0442\u0435\u0440\u043d\u044b \u0432 \u0441\u0442\u0440\u0443\u043a\u0442\u0443\u0440\u0438\u0440\u043e\u0432\u0430\u043d\u043d\u044b\u0445 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-93155","post","type-post","status-publish","format-standard","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 5.0.1.1 - aioseo.com -->\n\t<meta name=\"description\" content=\"\u041f\u0440\u0438\u0432\u0435\u0442, \u0425\u0430\u0431\u0440!\u041c\u044b \u0432 \u00ab\u0420\u0435\u043a\u0441\u043e\u0444\u0442\u00bb \u043f\u0435\u0440\u0435\u0432\u0435\u043b\u0438 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u0438\u0439 \u044f\u0437\u044b\u043a \u0441\u0442\u0430\u0442\u044c\u044e Feature Selection in Machine.\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 5.0.1.1\" \/>\n\t\t<meta property=\"og:locale\" content=\"it_IT\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u041e\u0442\u0431\u043e\u0440 \u043f\u0440\u0438\u0437\u043d\u0430\u043a\u043e\u0432 \u0432 \u043c\u0430\u0448\u0438\u043d\u043d\u043e\u043c \u043e\u0431\u0443\u0447\u0435\u043d\u0438\u0438 | ProHoster\" \/>\n\t\t<meta property=\"og:description\" content=\"\u041f\u0440\u0438\u0432\u0435\u0442, \u0425\u0430\u0431\u0440!\u041c\u044b \u0432 \u00ab\u0420\u0435\u043a\u0441\u043e\u0444\u0442\u00bb \u043f\u0435\u0440\u0435\u0432\u0435\u043b\u0438 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u0438\u0439 \u044f\u0437\u044b\u043a \u0441\u0442\u0430\u0442\u044c\u044e Feature Selection in Machine.\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-09-03T11:42:13+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-09-03T11:42:13+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Selezione delle caratteristiche nel machine learning | ProHoster","description":"Ciao, Habr! Noi di \u00abRexoft\u00bb abbiamo tradotto in russo l'articolo sulla selezione delle caratteristiche nel machine.","canonical_url":"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"it_IT","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u041e\u0442\u0431\u043e\u0440 \u043f\u0440\u0438\u0437\u043d\u0430\u043a\u043e\u0432 \u0432 \u043c\u0430\u0448\u0438\u043d\u043d\u043e\u043c \u043e\u0431\u0443\u0447\u0435\u043d\u0438\u0438 | ProHoster","og:description":"\u041f\u0440\u0438\u0432\u0435\u0442, \u0425\u0430\u0431\u0440!\u041c\u044b \u0432 \u00ab\u0420\u0435\u043a\u0441\u043e\u0444\u0442\u00bb \u043f\u0435\u0440\u0435\u0432\u0435\u043b\u0438 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u0438\u0439 \u044f\u0437\u044b\u043a \u0441\u0442\u0430\u0442\u044c\u044e Feature Selection in Machine.","og:url":"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-09-03T11:42:13+00:00","article:modified_time":"2020-09-03T11:42:13+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"93155","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 11:54:00","updated":"2022-09-30 17:42:24","focus_keyword":null,"additional_keywords":null,"truseo_locale":null},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/posts\/93155","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/comments?post=93155"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/posts\/93155\/revisions"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/media?parent=93155"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/categories?post=93155"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/tags?post=93155"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}