{"id":93155,"date":"2020-09-03T13:42:13","date_gmt":"2020-09-03T11:42:13","guid":{"rendered":"https:\/\/prohoster.info\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii"},"modified":"2020-09-03T13:42:13","modified_gmt":"2020-09-03T11:42:13","slug":"otbor-priznakov-v-mashinnom-obuchenii","status":"publish","type":"post","link":"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii","title":{"rendered":"Selezione delle caratteristiche nel machine learning","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p>Ciao, Habr!<\/p>\n<p>In \u00abRexoft\u00bb abbiamo tradotto in italiano un articolo <noindex><a rel=\"nofollow\" href=\"\/it\/Feature%20Selection%20in%20Machine%20Learning\/\">Selezione delle caratteristiche nel machine learning<\/a><\/noindex>. Speriamo sia utile a tutti coloro che sono interessati all'argomento.<\/p>\n<p>Nel mondo reale, i dati non sono sempre cos\u00ec puliti come a volte pensano i committenti. Ecco perch\u00e9 l'analisi intelligente dei dati (data mining e data wrangling) \u00e8 cos\u00ec richiesta. Essa aiuta a identificare i valori mancanti e i modelli nei dati strutturati attraverso query che non possono essere identificate dagli esseri umani. Per trovare e utilizzare questi modelli per prevedere i risultati attraverso le relazioni scoperte nei dati, sar\u00e0 utile il machine learning.<\/p>\n<p>Per comprendere qualsiasi algoritmo, \u00e8 necessario esaminare tutte le variabili nei dati e capire cosa rappresentano. Questo \u00e8 estremamente importante, poich\u00e9 la giustificazione dei risultati si basa sulla comprensione dei dati. Se i dati contengono 5 o anche 50 variabili, \u00e8 possibile studiarle tutte. E se fossero 200? Allora non ci sarebbe abbastanza tempo per analizzare ogni singola variabile. Inoltre, alcuni algoritmi non funzionano con dati categorici, e quindi sar\u00e0 necessario convertire tutte le colonne categoriali in variabili quantitative (possono sembrare quantitative, ma le metriche mostreranno che sono categoriche) per poterle inserire nel modello. Cos\u00ec, il numero di variabili aumenta e arriva a circa 500. Cosa si pu\u00f2 fare? Potrebbe sembrare che la risposta sia la riduzione della dimensionalit\u00e0. Gli algoritmi di riduzione della dimensionalit\u00e0 riducono il numero dei parametri, ma influiscono negativamente sull'interpretabilit\u00e0. E se ci fossero altre tecniche che escludono alcune caratteristiche e allo stesso tempo permettono di comprendere e interpretare facilmente quelle rimanenti?<\/p>\n<p>A seconda che l'analisi sia basata su regressione o classificazione, gli algoritmi di selezione delle caratteristiche possono differire, ma l'idea principale della loro implementazione rimane la stessa.<\/p>\n<h3>Variabili fortemente correlate<\/h3>\n<p>Le variabili fortemente correlate tra loro forniscono alla modella le stesse informazioni, quindi non \u00e8 necessario utilizzare tutte per l'analisi. Ad esempio, se un dataset contiene le caratteristiche \"Tempo online\" e \"Traffico utilizzato\", si pu\u00f2 presumere che siano in qualche modo correlate e noteremo una forte correlazione anche se scegliamo un campione di dati imparziale. In questo caso, nella modella \u00e8 necessaria solo una di queste variabili. Se utilizziamo entrambe, il modelo risulter\u00e0 sovra-adattato (overfit) e parziale rispetto a un singolo attributo.<\/p>\n<h3>Valori di p<\/h3>\n<p>In algoritmi come la regressione lineare, un modello statistico iniziale \u00e8 sempre una buona idea. Aiuta a dimostrare l'importanza delle caratteristiche attraverso i loro valori p, ottenuti con questo modello. Stabilendo il livello di significativit\u00e0, verifichiamo i valori p ottenuti e, se uno di questi valori \u00e8 inferiore al livello di significativit\u00e0 impostato, quella caratteristica viene dichiarata significativa, il che significa che una variazione del suo valore probabilmente porter\u00e0 a una variazione del valore obiettivo (target).<\/p>\n<h3>Selezione diretta<\/h3>\n<p>La selezione diretta \u00e8 una tecnica che consiste nell'applicazione della regressione passo-passo. La costruzione del modello inizia da zero, cio\u00e8 da un modello vuoto, e ad ogni iterazione viene aggiunta la variabile che porta un miglioramento al modello in costruzione. La variabile da aggiungere al modello \u00e8 determinata dalla sua significativit\u00e0. Questo pu\u00f2 essere calcolato utilizzando varie metriche. Il metodo pi\u00f9 comune \u00e8 l'applicazione dei valori di p, ottenuti nel modello statistico iniziale utilizzando tutte le variabili. A volte, la selezione diretta pu\u00f2 portare a sovra-adattamento del modello, perch\u00e9 nel modello possono trovarsi variabili fortemente correlate, anche se forniscono la stessa informazione al modello (ma il modello mostra comunque un miglioramento).<\/p>\n<h3>Selezione inversa<\/h3>\n<p>La selezione inversa consiste anch'essa in un'esclusione passo-passo delle variabili, tuttavia in direzione opposta rispetto alla selezione diretta. In questo caso, il modello iniziale include tutte le variabili indipendenti. Le variabili vengono quindi escluse (una per iterazione), se non apportano valore al nuovo modello di regressione in ogni iterazione. L'esclusione delle variabili si basa sui valori di p del modello iniziale. Anche in questo metodo esiste incertezza nell'eliminazione di variabili fortemente correlate.<\/p>\n<h3>Esclusione ricorsiva delle caratteristiche<\/h3>\n<p>RFE \u00e8 una tecnica\/algoritmo ampiamente utilizzato per la selezione del numero esatto di caratteristiche significative. A volte il metodo viene usato per spiegare un certo numero di \u00abcaratteristiche pi\u00f9 importanti\u00bb che influenzano i risultati; altre volte per ridurre un numero molto elevato di variabili (circa 200-400), mantenendo solo quelle che contribuiscono in qualche modo al modello, mentre tutte le altre vengono escluse. RFE utilizza un sistema di classificazione. Alle caratteristiche nel set di dati vengono assegnati dei ranghi. Questi ranghi vengono quindi utilizzati per l'esclusione ricorsiva delle caratteristiche in base alla collinearit\u00e0 tra di esse e all'importanza di queste caratteristiche nel modello. Oltre alla classificazione delle caratteristiche, RFE pu\u00f2 mostrare se queste caratteristiche sono importanti o meno anche per un numero specifico di caratteristiche (perch\u00e9 \u00e8 molto probabile che il numero scelto di caratteristiche possa non essere ottimale, e il numero ottimale di caratteristiche pu\u00f2 essere sia maggiore che minore rispetto a quello scelto).<\/p>\n<h3>Diagramma di importanza delle caratteristiche<\/h3>\n<p>Parlando dell'interpretabilit\u00e0 degli algoritmi di apprendimento automatico, si discutono solitamente le regressioni lineari (che permettono di analizzare l'importanza delle caratteristiche tramite i valori p) e gli alberi decisionali (che mostrano letteralmente l'importanza delle caratteristiche in forma di albero, evidenziandone anche la gerarchia). D'altro canto, algoritmi come Random Forest, LightGBM e XG Boost spesso utilizzano i grafici di importanza delle caratteristiche, costruendo quindi un diagramma delle variabili e 'del loro grado di importanza'. Questo \u00e8 particolarmente utile quando \u00e8 necessario fornire una giustificazione strutturata dell'importanza delle caratteristiche in relazione al loro impatto sul business.<\/p>\n<h3>Regolarizzazione<\/h3>\n<p>La regolarizzazione viene applicata per controllare il bilanciamento tra bias e varianza. Il bias indica quanto un modello sia sovraccarico (overfit) sul set di dati di addestramento. La varianza indica quanto siano differenti le previsioni tra il set di dati di addestramento e quello di test. In un mondo ideale, sia il bias che la varianza dovrebbero essere ridotti al minimo. Qui entra in gioco la regolarizzazione! Esistono due tecniche principali:<\/p>\n<p>Regolarizzazione L1 - Lasso: Lasso penalizza i coefficienti pesanti del modello per modificare la loro importanza per il modello e pu\u00f2 persino azzerarli (cio\u00e8 rimuovere queste variabili dal modello finale). Di solito Lasso viene utilizzato se il dataset contiene un gran numero di variabili e si richiede di escludere alcune di esse per comprendere meglio come le caratteristiche importanti influenzano il modello (cio\u00e8, quelle caratteristiche selezionate da Lasso e per le quali \u00e8 stata stabilita l'importanza).<\/p>\n<p>Regolarizzazione L2 - metodo Ridge: L'obiettivo di Ridge \u00e8 mantenere tutte le variabili e allo stesso tempo assegnare loro importanza basata sul contributo all'efficacia del modello. Ridge sar\u00e0 una buona scelta se il dataset contiene un numero ridotto di variabili e tutte sono necessarie per interpretare le conclusioni e i risultati ottenuti.<\/p>\n<p>Poich\u00e9 Ridge mantiene tutte le variabili, mentre Lasso stabilisce meglio la loro importanza, \u00e8 stato sviluppato un algoritmo che combina le migliori caratteristiche di entrambe le regolarizzazioni ed \u00e8 noto come Elastic-Net.<\/p>\n<p>Esistono molti altri metodi per la selezione delle caratteristiche nel machine learning, ma l'idea principale rimane sempre la stessa: dimostrare l'importanza delle variabili e poi escludere alcune di esse in base all'importanza ottenuta. L'importanza \u00e8 un termine molto soggettivo, in quanto non \u00e8 una sola, ma un'intera serie di metriche e diagrammi che possono essere utilizzati per individuare le caratteristiche chiave.<\/p>\n<p>Grazie per la lettura! Buono studio!<\/p>\n<p>Fonte: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/post\/517386\/\">habr.com<\/a> <\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>\u041f\u0440\u0438\u0432\u0435\u0442, \u0425\u0430\u0431\u0440! \u041c\u044b \u0432 \u00ab\u0420\u0435\u043a\u0441\u043e\u0444\u0442\u00bb \u043f\u0435\u0440\u0435\u0432\u0435\u043b\u0438 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u0438\u0439 \u044f\u0437\u044b\u043a \u0441\u0442\u0430\u0442\u044c\u044e Feature Selection in Machine Learning. \u041d\u0430\u0434\u0435\u0435\u043c\u0441\u044f, \u0431\u0443\u0434\u0435\u0442 \u043f\u043e\u043b\u0435\u0437\u043d\u043e \u0432\u0441\u0435\u043c, \u043a\u0442\u043e \u043d\u0435\u0440\u0430\u0432\u043d\u043e\u0434\u0443\u0448\u0435\u043d \u043a \u0442\u0435\u043c\u0435. \u0412 \u0440\u0435\u0430\u043b\u044c\u043d\u043e\u043c \u043c\u0438\u0440\u0435 \u0434\u0430\u043d\u043d\u044b\u0435 \u043d\u0435 \u0432\u0441\u0435\u0433\u0434\u0430 \u0442\u0430\u043a\u0438\u0435 \u0447\u0438\u0441\u0442\u044b\u0435, \u043a\u0430\u043a \u043f\u043e\u0440\u043e\u0439 \u0434\u0443\u043c\u0430\u044e\u0442 \u0431\u0438\u0437\u043d\u0435\u0441-\u0437\u0430\u043a\u0430\u0437\u0447\u0438\u043a\u0438. \u0418\u043c\u0435\u043d\u043d\u043e \u043f\u043e\u044d\u0442\u043e\u043c\u0443 \u0432\u043e\u0441\u0442\u0440\u0435\u0431\u043e\u0432\u0430\u043d \u0438\u043d\u0442\u0435\u043b\u043b\u0435\u043a\u0442\u0443\u0430\u043b\u044c\u043d\u044b\u0439 \u0430\u043d\u0430\u043b\u0438\u0437 \u0434\u0430\u043d\u043d\u044b\u0445 (data mining \u0438 data wrangling). \u041e\u043d \u043f\u043e\u043c\u043e\u0433\u0430\u0435\u0442 \u0432\u044b\u044f\u0432\u043b\u044f\u0442\u044c \u043d\u0435\u0434\u043e\u0441\u0442\u0430\u044e\u0449\u0438\u0435 \u0437\u043d\u0430\u0447\u0435\u043d\u0438\u044f \u0438 \u043f\u0430\u0442\u0442\u0435\u0440\u043d\u044b \u0432 \u0441\u0442\u0440\u0443\u043a\u0442\u0443\u0440\u0438\u0440\u043e\u0432\u0430\u043d\u043d\u044b\u0445 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-93155","post","type-post","status-publish","format-standard","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 5.0.0.1 - aioseo.com -->\n\t<meta name=\"description\" content=\"\u041f\u0440\u0438\u0432\u0435\u0442, \u0425\u0430\u0431\u0440!\u041c\u044b \u0432 \u00ab\u0420\u0435\u043a\u0441\u043e\u0444\u0442\u00bb \u043f\u0435\u0440\u0435\u0432\u0435\u043b\u0438 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u0438\u0439 \u044f\u0437\u044b\u043a \u0441\u0442\u0430\u0442\u044c\u044e Feature Selection in Machine.\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 5.0.0.1\" \/>\n\t\t<meta property=\"og:locale\" content=\"it_IT\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u041e\u0442\u0431\u043e\u0440 \u043f\u0440\u0438\u0437\u043d\u0430\u043a\u043e\u0432 \u0432 \u043c\u0430\u0448\u0438\u043d\u043d\u043e\u043c \u043e\u0431\u0443\u0447\u0435\u043d\u0438\u0438 | ProHoster\" \/>\n\t\t<meta property=\"og:description\" content=\"\u041f\u0440\u0438\u0432\u0435\u0442, \u0425\u0430\u0431\u0440!\u041c\u044b \u0432 \u00ab\u0420\u0435\u043a\u0441\u043e\u0444\u0442\u00bb \u043f\u0435\u0440\u0435\u0432\u0435\u043b\u0438 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u0438\u0439 \u044f\u0437\u044b\u043a \u0441\u0442\u0430\u0442\u044c\u044e Feature Selection in Machine.\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-09-03T11:42:13+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-09-03T11:42:13+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Selezione delle caratteristiche nel machine learning | ProHoster","description":"Ciao, Habr! In \"Rexsoft\" abbiamo tradotto in russo l'articolo Feature Selection in Machine.","canonical_url":"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"it_IT","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u041e\u0442\u0431\u043e\u0440 \u043f\u0440\u0438\u0437\u043d\u0430\u043a\u043e\u0432 \u0432 \u043c\u0430\u0448\u0438\u043d\u043d\u043e\u043c \u043e\u0431\u0443\u0447\u0435\u043d\u0438\u0438 | ProHoster","og:description":"\u041f\u0440\u0438\u0432\u0435\u0442, \u0425\u0430\u0431\u0440!\u041c\u044b \u0432 \u00ab\u0420\u0435\u043a\u0441\u043e\u0444\u0442\u00bb \u043f\u0435\u0440\u0435\u0432\u0435\u043b\u0438 \u043d\u0430 \u0440\u0443\u0441\u0441\u043a\u0438\u0439 \u044f\u0437\u044b\u043a \u0441\u0442\u0430\u0442\u044c\u044e Feature Selection in Machine.","og:url":"https:\/\/prohoster.info\/it\/blog\/administrirovanie\/otbor-priznakov-v-mashinnom-obuchenii","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-09-03T11:42:13+00:00","article:modified_time":"2020-09-03T11:42:13+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"93155","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 11:54:00","updated":"2022-09-30 17:42:24","focus_keyword":null,"additional_keywords":null,"truseo_locale":null},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/posts\/93155","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/comments?post=93155"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/posts\/93155\/revisions"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/media?parent=93155"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/categories?post=93155"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/it\/wp-json\/wp\/v2\/tags?post=93155"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}