Queste due parole di moda, legate alla Data Science, confondono molte persone. Spesso il Data Mining viene frainteso come estrazione e recupero dei dati, ma in realtà è molto più complesso. In questo post, mettiamo in chiaro la situazione e scopriamo la differenza tra Data Mining e Data Extraction.
Cos'è il Data Mining?
Il data mining, noto anche come Scoperta della conoscenza nei database (KDD), è un metodo spesso utilizzato per analizzare grandi quantità di dati attraverso metodi statistici e matematici per scoprire schemi o tendenze nascoste e estrarne valore.
Cosa si può fare con il Data Mining?
Automatizzando il processo, possono esaminare i database ed effettivamente identificare schemi nascosti. Per le aziende, il data mining è spesso utilizzato per scoprire schemi e relazioni nei dati, per aiutare a prendere decisioni ottimali nel business.
Esempi di applicazione
Dopo che il data mining ha preso piede negli anni '90, le aziende in un'ampia gamma di settori, tra cui commercio al dettaglio, finanza, sanità, trasporti, telecomunicazioni, commercio elettronico, ecc., hanno iniziato a utilizzare metodi di data mining per ottenere informazioni basate sui dati. Il data mining può aiutare a segmentare i clienti, rilevare frodi, prevedere le vendite e molto altro ancora.
- Segmentazione dei clienti
Grazie all'analisi dei dati dei clienti e all'identificazione delle caratteristiche dei clienti target, le aziende possono raggrupparli in categorie separate e offrire loro offerte speciali che soddisfano le loro esigenze. - Analisi del carrello della spesa
Questa metodologia si basa sulla teoria che se acquisti un certo gruppo di prodotti, è probabile che tu acquisti anche un altro gruppo di prodotti. Un esempio noto: quando i padri comprano pannolini per i loro bambini, di solito acquistano birra insieme ai pannolini. - Previsione delle vendite
Questo potrebbe sembrare simile all'analisi del paniere di mercato, ma questa volta l'analisi dei dati viene utilizzata per prevedere quando un acquirente riacquisterà un prodotto in futuro. Ad esempio, un allenatore acquista un barattolo di proteine, che dovrebbe durare 9 mesi. Il negozio che vende queste proteine pianifica di rilasciare una nuova versione tra 9 mesi, affinché l'allenatore possa riacquistarla. - Rilevamento delle frodi
L'analisi dei dati aiuta nella costruzione di modelli per il rilevamento delle frodi. Raccogliendo campioni di rapporti fraudolenti e veritieri, le aziende possono determinare quali operazioni sono sospette. - Rilevamento dei modelli nella produzione
Nell'industria manifatturiera, l'analisi dei dati viene utilizzata per aiutare nella progettazione di sistemi, identificando le relazioni tra l'architettura del prodotto, il profilo e le esigenze dei clienti. L'analisi dei dati può anche prevedere i tempi di sviluppo del prodotto e i costi.
E questi sono solo alcuni degli scenari di utilizzo dell'analisi dei dati.
Fasi dell'analisi dei dati
L'analisi dei dati è un processo completo di raccolta, selezione, pulizia, trasformazione ed estrazione dei dati per valutare i modelli e, infine, per estrarre valore.

In generale, l'intero processo di analisi dei dati può essere riassunto in 7 fasi:
- Pulizia dei dati
Nel mondo reale, i dati non sono sempre puliti e strutturati. Spesso sono rumorosi, incompleti e possono contenere errori. Per garantire che il risultato dell'analisi dei dati sia accurato, è prima necessario pulire i dati. Alcuni metodi di pulizia includono la compilazione di valori mancanti, il controllo automatico e manuale, ecc. - Integrazione dei dati
Questa è la fase in cui i dati provenienti da diverse fonti vengono estratti, combinati e integrati. Le fonti possono essere database, file di testo, fogli di calcolo, documenti, array multidimensionali di dati, internet e così via. - Campionamento dei dati
Di solito, non tutti i dati integrati sono necessari per l'analisi dei dati. Il campionamento dei dati è la fase in cui vengono selezionati ed estratti solo i dati utili da un'ampia base di dati. - Trasformazione dei dati
Dopo la selezione dei dati, essi vengono trasformati in forme adatte all'analisi. Questo processo include la normalizzazione, l'aggregazione, l'astrazione, ecc. - Analisi intelligente dei dati
Qui inizia la parte più importante del data mining: l'utilizzo di metodi intelligenti per identificare schemi all'interno dei dati. Il processo include regressione, classificazione, previsione, clustering, studio delle associazioni e molto altro. - Valutazione del modello
Questa fase è focalizzata sull'individuazione di modelli potenzialmente utili e facile da comprendere, così come modelli che confermano le ipotesi. - Rappresentazione della conoscenza
Nella fase finale, le informazioni ottenute sono presentate in modo accattivante utilizzando metodi di rappresentazione della conoscenza e visualizzazione.
Svantaggi del Data Mining
- Elevati investimenti di tempo e lavoro
Poiché il data mining è un processo lungo e complesso, richiede un impegno significativo da parte di persone produttive e qualificate. Gli esperti di analisi dei dati possono avvalersi di potenti strumenti di data mining, tuttavia necessitano di professionisti per la preparazione dei dati e per comprendere i risultati. Di conseguenza, il trattamento di tutte le informazioni può richiedere del tempo. - Privacy e sicurezza dei dati
Poiché il data mining raccoglie informazioni sui clienti attraverso metodi di mercato, può compromettere la riservatezza degli utenti. Inoltre, i hacker possono accedere ai dati conservati nei sistemi di data mining. Ciò rappresenta una minaccia per la sicurezza dei dati dei clienti. Se i dati rubati vengono utilizzati impropriamente, possono facilmente causare danni.
Quanto sopra è una breve introduzione al data mining. Come ho già accennato, il data mining include il processo di raccolta e integrazione dei dati, che comprende il processo di estrazione dei dati (data extraction). In questo caso, si può affermare con certezza che l'estrazione dei dati può essere parte di un lungo processo di data mining.
Che cos'è l'estrazione dei dati?
Conosciuto anche come «estrazione di dati web» e «web scraping», questo processo è l'atto di estrarre dati da fonti di dati (di solito non strutturate o mal strutturate) e centralizzarli in un unico luogo per la memorizzazione o l'ulteriore elaborazione. In particolare, le fonti di dati non strutturate includono pagine web, e-mail, documenti, file PDF, testi scansionati, report di mainframe, file audio e video, annunci, ecc. Gli archivi centralizzati possono essere locali, cloud o ibridi. È importante ricordare che l'estrazione dei dati non include l'elaborazione o l'analisi che possono avvenire in seguito.
Cosa si può fare con l'Estrattore di Dati?
In generale, gli obiettivi dell'estrazione dei dati possono essere suddivisi in 3 categorie.
- Archiviazione
L'estrazione dei dati può convertire dati da formati fisici: libri, giornali, fatture in formati digitali, come database per la memorizzazione o il backup. - Modifica del formato dei dati
Quando si desidera trasferire dati dal proprio sito corrente a uno nuovo in fase di sviluppo, è possibile raccogliere dati dal proprio sito estraendoli. - Analisi dei dati
È comune un'analisi aggiuntiva dei dati estratti per ottenere informazioni su di essi. Questo può sembrare simile all'analisi dei dati nel data mining, ma è importante notare che l'analisi dei dati è un obiettivo dell'estrazione, ma non ne fa parte. Inoltre, i dati vengono analizzati in modo diverso. Un esempio: i proprietari di negozi online estraggono informazioni sui prodotti da siti di e-commerce, come Amazon, per monitorare le strategie dei concorrenti in tempo reale. Proprio come il data mining, l'estrazione dei dati è un processo automatizzato che offre numerosi vantaggi. In passato, le persone copiavano e incollavano manualmente i dati da un luogo all'altro, il che richiedeva molto tempo. L'estrazione dei dati accelera la raccolta e aumenta notevolmente l'accuratezza dei dati estratti.
Alcuni esempi di utilizzo dell'Estrattore di Dati
Analogamente al data mining, l'estrazione dei dati è ampiamente utilizzata in vari settori. Oltre al monitoraggio dei prezzi nell'e-commerce, l'estrazione dei dati può aiutare nella ricerca personale, nell'aggregazione di notizie, nel marketing, nel settore immobiliare, nei viaggi e nel turismo, nella consulenza, nella finanza e molto altro.
- Generazione di lead
Le aziende possono estrarre dati da elenchi come Yelp, Crunchbase, Yellowpages e generare lead per lo sviluppo del business. Puoi guardare il video qui sotto per scoprire come estrarre dati da Yellowpages utilizzando . - Aggregazione di contenuti e notizie
I siti web di aggregazione dei contenuti possono ricevere flussi regolari di dati da più fonti e mantenere i loro siti aggiornati. - Analisi del sentiment
Dopo aver estratto recensioni, commenti e feedback dai social media come Instagram e Twitter, gli specialisti possono analizzare le opinioni sottostanti e ottenere informazioni su come vengono percepiti il brand, il prodotto o un fenomeno.
Fasi dell'estrazione dei dati
L'estrazione dei dati è il primo passo dell'ETL (estrazione, trasformazione, caricamento) e dell'ELT (estrazione, caricamento e trasformazione). ETL ed ELT sono parte di una strategia completa di integrazione dei dati. In altre parole, l'estrazione dei dati può essere parte della loro acquisizione.

Estrazione, trasformazione, caricamento
Mentre il data mining è l'acquisizione di informazioni da grandi set di dati, l'estrazione dei dati è un processo molto più breve e semplice. Può essere ridotto a tre fasi:
- Selezione della fonte di dati
Scegli la fonte da cui desideri estrarre i dati, ad esempio un sito web. - Raccolta dati
Invia una richiesta "GET" al sito e analizza il documento HTML restituito utilizzando linguaggi di programmazione come Python, PHP, R, Ruby, ecc. - Archiviazione dati
Salva i dati nel tuo database locale o in uno storage cloud per un uso futuro. Se sei un programmatore esperto che desidera estrarre dati, i passaggi sopra potrebbero sembrarti semplici. Tuttavia, se non programmi, c'è un modo più semplice: utilizzare strumenti di estrazione dei dati, come . Gli strumenti di data extraction, così come gli strumenti di data mining, sono progettati per risparmiare energia e semplificare l'elaborazione dei dati per tutti. Questi strumenti non solo sono economici, ma anche convenienti per i principianti. Consentono agli utenti di raccogliere dati in pochi minuti, di archiviarli nel cloud e di esportarli in molti formati: Excel, CSV, HTML, JSON o in database sul sito tramite API.
Svantaggi della Data Extraction
- Guasto del server
Quando si estraggono dati su larga scala, il server web del sito di destinazione può essere sovraccaricato, il che può causare il guasto del server. Questo danneggerebbe gli interessi del proprietario del sito. - Blocco per IP
Quando una persona raccoglie dati troppo frequentemente, i siti web possono bloccare il suo indirizzo IP. La risorsa può completamente vietare l'indirizzo IP o limitare l'accesso, rendendo i dati incompleti. Per estrarre dati ed evitare il blocco, è necessario farlo a una velocità moderata e applicare alcune tecniche anti-blocco. - Problemi legali
L'estrazione di dati dal web rientra in una zona grigia quando si tratta di legalità. Grandi siti come Linkedin e Facebook dichiarano chiaramente nei loro termini di utilizzo che qualsiasi estrazione automatica di dati è vietata. Ci sono state molte cause legali tra le aziende a causa dell'attività dei bot.
Differenze chiave tra Data Mining e Data Extraction
- Il data mining è anche chiamato scoperta di conoscenza nei database, estrazione di conoscenza, analisi di dati/schemmi, raccolta di informazioni. La data extraction viene utilizzata in modo intercambiabile con l'estrazione di dati web, scraping di pagine web, raccolta di dati e così via.
- La ricerca nel data mining è principalmente basata su dati strutturati, mentre nell'estrazione di dati, questi sono solitamente estratti da fonti non strutturate o scarsamente strutturate.
- L'obiettivo del data mining è rendere i dati più utili per l'analisi. La data extraction è la raccolta di dati in un unico posto, dove possono essere archiviati o elaborati.
- L'analisi nel data mining si basa su metodi matematici per identificare modelli o tendenze. La data extraction si basa su linguaggi di programmazione o strumenti di estrazione dati per accedere alle fonti.
- L'obiettivo del data mining è trovare fatti che in precedenza non erano noti o ignorati, mentre la data extraction si occupa di informazioni esistenti.
- Il data mining è più complesso e richiede maggiori investimenti nella formazione delle persone. L'estrazione dei dati con l'uso di strumenti adeguati può essere estremamente semplice ed economica.
Aiutiamo i principianti a non perdersi nei dati. Appositamente per gli utenti di Habr, abbiamo creato un codice promozionale HABR, che offre uno sconto aggiuntivo del 10% sullo sconto indicato nel banner.
Altri corsi
Articoli consigliati
Fonte: habr.com
