Need for Data Science-related terms often confuses many people. Data Mining is frequently misunderstood as data extraction, but the truth is more complex. In this post, let's clarify Mining and understand the difference between Data Mining and Data Extraction.
What is Data Mining?
Data mining, also known as Knowledge Discovery in Databases (KDD), is a method commonly used to analyze large datasets using statistical and mathematical methods to identify hidden patterns or trends and extract value from them.
What can be done with Data Mining?
By automating the process, can scan databases and efficiently detect hidden patterns. For businesses, data mining is often used to uncover correlations and relationships in data, helping to make optimal business decisions.
Application examples
After data mining gained popularity in the 1990s, companies across a wide range of industries, including retail, finance, healthcare, transportation, telecommunications, e-commerce, etc., began utilizing data mining techniques to gain insights from data. Data mining can help segment customers, detect fraud, forecast sales, and much more.
- Customer Segmentation
By analyzing customer data and identifying characteristics of target customers, companies can group them into a separate category and provide tailored offers that meet their needs. - Market Basket Analysis
This technique is based on the theory that if you purchase a certain group of items, you are likely to buy another group of items. One well-known example is when fathers buy diapers for their babies, they tend to buy beer along with the diapers. - Sales Forecasting
This may seem similar to market basket analysis, but this time data analysis is used to predict when a customer will repurchase a product in the future. For example, a coach buys a can of protein that should last for 9 months. The store selling this protein plans to release a new one in 9 months, so the coach buys it again. - Fraud Detection
Andmete kaevandamine aitab luua mudelit petmise avastamiseks. Kogudes nÀidiseid petlike ja tÔeliste aruannete hulgast, saavad ettevÔtted Ôiguse mÀÀrata, millised tehingud on kahtlased. - Musterte avastamine tootmises
Tööstuses kasutatakse andmete kaevandamist, et aidata sĂŒsteemide projekteerimisel, avastades seoseid toote arhitektuuri, profiili ja klientide vajaduste vahel. Andmete kaevandamine suudab ka prognoosida toote arendamise ajakava ja kulusid.
Ja need on vaid mÔned andmete kaevandamise kasutusjuhtumid.
Andmete kaevandamise etapid
Andmete kaevandamine on terviklik protsess, mis hÔlmab andmete kogumist, valimist, puhastamist, muundamist ja ekstraheerimist, et hinnata mustreid ja lÔpuks vÀÀrtust ekstraheerida.

Tavaliselt saab kogu andmete kaevandamise protsessi kokku vÔtta seitsmeks etapiks:
- Andmete puhastamine
Reaalmaailmas ei ole andmed alati puhastatud ja struktureeritud. Need on sageli lÀrmakad, puudulikud ja vÔivad sisaldada vigu. Andmete kaevandamise tulemuse tÀpsuse tagamiseks tuleb andmed kÔigepealt puhastada. Puhastamise meetoditeks on nÀiteks puuduvaid vÀÀrtusi tÀitmine, automaatne ja kÀsitsi kontroll jne. - Andmete integreerimine
See on etapp, kus andmed erinevatest allikatest ekstraheeritakse, kombineeritakse ja integreeritakse. Allikateks vÔivad olla andmebaasid, tekstifailid, tabelid, dokumendid, mitmemÔÔtmelised andmemassiivid, internet jne. - Andmete valimine
Tavaliselt ei ole kÔik integreeritud andmed andmete kaevandamise jaoks vajalikud. Andmete valik on etapp, kus suurest andmebaasist valitakse ja ekstraheeritakse ainult kasulikud andmed. - Andmete töötlemine.
Peale andmete valimist muundatakse need andmete kaevandamiseks sobivatesse vormidesse. See protsess hĂ”lmab normaliseerimist, agregeerimist, ĂŒldistamist jne. - Intelligentne andmeanalĂŒĂŒs
Siin algab andmete kaevandamise kĂ”ige olulisem osa â intelligentsete meetodite kasutamine mustrite leidmiseks. Protsess hĂ”lmab regressiooni, klassifitseerimist, prognoosimist, klasterdamist, assotsiatsioonide uurimist ja palju muud. - Mudeli hindamine
See etapp on suunatud potentsiaalselt kasulike, arusaadavate mustrite tuvastamisele, samuti mustritele, mis kinnitavad hĂŒpoteese. - Teadmiste esitlemine
LÔppstaadiumis esitatakse saadud teave atraktiivses vormis teadmiste esitlemise ja visualiseerimise meetodite abil.
Data Miningu puudused
- Suured ajainvesteeringud ja vaeva
Kuna andmete kaevandamine on pikaajaline ja keeruline protsess, nĂ”uab see palju produktiivsete ja kvalifitseeritud inimeste tööd. AndmeanalĂŒĂŒsi spetsialistid saavad kasutada vĂ”imsaid andmete kaevandamise tööriistu, kuid nad vajavad andmete ettevalmistamiseks ja tulemuste mĂ”istmiseks spetsialiste. SeetĂ”ttu vĂ”ib kogu teabe töötlemiseks kuluda aega. - Andmete privaatsus ja turvalisus
Kuna andmete kaevandamine kogub teavet klientide kohta turundusmeetodite abil, vĂ”ib see rikkuda kasutajate konfidentsiaalsust. Lisaks vĂ”ivad hĂ€kkerid saada juurde andmetele, mis on salvestatud andmete kaevandamise sĂŒsteemidesse. See esitab ohu kliendiandmete turvalisusele. Kui varastatud andmeid kasutatakse valesti, vĂ”ib see kergesti teisi kahjustada.
Ălaltoodud on lĂŒhike sissejuhatus andmete kaevandamisse. Nagu mainisin, sisaldab andmete kaevandamine andmete kogumise ja integreerimise protsessi, mis hĂ”lmab andmete eraldamise protsessi (data extraction). Sel juhul vĂ”ib kindlalt öelda, et andmete eraldamine vĂ”ib olla osa pikaajaliselt andmete kaevandamise protsessist.
Mis on Andmete Eraldamine?
Tuntud ka kui âveebandmete eraldamineâ ja âveebikogumineâ, on see protsess andmete eraldamine (tavaliselt struktureerimata vĂ”i halvasti struktureeritud) andmeallikatest kesksetesse kohtadesse ning koondamine ĂŒhte kohta ladustamiseks vĂ”i edasise töötlemise jaoks. EelkĂ”ige kuuluvad struktureerimata andmeallikate alla veebilehed, e-post, dokumendid, PDF-failid, skannitud tekst, peamiste raudade aruanded, lintfailid, reklaamid jne. Kesksed andmehanked vĂ”ivad olla kohalikud, pilve- vĂ”i hĂŒbriidlahendused. Oluline on meeles pidada, et andmete eraldamine ei hĂ”lma töötlemist ega muud analĂŒĂŒsi, mis vĂ”ib toimuda hiljem.
Mida saab teha Andmete Eraldamisega?
Peamiselt jagunevad andmete eraldamise eesmÀrgid 3 kategooriasse.
- Arhiveerimine
Andmete ekstraktsioon vĂ”ib muuta andmeid fĂŒĂŒsilistest formaatidest, nagu raamatud, ajalehed, arved, digitaalseteks formaatideks, nĂ€iteks andmebaasidesse salvestamiseks vĂ”i varundamiseks. - Andmeformaadi muutmine
Kui soovite andmeid oma praeguselt veebisaidilt uuele, mis on arendamise faasis, ĂŒle kanda, saate andmeid oma veebisaidilt pĂ€rida, neid vĂ€lja tuues. - AndmeanalĂŒĂŒs
Tavaliselt analĂŒĂŒsitakse ekstraheeritud andmeid, et neist ĂŒlevaade saada. See vĂ”ib tunduda sarnane andmete kaevandamise (data mining) analĂŒĂŒsiga, kuid pidage meeles, et andmeanalĂŒĂŒs on andmete ekstraheerimise eesmĂ€rk, mitte selle osa. Veelgi enam, andmeid analĂŒĂŒsitakse teistmoodi. Ăks nĂ€ide: veebipoe omanikud ekstraktsioonivad tooteinfot e-kaubanduse saitidelt, nagu Amazon, et jĂ€lgida konkurentsistrateegiaid reaalajas. Nii nagu andmete kaevandamine, on ka andmete ekstraheerimine automatiseeritud protsess, millel on palju eeliseid. Varem kopeerisid inimesed andmeid kĂ€sitsi ĂŒhest kohast teise, mis vĂ”ttis palju aega. Andmete ekstraktsioon kiirendab kogumist ja suurendab oluliselt ekstraheeritud andmete tĂ€psust.
MÔned andmete ekstraktsiooni rakendused
Nagu andmete kaevandamine, on andmete ekstraheerimine laialdaselt kasutusel erinevates tööstusharudes. Lisaks e-kaubanduse hindade jÀlgimisele vÔib andmete ekstraheerimine aidata oma teadusuuringutes, uudiste kogumises, turunduses, kinnisvaras, reisides ja turismis, konsultatsioonides, rahanduses ning mujal.
- MĂŒĂŒgivihjete genereerimine
EttevĂ”tted saavad andmeid vĂ€lja ekstraktsioonida kataloogidest, nagu Yelp, Crunchbase, Yellowpages, ja genereerida mĂŒĂŒgivihjeid oma Ă€riarengu jaoks. Allolevast videost saate teada, kuidas saada andmeid Yellowpages'ist . - Sisu ja uudiste kogumine
Sisu koguvad veebisaidid saavad regulaarselt andmevooge mitmest allikast ja hoiavad oma saidid ajakohastena. - Meeleolu analĂŒĂŒs
PĂ€rast arvustuste, kommentaaride ja tagasiside ekstraktsiooni sotsiaalmeediast, nagu Instagram ja Twitter, saavad spetsialistid analĂŒĂŒsida nende taga olevaid arvamusi ning saada ĂŒlevaadet sellest, kuidas brĂ€nd, toode vĂ”i nĂ€htus on vastu vĂ”etud.
Andmete ekstraheerimise sammud
Andmete vÀljavÔtt on ETL (Extract, Transform, Load: vÀljavÔtmine, transformeerimine, laadimine) ja ELT (vÀljavÔtmine, laadimine ja transformeerimine) esimene etapp. ETL ja ELT on osa lÔpuni viidud andmete integreerimise strateegiast. TeisisÔnu, andmete vÀljavÔtt vÔib olla osa nende kaevandamisest.

VÀljavÔttmine, transformeerimine, laadimine
Kui andmete kaevandamine on teabe hankimine suurtest andmemassiividest, siis andmete vĂ€ljavĂ”tt on tunduvalt lĂŒhem ja lihtsam protsess. Selle saab kokku vĂ”tta kolme etappi:
- Andmeallika valimine
Valige allikas, millest soovite andmeid vÀljavÔtta, nÀiteks veebisait. - Andmete kogumine
Saada veebisaidile 'GET' pĂ€ring ja analĂŒĂŒsi saadud HTML-dokumenti programmeerimiskeelte abil, nagu Python, PHP, R, Ruby jne. - Andmete salvestamine
Salvestage andmed oma kohalikku andmebaasi vĂ”i pilvesalvestusse tulevikuks. Kui olete kogenud arendaja, vĂ”ivad eespool mainitud sammud teile tunduda lihtsad. Kuid kui te ei programmeeri, on olemas kiirem tee â kasutada andmete vĂ€ljavĂ”tu tööriistu, nagu . Andmete vĂ€ljavĂ”tu tööriistad, nagu ka andmete kaevandamise tööriistad, on loodud selleks, et sÀÀsta energiat ja muuta andmete töötlemine lihtsaks kĂ”igile. Need tööriistad on mitte ainult ökonoomsed, vaid ka algajatele mugavad. Nad vĂ”imaldavad kasutajatel andmeid koguda mĂ”ne minuti jooksul, salvestada neid pilve ja eksportida mitmesugustesse formaatidesse: Excel, CSV, HTML, JSON vĂ”i veebisaidi andmebaasidesse API kaudu.
Andmete vÀljavÔtu puudused
- Serveri rike
Kui andmeid vĂ€ljavĂ”etakse suurtes kogustes, vĂ”ib sihtveebisaidi server ĂŒle koormata, mis vĂ”ib viia serveri riketeeni. See tekitab kahju saidi omaniku huvidele. - IP-aadressi blokeerimine
Kui isik kogub andmeid liiga tihti, vĂ”ivad veebisaidid tema IP-aadressi blokeerida. Ressursi vĂ”ib tĂ€ielikult blokeerida vĂ”i juurdepÀÀsu piirata, muutes andmed puudulikeks. Andmete vĂ€ljavĂ”tmiseks ja blokeeringute vĂ€ltimiseks tuleb seda teha mÔÔdetud tempos ning rakendada mĂ”ningaid takistuste vĂ€ltimise meetodeid. - Ăiguslikud probleemid
Veebist andmete ekstraktsioon satub halli tsooni, kui rÀÀgitakse seaduslikkusest. Suured saidid nagu Linkedin ja Facebook vÀidavad selgelt oma kasutustingimustes, et igasugune automaatne andmete ekstraktsioon on keelatud. EttevÔtete vahel on olnud palju kohtuasju botitegevuse tÔttu.
Peamised erinevused andmete kaevandamise ja andmete ekstraktsiooni vahel
- Andmete kaevandamist nimetatakse ka teadmiste avastamiseks andmebaasides, teadmiste ekstraktsiooniks, andmete/mustrite analĂŒĂŒsiks, teabe kogumiseks. Andmete ekstraktsioon kasutab vaheldumisi veebandmete ekstraktsiooni, veebilehtede skaneerimist, andmete kogumist jne.
- Andmete kaevandamise uuringud pÔhinevad peamiselt struktureeritud andmetel, samas kui andmete ekstraktsiooni puhul eraldatakse andmed tavaliselt struktureerimata vÔi halvasti struktureeritud allikatest.
- Andmete kaevandamise eesmĂ€rk on muuta andmed analĂŒĂŒsimise jaoks kasulikumaks. Andmete ekstraktsioon on andmete kogumine ĂŒhte kohta, kus neid saab sĂ€ilitada vĂ”i töödelda.
- Andmete kaevandamise analĂŒĂŒs pĂ”hineb matemaatilistel meetoditel mustrite vĂ”i trendide tuvastamiseks. Andmete ekstraktsioon pĂ”hineb programmeerimiskeeltel vĂ”i andmete ekstraktsiooni tööriistadel allikate lĂ€bimiseks.
- Andmete kaevandamise eesmÀrk on leida fakte, mis on varem olnud tundmatud vÔi unustatud, samas kui andmete ekstraktsioon tegeleb juba olemasoleva teabega.
- Andmete kaevandamine on keerulisem ja nÔuab suurt investeeringut inimeste koolitusse. Andmete ekstraktsioon vÔib Ôigete tööriistade kasutamisel olla ÀÀrmiselt lihtne ja kulutÔhus.
Me aitame algajatel mitte andmete seas segadusse minna. Erakordselt Habrati liikmete jaoks oleme loonud sooduskoodi HABR, mis annab lisaks 10% allahindlusele, mis on nÀidatud bÀnneril.
Veel kursuseid
Soovitatud artiklid
Allikas: habr.com
