Need of see ennes tÀhed, mis seondub Data Science'iga, segadusse paljusid inimesi. Data Mining'i mÔistetakse sageli valesti andmete hankimise ja saamise kui lihtsa protsessina, kuid tegelikult on see palju keerulisem. Selles postituses seadkem asjad selgeks ja uurime, mis vahe on Data Mining'il ja Data Extraction'il.
Mis on Data Mining?
Data mining, tuntud ka kui teadmiste avastamine andmebaasist (KDD), on meetod, mida sageli kasutatakse suurte andmehulkade analĂŒĂŒsimiseks statistiliste ja matemaatiliste meetodite abil, et leida varjatud mustreid vĂ”i suundi ning neist vÀÀrtust vĂ€lja tuua.
Mida saab Data Mining'uga teha?
Automatiseerides protsessi, suudavad andmebaase sirvida ja tÔhusalt tuvastada varjatud mustreid. EttevÔtetes kasutatakse data mining'ut sageli mustrite ja seoste leidmiseks andmetes, aidates teha optimaalseid Àriotsuseid.
Rakenduse nÀited
1990. aastatel, kui andmekaevandamine laienes, hakkasid ettevĂ”tted erinevates valdkondades, sealhulgas jaemĂŒĂŒgis, finantsektoris, tervishoius, transpordis, telekommunikatsioonis ja e-kaubanduses, rakendama andmekaevandamise meetodeid, et saada teavet, mis pĂ”hineb andmetel. Andmekaevandamine aitab klientide segmenteerida, petuskeeme avastada, mĂŒĂŒki prognoosida ja palju muud.
- Kliendisegmentimine
Kliendiandmete analĂŒĂŒsi ja sihtrĂŒhmade omaduste vĂ€ljaselgitamise kaudu saavad ettevĂ”tted grupeerida kliente ning pakkuda neile nende vajadustele vastavaid eripakkumisi. - TurukĂ€ru analĂŒĂŒs
See meetod pĂ”hineb teoorial, et kui ostate teatud toodete rĂŒhma, ostate tĂ”enĂ€olisemalt ka teise tooterĂŒhma. Ăks tuntud nĂ€ide: kui isad ostavad oma beebidele mĂ€hkmeid, ostavad nad tavaliselt koos nendega ka Ă”lut. - MĂŒĂŒgi prognoosimine
See vĂ”ib tunduda turu korvi analĂŒĂŒsina, kuid seekord kasutatakse andmeanalĂŒĂŒsi selle ennustamiseks, millal klient tulevikus toote uuesti ostab. NĂ€iteks ostab treener purgi valku, mis peaks kestma 9 kuud. Poole, mis seda valku mĂŒĂŒb, plaanib turule tuua uue toote 9 kuu pĂ€rast, et treener ostaks seda jĂ€lle. - Petuste avastamine
AndmeanalĂŒĂŒs aitab luua mudeleid petuste avastamiseks. Kogudes petusaruannete ja ehtsate aruannete nĂ€iteid, saavad ettevĂ”tted Ă”iguse mÀÀrata, millised tehingud on kahtlased. - Mustrid avastamine tootmises
Tööstuses kasutatakse andmeanalĂŒĂŒsi sĂŒsteemide kavandamiseks, tuvastades seoseid toote arhitektuuri, profiili ja klientide vajaduste vahel. Andmete kaevandamine vĂ”ib ennustada ka toote arendamise aega ja kulusid.
Ja see on alles mĂ”ned andmeanalĂŒĂŒsi kasutusstsenaariumid.
AndmeanalĂŒĂŒsi etapid
Andmete kaevandamine on terviklik protsess, mis hÔlmab andmete kogumist, valikut, puhastamist, muutmist ja vÀljavÔtmist, et hinnata mustreid ja lÔpuks vÀÀrtust vÀlja tuua.

Tavaliselt saab kogu andmete kaevandamise protsessi kokku vÔtta seitsmeks etapiks:
- Andmete puhastamine
Reaalses elus ei ole andmed alati puhtad ja struktureeritud. Need on sageli mĂŒrarikkad, puudulikud ja vĂ”ivad sisaldada vigu. Et veenduda, et andmete kaevandamise tulemus on tĂ€pne, tuleb kĂ”igepealt andmed puhastada. Puhastamise meetodite hulka kuuluvad puuduvate vÀÀrtuste tĂ€iendamine, automaatne ja kĂ€sitsi kontroll jne. - Andmete integreerimine
See on etapp, kus andmed erinevatest allikatest eraldatakse, kombineeritakse ja integreeritakse. Allikad vÔivad olla andmebaasid, tekstifailid, arvutustabelid, dokumendid, mitmemÔÔtmelised andmestruktuurid, internet jne. - Andmete hankimine
Tavaliselt ei ole kÔik integreeritud andmed andmete kaevandamises vajalikud. Andmeproovide valik on etapp, kus suurest andmebaasist valitakse ja eraldatakse ainult kasulikud andmed. - Andmete konverteerimine
PĂ€rast andmete valimist muudetakse need kaevandamiseks sobivatesse vormidesse. See protsess sisaldab normaliseerimist, aggregeerimist, ĂŒldistamist jne. - Intellektuaalne andmeanalĂŒĂŒs
Siin jĂ”uab kĂ€tte andmete kaevandamise kĂ”ige olulisem osa â intellektuaalsete meetodite kasutamine mustrite leidmiseks. Protsess hĂ”lmab regressiooni, klassifikatsiooni, prognoosimist, klassifitseerimist, assotsiatsioonide uurimist ja palju muud. - Mudeli hindamine
See etapp on suunatud vĂ”imalikult kasulike, kergesti mĂ”istetavate mustrite kindlakstegemisele, samuti hĂŒpoteeside kinnitamise mustrite leidmisele. - Teadmiste esitlemine
LÔppetapis esitatakse saadud teave atraktiivsel viisil, kasutades teadmete esitamise ja visualiseerimise meetodeid.
Andmete kaevandamise puudused
- Suured ajainvesteeringud ja tööjÔud
Kuna andmete kaevandamine on pikaajaline ja keeruline protsess, vajab see palju kvalifitseeritud tööjĂ”udu. Andmete analĂŒĂŒsi spetsialistid saavad kasutada tĂ”husaid andmete kaevandamise tööriistu, kuid nad vajavad abiks spetsialiste, kes tunnevad andmete ettevalmistamist ja tulemuste tĂ”lgendamist. SeetĂ”ttu vĂ”ib kogu teabe töötlemine vĂ”ta aega. - Andmete privaatsus ja turvalisus
Kuna andmete kaevandamine kogub teavet klientide kohta turu meetodite kaudu, vĂ”ib see rikuda kasutajate konfidentsiaalsust. Lisaks vĂ”ivad hĂ€kkerid pÀÀseda ligi andmetele, mis on salvestatud andmete kaevandamise sĂŒsteemidesse. See kujutab endast ohtu klientide andmete turvalisusele. Kui varastatud andmeid kasutatakse valesti, vĂ”ib see kergesti teisi kahjustada.
Ălaltoodud on lĂŒhike ĂŒlevaade andmete kaevandamisest. Nagu ma juba mainisin, sisaldab andmete kaevandamine andmete kogumise ja integreerimise protsessi, mille osaks on andmete vĂ€ljavĂ”tmise (data extraction) protsess. Sel juhul vĂ”ib kindlalt öelda, et andmete vĂ€ljavĂ”tmine vĂ”ib olla osa pikaajalisest andmete kaevandamise protsessist.
Mis on Andmete VÀljavÔtmine?
Samuti tuntud kui "veebandmete kogumine" ja "veebikraapimine", see protsess viitab andmete kogumise aktile (tavaliselt struktureerimata vĂ”i halvasti struktureeritud) andmeallikatest, et centraliseerida need ĂŒhte kohta ladustamiseks vĂ”i edasiseks töötlemiseks. EelkĂ”ige hĂ”lmavad struktureerimata andmeallikad veebilehti, e-kirju, dokumente, PDF-faile, skaneeritud teksti, peamiste raamistikude aruandeid, magnetlintide faile, kuulutusi jne. Kesksetes salvestustes vĂ”ivad olla kohalikud, pilvepĂ”hised vĂ”i hĂŒbriidlahendused. Oluline on meeles pidada, et andmete kogumine ei hĂ”lma töötlemist ega muud analĂŒĂŒsi, mis vĂ”ib toimuda hiljem.
Mida saab andmete kogumisega teha?
Peamiselt jagunevad andmete kogumise eesmÀrgid 3 kategooriasse.
- Arhiveerimine
Andmete kogumine vĂ”ib muuta andmeid fĂŒĂŒsilisest formaadist: raamatud, ajalehed, arved digitaalseteks formaatideks, nĂ€iteks andmebaasid ladustamiseks vĂ”i varundamiseks. - Andmeformaadi muutmine
Kui soovite anda andmed oma praeguselt saidilt ĂŒle uuele arendusprotsessis olevale saidile, saate koguda andmeid oma enda saidilt, neid vĂ€lja tĂ”mmates. - Andmete analĂŒĂŒs
TĂ”mmatud andmete analĂŒĂŒs on allpool esitatud saadaolevate andmete ĂŒlevaate saamiseks tavaline. See vĂ”ib tunduda sarnane andmete kaevandamise analĂŒĂŒsiga, kuid pidage meeles, et andmete analĂŒĂŒs on nende vĂ€ljavĂ”tmise eesmĂ€rk, mitte osa sellest. Lisaks analĂŒĂŒsitakse andmeid teisiti. Ăks nĂ€ide: veebipoe omanikud tĂ”mbavad tooteteavet e-kaubanduse saitidelt, nagu Amazon, jĂ€lgides konkurentide strateegiaid reaalajas. Nagu andmete kaevandamine, on andmete vĂ€ljavĂ”tmine automatiseeritud protsess, millel on palju eeliseid. Varem kopeerisid ja kleepisid inimesed andmeid kĂ€sitsi ĂŒhest kohast teise, mis vĂ”ttis vĂ€ga palju aega. Andmete vĂ€ljavĂ”tmine kiirendab kogumist ja suurendab oluliselt vĂ€ljatĂ”mmatud andmete tĂ€psust.
MÔned andmete vÀljavÔtmise rakendamise nÀited
Nagu andmekaevanduses, on andmete vÀljavÔtmine laialdaselt kasutusel erinevates tööstusharudes. Lisaks e-kaubanduse hindade jÀlgimisele vÔib andmete vÀljavÔtmine aidata isiklikus uurimises, uudiste agregatsioonis, turunduses, kinnisvara, reisi- ja turismivaldkonnas, konsultatsioonides, rahanduses ja paljus muus.
- MĂŒĂŒgivihjete genereerimine
EttevĂ”tted saavad andmeid koguda kataloogidest nagu Yelp, Crunchbase, Yellowpages ja genereerida mĂŒĂŒgivihjeid Ă€ri arendamiseks. Vaadake allolevat videot, et Ă”ppida, kuidas andmeid Yellowpages'ist vĂ€lja vĂ”tta, kasutades . - Sisu ja uudiste agregatsioon
Sisu agregatsiooni veebisaidid vĂ”ivad regulaarselt saada andmevooge erinevatest allikatest ja hoida oma saite ajakohastatud. - Meelsuse analĂŒĂŒs
PĂ€rast arvustuste, kommentaaride ja tagasiside vĂ€ljavĂ”tmist sotsiaalmeediast, nagu Instagram ja Twitter, saavad spetsialistid analĂŒĂŒsida nende taga peituvat arvamust ja saada seisukohti, kuidas brĂ€ndi, toodet vĂ”i teatud nĂ€htust tajutakse.
Andmete vÀljavÔtmise sammud
Andmete ekstraktsioon on ETL (Extract, Transform, Load: ekstraktsioon, transformatsioon, laadimine) ja ELT (ekstraktsioon, laadimine ja transformatsioon) esimeseks etapiks. ETL ja ELT on osa terviklikust andmeintegreerimise strateegiast. TeisisÔnu, andmete ekstraktsioon vÔib olla nende kaevandamise osa.

Ekstraktsioon, transformatsioon, laadimine
Kuna andmete kaevandamine tĂ€hendab teabe hankimist suurtest andmehulkadest, on andmete ekstraktsioon palju lĂŒhem ja lihtsam protsess. Selle vĂ”ib kokku vĂ”tta kolmes etapis:
- Andmeallika valimine
Valige allikas, mille andmeid soovite ekstrakteerida, nÀiteks veebileht. - Andmete kogumine
Saada veebilehele 'GET' pĂ€ring ja analĂŒĂŒsi saadud HTML-dokumenti programmeerimiskeelte, nĂ€iteks Python, PHP, R, Ruby jne abil. - Andmete salvestamine
Salvestage andmed oma kohalikku andmebaasi vĂ”i pilveteenusesse edasiseks kasutamiseks. Kui olete kogenud programmeerija, vĂ”ivad ĂŒlaltoodud sammud teile tunduda lihtsad. Kui aga programmeerimine pole teile tuttav, on lĂŒhike tee â kasutada andmete ekstraktsiooni tööriistu, nĂ€iteks . Andmete ekstraheerimise tööriistad, nagu ka andmete kaevandamise tööriistad, on loodud energia sÀÀstmiseks ja andmete töötlemise hĂ”lbustamiseks kĂ”igile. Need tööriistad on mitte ainult kulutĂ”husad, vaid ka algajatele mugavad. Need vĂ”imaldavad kasutajatel andmeid koguda vaid mĂ”ne minutiga, salvestada neid pilves ja eksportida mitmesugustesse formaatidesse: Excel, CSV, HTML, JSON vĂ”i veebilehtede andmebaasidesse API kaudu.
Andmete ekstraheerimise puudused
- Serveri rike
Suures ulatuses andmeid ekstraheerides vĂ”ib sihtruumi veebiserver ĂŒle koormata, mis vĂ”ib pĂ”hjustada serveri rikke. See kahjustab saidi omaniku huve. - IP-aadressi keeld
Kui inimene kogub andmeid liiga sageli, vĂ”ivad veebisaidid blokeerida tema IP-aadressi. Ressurss vĂ”ib tĂ€ielikult keelata IP-aadressi vĂ”i piirata ligipÀÀsu, tehes andmed puudulikuks. Andmete ekstraheerimiseks ja blokeeringute vĂ€ltimiseks on vajalik seda teha mÔÔdukas tempos ning rakendada mĂ”ningaid blokeerimise vĂ€ltimise meetodeid. - Ăiguslikud probleemid
Veebist andmete ekstraheerimine satub halli tsooni, kui jutt on seaduslikkusest. Suured saidid nagu Linkedin ja Facebook vÀidavad selgelt oma kasutustingimustes, et igasugune automaatne andmete ekstraheerimine on keelatud. EttevÔtete vahel on olnud palju kohtuasju botide tegevuse tÔttu.
Data Miningu ja Andmete Ekstraheerimise peamised erinevused
- Data miningut nimetatakse ka teadlikkuse avastamiseks andmebaasides, teadmiste ekstraheerimiseks, andmeanalĂŒĂŒsiks/mustriteks, teabe kogumiseks. Andmete ekstraheerimist kasutatakse vahetatult veebandmete ekstraheerimise, veebilehtede skaneerimise ja andmete kogumisega jne.
- Data mining uuringud pÔhinevad peamiselt struktureeritud andmetel, samas kui andmete ekstraheerimisel ekstraheeritakse tavaliselt andmeid struktureerimata vÔi halvasti struktureeritud allikatest.
- Data mining eesmĂ€rk on muuta andmed analĂŒĂŒsimiseks kasulikumaks. Andmete ekstraheerimine seisneb andmete kogumises ĂŒhte kohta, kus need vĂ”ivad olla salvestatud vĂ”i töödeldud.
- Andmete kaevandamine pÔhineb matemaatilistel meetoditel mustrite vÔi tendentside tuvastamiseks. Andmete ekstraheerimine toetub programmeerimiskeeltele vÔi andmete ekstraheerimise vahenditele allikate lÀbimiseks.
- Andmete kaevandamise eesmÀrk on leida fakte, mis varem ei olnud teada vÔi olid tÀhelepanuta jÀetud, samas kui andmete ekstraheerimine tegeleb olemasoleva teabega.
- Andmete kaevandamine on keerulisem ning nÔuab suuremaid investeeringuid inimeste koolitamisse. Andmete ekstraheerimine vÔib sobiva tööriista kasutamisel olla ÀÀrmiselt lihtne jaöökonoomne.
Aitame algajatel andmetes mitte segadusse minna. Erinevalt Khabra kasutajatest oleme loonud promokoodi HABR, mis annab tÀiendava 10% allahindluse, lisaks juba bÀnneril nÀidatud soodustusele.
Rohkem kursusi
Soovitatud artiklid
Allikas: habr.com
