Need of see ennes tähed, mis seondub Data Science'iga, segadusse paljusid inimesi. Data Mining'i mõistetakse sageli valesti andmete hankimise ja saamise kui lihtsa protsessina, kuid tegelikult on see palju keerulisem. Selles postituses seadkem asjad selgeks ja uurime, mis vahe on Data Mining'il ja Data Extraction'il.
Mis on Data Mining?
Data mining, tuntud ka kui teadmiste avastamine andmebaasist (KDD), on meetod, mida sageli kasutatakse suurte andmehulkade analüüsimiseks statistiliste ja matemaatiliste meetodite abil, et leida varjatud mustreid või suundi ning neist väärtust välja tuua.
Mida saab Data Mining'uga teha?
Automatiseerides protsessi, suudavad andmebaase sirvida ja tõhusalt tuvastada varjatud mustreid. Ettevõtetes kasutatakse data mining'ut sageli mustrite ja seoste leidmiseks andmetes, aidates teha optimaalseid äriotsuseid.
Rakenduse näited
1990. aastatel, kui andmekaevandamine laienes, hakkasid ettevõtted erinevates valdkondades, sealhulgas jaemüügis, finantsektoris, tervishoius, transpordis, telekommunikatsioonis ja e-kaubanduses, rakendama andmekaevandamise meetodeid, et saada teavet, mis põhineb andmetel. Andmekaevandamine aitab klientide segmenteerida, petuskeeme avastada, müüki prognoosida ja palju muud.
- Kliendisegmentimine
Kliendiandmete analüüsi ja sihtrühmade omaduste väljaselgitamise kaudu saavad ettevõtted grupeerida kliente ning pakkuda neile nende vajadustele vastavaid eripakkumisi. - Turukäru analüüs
See meetod põhineb teoorial, et kui ostate teatud toodete rühma, ostate tõenäolisemalt ka teise tooterühma. Üks tuntud näide: kui isad ostavad oma beebidele mähkmeid, ostavad nad tavaliselt koos nendega ka õlut. - Müügi prognoosimine
See võib tunduda turu korvi analüüsina, kuid seekord kasutatakse andmeanalüüsi selle ennustamiseks, millal klient tulevikus toote uuesti ostab. Näiteks ostab treener purgi valku, mis peaks kestma 9 kuud. Poole, mis seda valku müüb, plaanib turule tuua uue toote 9 kuu pärast, et treener ostaks seda jälle. - Petuste avastamine
Andmeanalüüs aitab luua mudeleid petuste avastamiseks. Kogudes petusaruannete ja ehtsate aruannete näiteid, saavad ettevõtted õiguse määrata, millised tehingud on kahtlased. - Mustrid avastamine tootmises
Tööstuses kasutatakse andmeanalüüsi süsteemide kavandamiseks, tuvastades seoseid toote arhitektuuri, profiili ja klientide vajaduste vahel. Andmete kaevandamine võib ennustada ka toote arendamise aega ja kulusid.
Ja see on alles mõned andmeanalüüsi kasutusstsenaariumid.
Andmeanalüüsi etapid
Andmete kaevandamine on terviklik protsess, mis hõlmab andmete kogumist, valikut, puhastamist, muutmist ja väljavõtmist, et hinnata mustreid ja lõpuks väärtust välja tuua.

Tavaliselt saab kogu andmete kaevandamise protsessi kokku võtta seitsmeks etapiks:
- Andmete puhastamine
Reaalses elus ei ole andmed alati puhtad ja struktureeritud. Need on sageli mürarikkad, puudulikud ja võivad sisaldada vigu. Et veenduda, et andmete kaevandamise tulemus on täpne, tuleb kõigepealt andmed puhastada. Puhastamise meetodite hulka kuuluvad puuduvate väärtuste täiendamine, automaatne ja käsitsi kontroll jne. - Andmete integreerimine
See on etapp, kus andmed erinevatest allikatest eraldatakse, kombineeritakse ja integreeritakse. Allikad võivad olla andmebaasid, tekstifailid, arvutustabelid, dokumendid, mitmemõõtmelised andmestruktuurid, internet jne. - Andmete hankimine
Tavaliselt ei ole kõik integreeritud andmed andmete kaevandamises vajalikud. Andmeproovide valik on etapp, kus suurest andmebaasist valitakse ja eraldatakse ainult kasulikud andmed. - Andmete konverteerimine
Pärast andmete valimist muudetakse need kaevandamiseks sobivatesse vormidesse. See protsess sisaldab normaliseerimist, aggregeerimist, üldistamist jne. - Intellektuaalne andmeanalüüs
Siin jõuab kätte andmete kaevandamise kõige olulisem osa — intellektuaalsete meetodite kasutamine mustrite leidmiseks. Protsess hõlmab regressiooni, klassifikatsiooni, prognoosimist, klassifitseerimist, assotsiatsioonide uurimist ja palju muud. - Mudeli hindamine
See etapp on suunatud võimalikult kasulike, kergesti mõistetavate mustrite kindlakstegemisele, samuti hüpoteeside kinnitamise mustrite leidmisele. - Teadmiste esitlemine
Lõppetapis esitatakse saadud teave atraktiivsel viisil, kasutades teadmete esitamise ja visualiseerimise meetodeid.
Andmete kaevandamise puudused
- Suured ajainvesteeringud ja tööjõud
Kuna andmete kaevandamine on pikaajaline ja keeruline protsess, vajab see palju kvalifitseeritud tööjõudu. Andmete analüüsi spetsialistid saavad kasutada tõhusaid andmete kaevandamise tööriistu, kuid nad vajavad abiks spetsialiste, kes tunnevad andmete ettevalmistamist ja tulemuste tõlgendamist. Seetõttu võib kogu teabe töötlemine võta aega. - Andmete privaatsus ja turvalisus
Kuna andmete kaevandamine kogub teavet klientide kohta turu meetodite kaudu, võib see rikuda kasutajate konfidentsiaalsust. Lisaks võivad häkkerid pääseda ligi andmetele, mis on salvestatud andmete kaevandamise süsteemidesse. See kujutab endast ohtu klientide andmete turvalisusele. Kui varastatud andmeid kasutatakse valesti, võib see kergesti teisi kahjustada.
Ülaltoodud on lühike ülevaade andmete kaevandamisest. Nagu ma juba mainisin, sisaldab andmete kaevandamine andmete kogumise ja integreerimise protsessi, mille osaks on andmete väljavõtmise (data extraction) protsess. Sel juhul võib kindlalt öelda, et andmete väljavõtmine võib olla osa pikaajalisest andmete kaevandamise protsessist.
Mis on Andmete Väljavõtmine?
Samuti tuntud kui "veebandmete kogumine" ja "veebikraapimine", see protsess viitab andmete kogumise aktile (tavaliselt struktureerimata või halvasti struktureeritud) andmeallikatest, et centraliseerida need ühte kohta ladustamiseks või edasiseks töötlemiseks. Eelkõige hõlmavad struktureerimata andmeallikad veebilehti, e-kirju, dokumente, PDF-faile, skaneeritud teksti, peamiste raamistikude aruandeid, magnetlintide faile, kuulutusi jne. Kesksetes salvestustes võivad olla kohalikud, pilvepõhised või hübriidlahendused. Oluline on meeles pidada, et andmete kogumine ei hõlma töötlemist ega muud analüüsi, mis võib toimuda hiljem.
Mida saab andmete kogumisega teha?
Peamiselt jagunevad andmete kogumise eesmärgid 3 kategooriasse.
- Arhiveerimine
Andmete kogumine võib muuta andmeid füüsilisest formaadist: raamatud, ajalehed, arved digitaalseteks formaatideks, näiteks andmebaasid ladustamiseks või varundamiseks. - Andmeformaadi muutmine
Kui soovite anda andmed oma praeguselt saidilt üle uuele arendusprotsessis olevale saidile, saate koguda andmeid oma enda saidilt, neid välja tõmmates. - Andmete analüüs
Tõmmatud andmete analüüs on allpool esitatud saadaolevate andmete ülevaate saamiseks tavaline. See võib tunduda sarnane andmete kaevandamise analüüsiga, kuid pidage meeles, et andmete analüüs on nende väljavõtmise eesmärk, mitte osa sellest. Lisaks analüüsitakse andmeid teisiti. Üks näide: veebipoe omanikud tõmbavad tooteteavet e-kaubanduse saitidelt, nagu Amazon, jälgides konkurentide strateegiaid reaalajas. Nagu andmete kaevandamine, on andmete väljavõtmine automatiseeritud protsess, millel on palju eeliseid. Varem kopeerisid ja kleepisid inimesed andmeid käsitsi ühest kohast teise, mis võttis väga palju aega. Andmete väljavõtmine kiirendab kogumist ja suurendab oluliselt väljatõmmatud andmete täpsust.
Mõned andmete väljavõtmise rakendamise näited
Nagu andmekaevanduses, on andmete väljavõtmine laialdaselt kasutusel erinevates tööstusharudes. Lisaks e-kaubanduse hindade jälgimisele võib andmete väljavõtmine aidata isiklikus uurimises, uudiste agregatsioonis, turunduses, kinnisvara, reisi- ja turismivaldkonnas, konsultatsioonides, rahanduses ja paljus muus.
- Müügivihjete genereerimine
Ettevõtted saavad andmeid koguda kataloogidest nagu Yelp, Crunchbase, Yellowpages ja genereerida müügivihjeid äri arendamiseks. Vaadake allolevat videot, et õppida, kuidas andmeid Yellowpages'ist välja võtta, kasutades . - Sisu ja uudiste agregatsioon
Sisu agregatsiooni veebisaidid võivad regulaarselt saada andmevooge erinevatest allikatest ja hoida oma saite ajakohastatud. - Meelsuse analüüs
Pärast arvustuste, kommentaaride ja tagasiside väljavõtmist sotsiaalmeediast, nagu Instagram ja Twitter, saavad spetsialistid analüüsida nende taga peituvat arvamust ja saada seisukohti, kuidas brändi, toodet või teatud nähtust tajutakse.
Andmete väljavõtmise sammud
Andmete ekstraktsioon on ETL (Extract, Transform, Load: ekstraktsioon, transformatsioon, laadimine) ja ELT (ekstraktsioon, laadimine ja transformatsioon) esimeseks etapiks. ETL ja ELT on osa terviklikust andmeintegreerimise strateegiast. Teisisõnu, andmete ekstraktsioon võib olla nende kaevandamise osa.

Ekstraktsioon, transformatsioon, laadimine
Kuna andmete kaevandamine tähendab teabe hankimist suurtest andmehulkadest, on andmete ekstraktsioon palju lühem ja lihtsam protsess. Selle võib kokku võtta kolmes etapis:
- Andmeallika valimine
Valige allikas, mille andmeid soovite ekstrakteerida, näiteks veebileht. - Andmete kogumine
Saada veebilehele 'GET' päring ja analüüsi saadud HTML-dokumenti programmeerimiskeelte, näiteks Python, PHP, R, Ruby jne abil. - Andmete salvestamine
Salvestage andmed oma kohalikku andmebaasi või pilveteenusesse edasiseks kasutamiseks. Kui olete kogenud programmeerija, võivad ülaltoodud sammud teile tunduda lihtsad. Kui aga programmeerimine pole teile tuttav, on lühike tee — kasutada andmete ekstraktsiooni tööriistu, näiteks . Andmete ekstraheerimise tööriistad, nagu ka andmete kaevandamise tööriistad, on loodud energia säästmiseks ja andmete töötlemise hõlbustamiseks kõigile. Need tööriistad on mitte ainult kulutõhusad, vaid ka algajatele mugavad. Need võimaldavad kasutajatel andmeid koguda vaid mõne minutiga, salvestada neid pilves ja eksportida mitmesugustesse formaatidesse: Excel, CSV, HTML, JSON või veebilehtede andmebaasidesse API kaudu.
Andmete ekstraheerimise puudused
- Serveri rike
Suures ulatuses andmeid ekstraheerides võib sihtruumi veebiserver üle koormata, mis võib põhjustada serveri rikke. See kahjustab saidi omaniku huve. - IP-aadressi keeld
Kui inimene kogub andmeid liiga sageli, võivad veebisaidid blokeerida tema IP-aadressi. Ressurss võib täielikult keelata IP-aadressi või piirata ligipääsu, tehes andmed puudulikuks. Andmete ekstraheerimiseks ja blokeeringute vältimiseks on vajalik seda teha mõõdukas tempos ning rakendada mõningaid blokeerimise vältimise meetodeid. - Õiguslikud probleemid
Veebist andmete ekstraheerimine satub halli tsooni, kui jutt on seaduslikkusest. Suured saidid nagu Linkedin ja Facebook väidavad selgelt oma kasutustingimustes, et igasugune automaatne andmete ekstraheerimine on keelatud. Ettevõtete vahel on olnud palju kohtuasju botide tegevuse tõttu.
Data Miningu ja Andmete Ekstraheerimise peamised erinevused
- Data miningut nimetatakse ka teadlikkuse avastamiseks andmebaasides, teadmiste ekstraheerimiseks, andmeanalüüsiks/mustriteks, teabe kogumiseks. Andmete ekstraheerimist kasutatakse vahetatult veebandmete ekstraheerimise, veebilehtede skaneerimise ja andmete kogumisega jne.
- Data mining uuringud põhinevad peamiselt struktureeritud andmetel, samas kui andmete ekstraheerimisel ekstraheeritakse tavaliselt andmeid struktureerimata või halvasti struktureeritud allikatest.
- Data mining eesmärk on muuta andmed analüüsimiseks kasulikumaks. Andmete ekstraheerimine seisneb andmete kogumises ühte kohta, kus need võivad olla salvestatud või töödeldud.
- Andmete kaevandamine põhineb matemaatilistel meetoditel mustrite või tendentside tuvastamiseks. Andmete ekstraheerimine toetub programmeerimiskeeltele või andmete ekstraheerimise vahenditele allikate läbimiseks.
- Andmete kaevandamise eesmärk on leida fakte, mis varem ei olnud teada või olid tähelepanuta jäetud, samas kui andmete ekstraheerimine tegeleb olemasoleva teabega.
- Andmete kaevandamine on keerulisem ning nõuab suuremaid investeeringuid inimeste koolitamisse. Andmete ekstraheerimine võib sobiva tööriista kasutamisel olla äärmiselt lihtne jaöökonoomne.
Aitame algajatel andmetes mitte segadusse minna. Erinevalt Khabra kasutajatest oleme loonud promokoodi HABR, mis annab täiendava 10% allahindluse, lisaks juba bänneril näidatud soodustusele.
Rohkem kursusi
Soovitatud artiklid
Allikas: habr.com
