Si si për të identifikuar një mashtrues në Data Science?

Si si për të identifikuar një mashtrues në Data Science?
Mund të keni dëgjuar për analistë, specialistë në të mësuarit e makinerisë dhe inteligjencën artificiale, por a keni dëgjuar ndonjëherë për ata që paguhen më shumë se meritojnë? Takoni mashtruesin e të dhënave! Këta mjeshtra, të joshur nga puna përfitimprurëse, krijojnë një reputacion të keq për profesionistët e vërtetë të përpunimit të të dhënave. Në këtë material, shqyrtojmë mënyrat për t'i zbuluar ata.

Mashtruesit e të dhënave janë kudo

Mashtruesit e të dhënave janë aq të mirë në fshehjen e tyre, saqë ju mund të jini një prej tyre, duke mos e ditur fare. Është shumë e mundshme që organizata juaj ka fshehur këta mjeshtër për vite me radhë, por ka një lajm të mirë: ata janë të lehtë për t'u identifikuar nëse e dini çfarë të kërkoni.
Shenja e parë paralajmëruese është moskuptimi se analiza dhe statistika janë disciplina shumë të ndryshme. Më tutje, do t'i shpjegohem këtë.

Disiplina të ndryshme

Statistikat janë të trajnuar të nxjerrin përfundime për atë që del jashtë të dhënave të tyre, analistët janë të trajnuar të studiojnë përmbajtjen e grupit të të dhënave. Me fjalë të tjera, analistët nxjerrin përfundime mbi atë që përmban informacioni i tyre, ndërsa statistikat nxjerrin përfundime mbi atë që mungon në të dhënat. Analistët ndihmojnë në formulimin e pyetjeve të mira (formulimin e hipotezave), ndërsa statistikat ndihmojnë në marrjen e përgjigjeve të mira (verifikimin e hipotezave).

Ekzistojnë gjithashtu role hibridë të çuditshëm, kur një person përpiqet të qëndrojë në dy karrige... Pse jo? Parimi kryesor i shkencës së të dhënave: nëse përballesh me pasiguri, nuk mund të përdorësh të njëjtën pikë të dhënash për hipoteza dhe verifikim. Kur të dhënat janë të kufizuara, pasiguria të detyron të zgjidhësh midis statistikave ose analitikës. Shpjegimi këtu.

Pa statistika do të ngecni dhe nuk do të kuptoni nëse vetë përfundimi i formuluar sapo është i qëndrueshëm ndaj kritikës, dhe pa analizë lëvizni në errësirë, me pak shanse për të përshkruar të panjohurën. Kjo është një zgjedhje e vështirë.

Shpërthimi i një mashtruesi nga kjo situatë është ta injorosh atë, e më pas të pretendojë se është i befasuar nga ajo që papritur zbulohet. Logjika e kontrollit të hipotezave statistike reduktohet në pyetjen: a janë të dhënat mjaft befasuese për të ndryshuar mendimin tonë? Si mund të jemi të befasuar nga të dhënat nëse i kemi parë tashmë?

Sa herë që mashtruesit gjejnë një model, ata frymëzohen, pastaj e kontrollojnë të njëjtat të dhëna për të të njëjtit model, për të publikuar një rezultat me një p-vlerë legjitime ose dy, pranë teorisë së tyre. Duke vepruar kështu, ata ju gënjejnë (ndoshta edhe veten e tyre). Një p-vlerë e tillë nuk ka rëndësi nëse nuk qëndroni pas hipotezës tuaj deri te për mënyrën se si e keni parë të dhënat tuaja. Mashtruesit imitojnë veprimet e analistëve dhe statistikëve pa kuptuar arsyet. Si pasojë, e gjithë fusha e shkencës të dhënave nxjerr një reputacion të keq.

Statistikët e vërtetë gjithmonë nxjerrin përfundimet e tyre

Falë reputacionit pothuajse mistik të specialistëve në statistikë, të angazhuar me arsyetim rigoroz, sasia e informacionit të rremë në Data Science është rekordisht e lartë. Është lehtësisht për t'u mashtruar dhe për t'u kapur, veçanërisht nëse viktima e paqëndrueshme mendon se gjithçka është çështje e ekuacioneve dhe të dhënave. Një set të dhënash është një set të dhënash, apo jo? Jo. Ka rëndësi si e përdorni atë.

Për fat të mirë, ju nevojitet vetëm një sugjerim për të kapur mashtruesit: ata «rihapin Amerikën pas ngjarjeve». Rihapin fenomene që, siç dinë ata tashmë, janë të pranishme në të dhëna.

Ndryshe nga mashtruesit, analistët e mirë nuk kanë paragjykime dhe kuptojnë se ide inspiruese mund të kenë shumë shpjegime të ndryshme. Në të njëjtën kohë, statistikët e mirë e përcaktojnë me kujdes përfundimin e tyre para se ta nxjerrin atë.

Analistët janë të liruar nga përgjegjësia… përsa kohë ata nuk kalojnë përtej të dhënave të tyre. Nëse ata ndihen të ndikuar të deklarojnë diçka që nuk kanë parë, kjo është një punë krejtësisht ndryshe. Ata duhet "të heqin këpucët" e analistit dhe "të veshin" këpucët e statistikani. Në fund të fundit, pavarësisht se çfarë titulli zyrtar ka, nuk ka rregull që ju ndalon të studioni të dyja profesione nëse dëshironi. Vetëm mos i ngatërroni ato.

Nëse e keni mirë statistikën, nuk do të thotë që e kuptoni mirë analitikën, dhe e anasjelltas. Nëse dikush përpiqet t'ju thotë të kundërtën, është e mençur të jeni të kujdesshëm. Nëse ky person ju informon se është e lejueshme të bëni përfundime statistike mbi të dhënat që keni studiuar tashmë, kjo është një arsye për të qenë dyfish të kujdesshëm.

Shpjegime të çuditshme

Duke vëzhguar mashtruesit e të dhënave në natyrë, do të vini re se ata i pëlqejnë të krijojnë histori fantastike për të "shpjeguar" të dhënat e vëzhguara. Sa më akademikë, aq më mirë. Nuk ka rëndësi që këto histori janë të përshtatura pas të faktës.

Kurë bëjnë kështu famëmëdhenjtë — lejoni që të mos kursej fjalët — ata gënjejnë. Asnjë sasi ekuacionesh apo koncepte të bukura nuk kompenson atë që ata ofruan si provë të zero për versionet e tyre. Mos u habitni se sa të pazakonta janë shpjegimet e tyre.

Kjo është njësoj si të demonstrosh aftësitë e tua "ekstrasensoriale", duke parë fillimisht kartat në duar, dhe pastaj të parashikosh se çfarë mbani... atë që mbani. Kjo është një paragjykim këndvështrimi retrospektiv, dhe profesionin e shkencëtarit të të dhënave e mbush me të.

Si si për të identifikuar një mashtrues në Data Science?

Analistët thonë: "Sapo shkove me mbretëreshën e kuqe." Statistikanët thonë: "E kam regjistruar hipotezën time në këtë copë letre përpara se të fillonim. Le të luajmë, të shohim disa të dhëna dhe të shohim nëse kam të drejtë." Famëmëdhenjtë thonë: "E dija se do të shkoje me këtë mbretëreshën e kuqe, sepse..."

Shkëputja e të dhënave është një zgjidhje e shpejtë për problemin që çdo person ka nevojë.

Kur të dhënat nuk janë shumë, duhet të zgjidhni mes statistikës dhe analizës, por kur ka tepër të dhëna, ka një mundësi të shkëlqyer për të bërë analizë pa mashtrime. dhe statistikës. Keni mbrojtjen perfekte nga mashtruesit — kjo është ndarja e të dhënave dhe, sipas mendimit tim, kjo është ideja më e fuqishme në Data Science.

Për t'u mbrojtur nga mashtruesit, gjithçka që duhet të bëni është të siguroheni që të ruhen disa të dhëna testuese jashtë syve të tyre kuriozë, dhe pastaj trajtoni gjithçka tjetër si analizë. Kur hasni një teori që rrezikoni të pranoni, përdorni atë për të vlerësuar situatën dhe pastaj hapni të dhënat tuaja sekrete testuese për të verifikuar se teoria nuk është ndonjë gjë e çmendur. Është kaq e thjeshtë!

Si si për të identifikuar një mashtrues në Data Science?
Sigurohuni që askush të mos lejohet të shikojë të dhënat testuese gjatë fazës së hulumtimit. Për këtë, qëndroni tek të dhënat hulumtuese. Të dhënat testuese nuk duhet të përdoren për analizë.

Kjo është një hap i madh përpara krahasuar me atë që njerëzit kanë mësuar gjatë epokës së 'të dhënave të vogla', kur ju nevojitej të shpjegoni se nga e dini atë që dini, për të bindur përfundimisht njerëzit se ju me të vërtetë dini diçka.

Aplikoni të njëjtat rregulla për ML/AI

Disa mashtrues që paraqiten si ekspertë në fushën e ML/AI janë gjithashtu të lehtë për tu zbuluar. Do t'i kapni ata ashtu si do të kapnit çdo inxhinier të keq tjetër: 'zgjidhjet', që ata përpiqen të ndihmojnë, dështojnë vazhdimisht. Një shenjë paralajmëruese e hershme është mungesa e përvojës me gjuhët dhe bibliotekat standarde të industrisë.

Por çfarë ndodh me njerëzit që krijojnë sisteme që duken funksionale? Si të kuptoni se po ndodh diçka të dyshimtë? Rregulli i njëjtë zbatohet! Mashtruesi është një karakter i dyshimtë që ju tregon sa mirë ka punuar modeli… me të njëjtat të dhëna që ata përdorën për të krijuar modelin.

Nëse keni krijuar një sistem absurdisht të komplikuar të mësimit të makinerive, si të kuptoni se sa i mirë është? Nuk do ta dini derisa të tregoni se si funksionon me të dhëna të reja që nuk i ka parë më parë.

Kur e keni parë të dhënat para parashikimit — dyshoj se është paradeklaratës.

Kur keni mjaft të dhëna për ndarje, nuk keni nevojë të referoheni në bukurinë e formulave tuaja për të justifikuar projektin (një zakon i vjetër që e shoh kudo, jo vetëm në shkencë). Mund të thoni: «E di që funksionon, sepse mund të marrë një grup të dhënash që nuk e kam parë më parë dhe të parashikoj me saktësi se çfarë do ndodhë... dhe do jem i saktë. Përsëri e përsëri».

Testimi i modelit tuaj/teorisë me të dhëna të reja është baza më e mirë për besim.

Nuk i toleroj mashtruesit e të dhënave. S'më intereson nëse opinioni juaj mbështetet në karakteristika të ndryshme. Bukuria e shpjegimeve tuaja nuk më impresionon. Më tregoni se teoria/juaj model funksionon (dhe vazhdon të funskionojë) me një sërë të dhënash të reja, që nuk keni parë ndonjëherë më parë. Kjo është vërtet provimi i qëndrueshmërisë së opinionit tuaj.

Dhe kërkoni ndihmën e profesionistëve në fushën e Data Science

Nëse doni të respektoheni nga të gjithë ata që e kuptojnë këtë humor, ndaloni së fshehuri pas ekuacioneve të çuditshme për të mbështetur paragjykimet personale. Tregoni se çfarë keni. Nëse dëshironi që ata që "kanë kuptuar" ta shohin teorinë / modelin tuaj si diçka më shumë se një poezi frymëzuese, keni guximin të organizoni një shfaqje grandioze për sa mirë funksionon në një grup të ri të dhënash… para dëshmitarëve!

Kërkesa për menaxherët

Refuzoni të merrni seriozisht çdo "ide" për të dhënat derisa të provohen në të dhëna të reja. Nuk doni të bëni përpjekje? Qëndroni te analitika, por mos u mbështetni te këto ide — ato janë të pasigurta dhe nuk janë verifikuar për besueshmëri. Për më tepër, kur një organizatë ka të dhëna në bollëk, nuk ka asnjë defekt në bërjen e ndarjes një themel në shkencë dhe ta mbani atë në nivelin e infrastrukturës duke kontrolluar aksesin në të dhënat testuese për statistikat. Kjo është një mënyrë e shkëlqyer për të parandaluar përpjekjet për t'ju mashtruar!

Nëse dëshironi të shihni më shumë shembuj të mashtruesve që planifikojnë diçka të keqe — ky është një thurje e shkëlqyer në Twitter.

Përfundimet

Kur ka shumë pak të dhëna për ndarje, vetëm një mashtrues përpiqet të ndjekë me rigorozitet frymëzimin, duke zbuluar Amerikën retrospektivisht, duke e rikthyer matematikisht fenomenin që tashmë është i njohur në të dhëna, dhe duke e quajtur mrekullinë statistike të rëndësishme. Kjo i ndan ata nga analisti pa paragjykime që merret me frymëzimin dhe statistiku i kujdesshëm që ofron prova kur parashikon.

Kur ka shumë të dhëna, zhvilloni zakonin e ndarjes së të dhënave, kështu do keni më të mirat e të dyja botëve! Sigurohuni që të bëni analitikë dhe statistika ndaras për nëngrupet e ndryshme të grumbullimit fillestar të të dhënave.

  • Analistët ju ofrojnë frymëzim dhe një gamë perspektivash.
  • Statistikët ju ofrojnë testim të rregullt.
  • Mashtruesit ju ofrojnë një këndvështrim të çrregullt retrospektiv që pretendon se është analitikë plus statistikë.

Pas një leximi të artikullit, ndoshta iu shfaq mendimi «a nuk jam ndonjë mashtrues»? Kjo është në rregull. Këtë mendim mund ta largoni në dy mënyra: së pari, kthehuni prapa, shihni se çfarë keni arritur, a ka sjellë puna juaj me të dhënat ndonjë dobi praktike. Së dyti, mund të punoni më shumë mbi kualifikimet tuaja (çka padyshim nuk do të dëmtonte), sidomos sepse studentët tanë iu japin aftësi praktike dhe njohuri që i lejojnë ata të bëhen të vërtetë data scientistë.

Si si për të identifikuar një mashtrues në Data Science?

E tjera kurse

Lexoni më shumë

Burimi: habr.com

Bli një hosting të besueshëm për faqet me mbrojtje DDoS, VPS VDS serverë 🔥 Bli një hosting të besueshëm për faqet me mbrojtje DDoS, VPS VDS serverë | ProHoster