Hoe herken je een oplichter in Data Science?

Hoe herken je een oplichter in Data Science?
Misschien hebt u gehoord van analisten, machine learning experts en kunstmatige intelligentie, maar heeft u gehoord van degenen die onterecht teveel betaald krijgen? Maak kennis met gegevenscharlatans! Deze slimme jongens, aangetrokken door lucratieve banen, creƫren een slechte reputatie voor echte data-experts. In dit artikel onderzoeken we hoe we deze mensen in het licht kunnen brengen.

Gegevenscharlatans zijn overal

Gegevenscharlatans zijn zo goed in het zich verbergen in het openbaar, dat u ƩƩn van hen zou kunnen zijn, zonder het zelfs maar te beseffen. Waarschijnlijk heeft uw organisatie deze slimmen jarenlang verborgen gehouden, maar er is goed nieuws: ze zijn gemakkelijk te identificeren als u weet wat u moet zoeken.
Het eerste waarschuwingssignaal is het onbegrip dat analyse en statistiek zeer verschillende disciplines zijn. Verder ga ik dit uitleggen.

Verschillende disciplines

Statistici zijn opgeleid om conclusies te trekken over wat buiten hun gegevens ligt, analisten zijn opgeleid om de inhoud van een dataset te bestuderen. Met andere woorden, analisten trekken conclusies over wat in hun gegevens aanwezig is, terwijl statistici conclusies trekken over wat niet in de gegevens zit. Analisten helpen goede vragen te stellen (hypotheses te formuleren), terwijl statistici helpen goede antwoorden te krijgen (hypotheses te testen).

Er zijn ook vreemde hybride functies waarbij iemand probeert op twee stoelen tegelijk te zitten... Waarom niet? Het belangrijkste principe van data science: als je met onzekerheid omgaat, kun je niet dezelfde datapunt gebruiken voor hypothesen en testen. Wanneer de gegevens beperkt zijn, dwingt de onzekerheid u om te kiezen tussen statistiek of analyse. Uitleg hier.

Zonder statistiek zult u vastlopen en niet begrijpen of de net geformuleerde uitspraak standhoudt, en zonder analyse loopt u blind rond met weinig kans om het onbekende te temmen. Dit is een moeilijke keuze.

De uitweg van de charlatan uit deze situatie is om deze te negeren en vervolgens te doen alsof hij verrast is met wat ineens ontdekt wordt. De logica van hypothesetests komt neer op de vraag: verrassen de gegevens ons genoeg om onze mening te veranderen? Hoe kunnen we door de gegevens verrast worden als we ze al hebben gezien?

Elke keer dat charlatans een patroon ontdekken, raken ze geĆÆnspireerd en controleren vervolgens dezelfde gegevens voor van hetzelfde patroon., om het resultaat met een legitieme p-waarde of twee te publiceren, naast hun theorie. Daarmee liegen ze tegen jou (en misschien ook tegen zichzelf). Zo'n p-waarde doet er niet toe als je niet vasthoudt aan je hypothese. tot hoe ze hun gegevens hebben bekeken. Charlatans imiteren de acties van analisten en statistici zonder de oorzaken te begrijpen. Als gevolg hiervan krijgt het hele vakgebied van datawetenschap een slechte reputatie.

Echte statistici trekken altijd hun conclusies.

Door de bijna mystieke reputatie van statistici die strenge redeneringen toepassen, is het aantal valse informatie in Data Science ongekend hoog. Het is gemakkelijk om te misleiden en niet gepakt te worden, vooral als een nietsvermoedend slachtoffer denkt dat het allemaal om vergelijkingen en gegevens draait. Een dataset is een dataset, toch? Nee. Het maakt uit hoe je het gebruikt.

Gelukkig heb je maar ƩƩn aanwijzing nodig om charlatans te ontmaskeren: ze 'herontdekken Amerika achteraf'. Ze ontdekken fenomenen opnieuw die ze al uit de gegevens weten te halen.

In tegenstelling tot charlatans hebben goede analisten geen vooroordelen en begrijpen ze dat inspirerende ideeƫn vele verschillende verklaringen kunnen hebben. Tegelijkertijd formuleren goede statistici hun conclusies zorgvuldig voordat ze deze bekendmaken.

Analisten zijn niet verantwoordelijk... zolang ze binnen hun gegevens blijven. Als ze in de verleiding komen om te beweren wat ze niet hebben gezien, is dat een heel andere zaak. Ze moeten 'de schoenen van de analist uitdoen' en 'overstappen in de schoenen van de statisticus'. Uiteindelijk, wat de officiƫle functietitel ook is, er bestaat geen regel die je verbiedt beide beroepen te bestuderen als je dat wilt. Maar verwissel ze niet.

Als je goed bent in statistiek, betekent dat niet dat je goed bent in analyse, en vice versa. Als iemand je het tegendeel probeert te vertellen, is het tijd om waakzaam te zijn. Als die persoon je vertelt dat het is toegestaan om statistische conclusies te trekken uit gegevens die je al hebt bestudeerd, moet je dubbel waakzaam zijn.

Bijzondere verklaringen

Als je de gegevenscharlatans in het wild observeert, merk je dat ze dol zijn op het verzinnen van fantastische verhalen om de waargenomen gegevens te 'verklaren'. Hoe academischer, hoe beter. Het maakt niet uit dat deze verhalen achteraf worden aangepast.

Wanneer charlatans dit doen — laat me niet besparen op woorden — liegen ze. Geen hoeveelheid vergelijkingen of mooie concepten compenseert het feit dat ze nul bewijs voor hun versies hebben aangeboden. Verwonder je niet over hoe vreemd hun verklaringen zijn.

Het is hetzelfde als jezelf 'extrazintuiglijk' te demonstreren door eerst naar de kaarten in je handen te kijken en vervolgens te voorspellen wat je vasthoudt… wat je vasthoudt. Dit is de vertekening van de retrospectieve blik, en het beroep van datascientist is hiermee compleet volgepropt.

Hoe herken je een oplichter in Data Science?

Analisten zeggen: 'Je bent net met de harten koningin gegaan.' Statistici zeggen: 'Ik heb mijn hypothesen op dit stukje papier genoteerd voordat we begonnen. Laten we spelen, wat gegevens bekijken en zien of ik gelijk heb.' Charlatans zeggen: 'Ik wist dat je met die harten koningin zou gaan, omdat...'

Data-segmentatie is een snelle oplossing voor een probleem waar iedereen behoefte aan heeft.

Wanneer er niet veel data is, moet je kiezen tussen statistiek en analyse, maar wanneer er overvloedige data is, is er een geweldige kans om zonder bedrog van analyses te profiteren. en Statistiek. Je hebt de perfecte bescherming tegen charlatans — datasegmentatie en naar mijn mening is dit het krachtigste idee in Data Science.

Om jezelf te beschermen tegen charlatans, moet je er alleen voor zorgen dat je wat testgegevens buiten hun nieuwsgierige ogen houdt, en behandel de rest als analyse. Wanneer je geconfronteerd wordt met een theorie die je overweegt te accepteren, gebruik deze dan om de situatie te beoordelen, en open vervolgens je geheime testgegevens om te controleren of de theorie onzin is. Het is zo eenvoudig!

Hoe herken je een oplichter in Data Science?
Zorg ervoor dat niemand de testgegevens kan inzien tijdens de onderzoeksfase. Houd je aan de onderzoeksgegevens. Testgegevens mogen niet voor analyse worden gebruikt.

Dit is een grote stap vooruit vergeleken met wat mensen gewend zijn in het tijdperk van 'kleine data', wanneer je moet uitleggen waar je je kennis vandaan hebt om mensen uiteindelijk te overtuigen dat je echt iets weet.

We passen dezelfde regels toe op ML/AI

Sommige charlatans die zich voordoen als deskundigen op het gebied van ML/AI zijn ook gemakkelijk te herkennen. Je pakt ze net zoals je elke andere slechte ingenieur zou vangen: de 'oplossingen' die ze proberen te bouwen falen continu. Een vroegtijdig waarschuwingssignaal is het gebrek aan ervaring met standaard branchestandaarden en programmeertalen.

Maar hoe zit het met mensen die systemen creƫren die operationeel lijken? Hoe weet je wanneer er iets verdachts aan de hand is? Dezelfde regel geldt! Een charlatan is een sinister figuur die je laat zien hoe goed een model heeft gewerkt... op dezelfde data die ze hebben gebruikt om het model te bouwen.

Als je een extreem complex systeem voor machine learning hebt gebouwd, hoe weet je dan hoe goed het is? Je komt daar pas achter als je kunt laten zien dat het werkt met nieuwe data die het nog niet heeft gezien.

Wanneer je de data hebt gezien vóór de voorspelling - dat is waarschijnlijk niet eenvoorspelling.

Wanneer je genoeg data hebt om te splitsen, hoef je niet te verwijzen naar de schoonheid van je formules om het project te rechtvaardigen (een oude gewoonte die ik overal zie, niet alleen in de wetenschap). Je kunt zeggen: ā€œIk weet dat dit werkt omdat ik een dataset kan nemen die ik nog nooit eerder heb gezien en precies kan voorspellen wat daar zal gebeuren... en gelijk zal hebben. Steeds weer.ā€

Het testen van je model/theorie op nieuwe data is de beste basis voor vertrouwen.

Ik heb geen geduld voor data charlatans. Het maakt me niet uit of jouw mening is gebaseerd op verschillende trucs. De schoonheid van uitleggen imponert me niet. Laat me zien dat jouw theorie/model werkt (en blijft werken) op een reeks nieuwe data die je nog nooit eerder hebt gezien. Dat is de echte test van de robuustheid van jouw mening.

Raadpleeg experts op het gebied van Data Science

Als je wilt dat iedereen die deze humor begrijpt je serieus neemt, stop dan met je te verbergen achter bizarre vergelijkingen om persoonlijke vooroordelen te ondersteunen. Laat zien wat je hebt. Als je wilt dat degenen die "het hebben begrepen" jouw theorie/model als meer dan slechts inspirerende poĆ«zie beschouwen, wees dan moedig genoeg om een grandioze demonstratie te geven van hoe goed het werkt op een geheel nieuwe dataset… in het bijzijn van getuigen!

Toewijding aan leidinggevenden

Weiger alle "ideeĆ«n" over gegevens serieus te nemen totdat ze zijn getest op nieuwe data. Geen zin om moeite te doen? Blijf dan bij analytics, maar vertrouw niet op deze ideeĆ«n — ze zijn onbetrouwbaar en zijn niet op betrouwbaarheid getest. Bovendien, wanneer een organisatie over voldoende gegevens beschikt, is er geen tekort aan het maken van scheiding als basis in wetenschap en het handhaven ervan op infrastructureel niveau, door toegang tot testgegevens voor statistieken te controleren. Dit is een uitstekende manier om te voorkomen dat men je bedriegt!

Als je meer voorbeelden wilt zien van charlatans die iets kwaads in de zin hebben — hier is een geweldige thread op Twitter.

Conclusies

Wanneer er te weinig gegevens zijn voor een scheiding, probeert alleen een charlatan strikt inspiratie te volgen, de America retrospectief te herontdekken, fenomenen die al in de gegevens bekend zijn wiskundig opnieuw te ontdekken en verwondering statistisch significant te noemen. Dit onderscheidt hen van een onbevooroordeeld analyst die zich bezighoudt met inspiratie, en een nauwgezette statisticus die bewijs levert bij voorspellingen.

Wanneer er veel gegevens zijn, maak dan de gewoonte om gegevens te scheiden, zodat je het beste van beide werelden kunt hebben! Zorg ervoor dat je analytics en statistiek apart uitvoert voor afzonderlijke subsets van de oorspronkelijke data-overload.

  • Analisten biedt je inspiratie en breedte van visie.
  • Statistici biedt je strikte testen.
  • Charlatans biedt je een verdraaid retrospectief beeld dat zich voordoet als analytics plus statistiek.

Het is mogelijk dat je na het lezen van dit artikel denkt: "ben ik geen oplichter?" Dat is normaal. Je kunt deze gedachte op twee manieren aanvechten: ten eerste, kijk om je heen en zie wat je hebt bereikt; heeft je werk met gegevens praktische waarde toegevoegd? Ten tweede kun je blijven werken aan je kwalificaties (wat zeker geen kwaad kan), vooral omdat we onze studenten praktische vaardigheden en kennis bijbrengen die hen in staat stellen echte data scientists te worden.

Hoe herken je een oplichter in Data Science?

Meer cursussen

Lees meer

Bron: habr.com

Koop betrouwbare webhosting met bescherming tegen DDoS, VPS VDS servers šŸ”„ Koop betrouwbare webhosting met bescherming tegen DDoS, VPS VDS servers | ProHoster