Być może słyszałeś o analitykach, specjalistach od uczenia maszynowego i sztucznej inteligencji, ale czy słyszałeś o tych, którzy są niesłusznie przepłacani? Poznaj oszustów danych! Ci sprytni ludzie, kuszeni dochodowymi ofertami, psują reputację prawdziwym specjalistom od przetwarzania danych. W artykule omawiamy, jak ujawniać takich ludzi.
Oszustów danych jest wszędzie
Oszustowie danych potrafią tak dobrze się ukrywać, że możesz być jednym z nich, nawet nie zdając sobie z tego sprawy. Prawdopodobnie Twoja organizacja przez lata ukrywała tych oszustów, ale jest dobra wiadomość: łatwo ich zidentyfikować, jeśli wiesz, czego szukać.
Pierwszy sygnał ostrzegawczy — niezrozumienie, że analityka i statystyka to zupełnie różne dyscypliny. Wyjaśnię to później.
Różne dyscypliny
Statystycy są szkoleni, aby wyciągać wnioski dotyczące tego, co wykracza poza ich dane, analitycy są szkoleni, aby badać zawartość zbioru danych. Innymi słowy, analitycy wyciągają wnioski na podstawie tego, co zawiera ich zbiór danych, a statystycy wyciągają wnioski na podstawie tego, czego w danych nie ma. Analitycy pomagają zadawać dobre pytania (formułować hipotezy), a statystycy pomagają uzyskiwać dobre odpowiedzi (testować hipotezy).
Są też dziwaczne hybrydowe role, kiedy ktoś stara się usiedzieć na dwóch krzesłach… Dlaczego nie? Podstawowa zasada nauki o danych: jeśli masz do czynienia z niepewnością, nie możesz używać tych samych punktów danych do hipotez i testów. Kiedy dane są ograniczone, niepewność zmusza do wyboru między statystyką a analityką. Wyjaśnienie .
Bez statystyki utkniesz i nie zrozumiesz, czy świeżo sformułowane stwierdzenie wytrzyma krytykę, a bez analizy działasz w ciemno, mając niewiele szans na okiełznanie nieznanego. To trudny wybór.
Wyjście oszusta z tej opresji — ignorowanie jej, a następnie udawanie zdziwionego, gdy coś nagle zostaje odkryte. Logika testowania hipotez statystycznych sprowadza się do pytania: czy dane wystarczająco nas zaskakują, aby zmienić nasze zdanie. Jak możemy być zaskoczeni danymi, jeśli już je widzieliśmy?
Za każdym razem, gdy oszuści znajdą wzór, czerpią inspirację, a następnie sprawdzają te same dane do tego samego wzoru, aby opublikować wynik z legitymnym p-wartością lub dwiema, obok swojej teorii. W ten sposób oszukują cię (a być może także siebie). Taka p-wartość nie ma znaczenia, jeśli nie trzymasz się swojej hipotezy do sposobu, w jaki przeglądali swoje dane. Szarlatani naśladują działania analityków i statystyków bez rozumienia przyczyn. W rezultacie cała dziedzina nauki o danych ma złą reputację.
Prawdziwi statystycy zawsze formułują swoje wnioski
Dzięki niemal mistycznej reputacji specjalistów w statystyce, zajmujących się ścisłymi rozważaniami, ilość fałszywych informacji w Data Science osiąga rekordowy poziom. Łatwo jest oszukać i nie zostać złapanym, szczególnie jeśli niczego niepodejrzewająca ofiara myśli, że wszystko sprowadza się do równań i danych. Zbiór danych to zbiór danych, prawda? Nie. Liczy się, jak go wykorzystujesz.
Na szczęście potrzebujesz tylko jednej wskazówki, aby złapać szarlatanów: oni 'odkrywają Amerykę na nowo po fakcie'. Na nowo odkrywają zjawiska, które, jak już wiedzą, są obecne w danych.
W przeciwieństwie do szarlatanów, dobrzy analitycy – są pozbawieni uprzedzeń i rozumieją, że inspirujące idee mogą mieć wiele różnych wyjaśnień. Jednocześnie dobrzy statystycy starannie określają swoje wnioski, zanim je sformułują.
Analitycy są zwolnieni z odpowiedzialności… dopóki nie wykraczają poza swoje dane. Jeśli czują pokusę, aby ogłosić coś, czego nie widzieli, to zupełnie inna praca. Powinni 'zdjąć buty' analityka i 'przebrać się' w buty statystyka. W końcu, jakie by nie było oficjalne stanowisko, nie ma zasady, która zabraniałaby ci studiowania obu zawodów, jeśli chcesz. Tylko nie myl ich.
Jeśli jesteś dobry w statystyce, to nie znaczy, że jesteś dobry w analizie, i odwrotnie. Jeśli ktoś próbuje ci powiedzieć coś przeciwnego, warto być ostrożnym. Jeśli ta osoba informuje cię, że możesz wyciągnąć wnioski statystyczne na podstawie danych, które już przestudiowałeś, to powód do podwójnej ostrożności.
Dziwaczne wyjaśnienia
Obserwując szarlatanów danych na wolności, zauważysz, że uwielbiają oni wymyślać fantastyczne historie, aby „wyjaśnić” obserwowane dane. Im bardziej akademickie, tym lepiej. Nie ma znaczenia, że te historie są dostosowane po fakcie.
Kiedy szarlatani tak postępują — pozwól mi nie żałować słów — kłamią. Żadne ilości równań ani piękne koncepcje nie zrekompensują faktu, że zaoferowali zerowe dowody swoich wersji. Nie zdziw się, jak niezwykłe są ich wyjaśnienia.
To tak, jakby demonstrować swoje „ekstrasensoryczne” zdolności, najpierw spoglądając na karty w rękach, a następnie przewidując, co trzymasz… to, co trzymasz. To jest stronniczość spojrzenia wstecz, a zawód data scientist jest tym przesycony.

Analitycy mówią: „Właśnie poszedłeś z damą karo”. Statystycy mówią: „Zapisałem swoje hipotezy na tym kawałku papieru, zanim zaczęliśmy. Zagrajmy, zobaczmy kilka danych i sprawdźmy, czy mam rację”. Szarlatani mówią: „Wiedziałem, że zamierzasz iść z tą damą karo, ponieważ…”
Podział danych to szybkie rozwiązanie problemu, którego potrzebuje każdy.
Gdy mamy ograniczone dane, musimy wybierać między statystyką a analityką, ale gdy danych jest w bród, jest doskonała okazja, aby bez oszustwa skorzystać z analityki. i Statystyki. Masz idealną ochronę przed szarlatanami — to podział danych i, moim zdaniem, to najpotężniejsza idea w Data Science.
Aby chronić się przed szarlatanami, wystarczy upewnić się, że trzymasz jakieś dane testowe z dala od ich ciekawskich oczu, a następnie traktować wszystko inne jako analitykę. Kiedy zderzasz się z teorią, którą ryzykujesz przyjąć, użyj jej, aby ocenić sytuację, a następnie otwórz swoje tajne dane testowe, aby sprawdzić, że teoria nie jest bzdurą. To takie proste!

Upewnij się, że nikt nie ma dostępu do danych testowych na etapie badań. W tym celu trzymaj się danych badawczych. Dane testowe nie powinny być używane do analizy.
To duży krok naprzód w porównaniu do tego, do czego ludzie przywykli w erze "małych danych", kiedy musisz tłumaczyć, skąd wiesz to, co wiesz, aby w końcu przekonać ludzi, że naprawdę coś wiesz.
Stosujemy te same zasady do ML/AI
Niektórych szarlatanów udających ekspertów w dziedzinie ML/AI również łatwo można wykryć. Złapiesz ich tak samo, jak złapałbyś każdego innego złego inżyniera: „rozwiązania”, które próbują zbudować, nieustannie zawodzą. Wczesny znak ostrzegawczy — brak doświadczenia w pracy ze standardowymi językami branżowymi i bibliotekami programistycznymi.
Ale co z osobami, które tworzą systemy, które wydają się działać? Jak rozpoznać, że dzieje się coś podejrzanego? Stosuje się ta sama zasada! Szarlatan to złowroga postać, która pokazuje ci, jak dobrze model działał… na tych samych danych, które wykorzystali do stworzenia modelu.
Jeśli stworzyłeś szalenie skomplikowany system uczenia maszynowego, jak możesz stwierdzić, jak dobry on jest? Nie dowiesz się, dopóki nie pokażesz, że działa z nowymi danymi, których wcześniej nie widział.
Kiedy widziałeś dane przed prognozowaniem – to mało prawdopodobne przedstawianiem.
Kiedy masz wystarczająco dużo danych do podziału, nie musisz odnosić się do piękna swoich formuł, aby uzasadnić projekt (stara modna tendencja, którą widzę wszędzie, nie tylko w nauce). Możesz powiedzieć: „Wiem, że to działa, bo mogę wziąć zestaw danych, którego wcześniej nie widziałem, i dokładnie przewidzieć, co się tam wydarzy… i będę mieć rację. Znowu i znowu”.
Weryfikacja twojego modelu/teorii na nowych danych to najlepsza podstawa do zaufania.
Nie toleruję szarlatanów danych. Nie interesuje mnie, czy twoje zdanie opiera się na różnych chwytach. Nie robi na mnie wrażenia piękno wyjaśnień. Pokaż mi, że twoja teoria/model działa (i nadal działa) na całej gamie nowych danych, których wcześniej nigdy nie widziałeś. To jest prawdziwy test odporności twojego zdania.
Zwracanie się do specjalistów w dziedzinie Data Science
Jeśli chcesz, aby wszyscy, którzy rozumieją ten humor, traktowali cię poważnie, przestań chować się za dziwacznymi równaniami, aby podtrzymywać osobiste uprzedzenia. Pokaż, co masz. Jeśli chcesz, aby ci, którzy "zrozumieli", traktowali twoją teorię/model jako coś więcej niż tylko inspirującą poezję, miej odwagę zorganizować wielkie przedstawienie tego, jak dobrze ona działa na zupełnie nowym zestawie danych… przy świadkach!
Zwrócenie się do liderów
Odmawiaj traktowania na poważnie jakichkolwiek "pomysłów" dotyczących danych, dopóki nie zostały one zweryfikowane na nowych danych. Nie chcesz się wysilać? Trzymaj się analityki, ale nie polegaj na tych pomysłach — są one zawodnie i nie były sprawdzone pod kątem wiarygodności. Co więcej, kiedy organizacja ma dane w obfitości, nie ma mowy o niechęci do uczynienia rozdzielenia fundamentem nauki i utrzymywania tego na poziomie infrastruktury, kontrolując dostęp do danych testowych dla statystyki. To doskonały sposób na przerwanie prób oszukania cię!
Jeśli chcesz zobaczyć więcej przykładów szarlatanów knujących coś niedobrego — .
Podsumowanie
Gdy danych jest zbyt mało do podziału, tylko szarlatan próbuje ściśle trzymać się inspiracji, odkrywając Amerykę retrospektywnie, matematycznie na nowo odkrywając zjawiska, o których już wiadomo, że istnieją w danych, i nazywając zdziwienie statystycznie istotnym. To odróżnia ich od bezstronnego analityka zmagającego się z inspiracją oraz drobiazgowego statystyka, który oferuje dowody podczas prognozowania.
Gdy danych jest dużo, wypracuj nawyk rozdzielania danych, dzięki czemu będziesz mieć najlepsze z obu światów! Koniecznie wykonuj analitykę i statystykę oddzielnie dla różnych podzbiorów pierwotnych danych.
- Analitycy oferują Ci inspirację i szeroką perspektywę.
- Statystycy oferują Ci rygorystyczne testowanie.
- Szarlatani oferują Ci wypaczony retrospektywny widok, który udaje analitykę plus statystykę.
By reading this article, you might think, "Am I a charlatan?" That’s normal. You can dismiss this thought in two ways: first, by reflecting on what you have accomplished and whether your work with data has made a practical impact. Secondly, you can work on enhancing your qualifications (which certainly won't hurt), especially since we provide our students with practical skills and knowledge that allow them to become true data scientists.
Inne kursy
Czytaj więcej
Źródło: habr.com
