Strukturyzacja ryzyk i rozwiązań przy użyciu BigData do pozyskiwania oficjalnych statystyk

Przedmowa tłumacza

Materiał zainteresował mnie, przede wszystkim z powodu poniższej tabeli:

Strukturyzacja ryzyk i rozwiązań przy użyciu BigData do pozyskiwania oficjalnych statystyk

Biorąc pod uwagę, że statystycy (a ci rosyjscy, na poziomie genetycznym) delikatnie mówiąc, nie przepadają za wszystkim, co odbiega od liniowego rozkładu, ci panowie zdołali wprowadzić użycie funkcji aktywacji w postaci parabolicznej do określenia stopnia ryzyka związanego z wykorzystaniem Big Data w oficjalnych statystykach. Brawo. Oczywiście, statystycy dodali swoje zastrzeżenie do tej pracy – „1 Jakiekolwiek błędy i braki są wyłączną odpowiedzialnością autorów. Opinie wyrażone w tym dokumencie są osobiste i niekoniecznie odzwierciedlają oficjalne stanowisko Komisji Europejskiej”. Ale publikację wydano. Myślę, że na dziś to wystarczy, a oni (autorzy) nikomu nie zabraniali odnajdywania swoich skali w tych aspektach.

W pracy można dość strukturalnie podzielić, gdzie i w jaki sposób metody statystyczne różnią się od metod badawczych dla Big Data. Moim zdaniem, największą korzyść z tej pracy można uzyskać podczas rozmowy z klientem oraz do obalania jego stwierdzeń typu:

— A my sami zbieramy statystyki, co jeszcze chcecie badać?
— A wy nam przedstawicie swoje wyniki tak, abyśmy mogli je uzgodnić z naszymi statystykami. W tej kwestii autorzy sugerują, że warto przeczytać tę pracę (3 Jak wielkie jest Big Data? Badanie roli Big Data w oficjalnych statystykach)

W tej pracy autorzy przedstawili swoje postrzeganie poziomu ryzyka. Ten parametr umieszczony jest w nawiasach, nie mylić z odniesieniem do źródeł.

Drugie spostrzeżenie. Autorzy używają terminu BDS – to odpowiednik pojęcia Big Data. (wyraźnie ukłon w stronę oficjalnych statystyk).

Przedmowa autorów

Coraz więcej urzędów statystycznych bada możliwości wykorzystania dużych zbiorów danych do przygotowania oficjalnej statystyki. Obecnie istnieje tylko kilka przykładów, w których zbiorniki te zostały całkowicie zintegrowane w rzeczywistej produkcji statystycznej. W związku z tym pełny zakres konsekwencji wynikających z ich integracji nadal nie jest znany. W międzyczasie podjęto pierwsze próby analizy warunków i wpływu dużych danych na różne aspekty produkcji statystycznej, takie jak jakość czy metodologia. Niedawno grupa robocza opracowała podstawy jakościowe przygotowania danych statystycznych opartych na dużych zbiorach danych w kontekście projektu dużych danych Komisji Gospodarczej dla Europy Organizacji Narodów Zjednoczonych (UNECE). Zgodnie z europejskim kodeksem praktyk statystycznych dostarczanie wysokiej jakości informacji statystycznych jest głównym zadaniem urzędów statystycznych. Ponieważ ryzyko definiowane jest jako wpływ niepewności na cele (na przykład przez Międzynarodową Organizację Normalizacyjną ISO 31000), uznaliśmy za stosowne sklasyfikować ryzyko zgodnie z wymiarami jakości, na które mają one wpływ.
Proponowana struktura jakości danych statystycznych pozyskiwanych z dużych zbiorów danych zapewnia zorganizowane przedstawienie jakości związanej ze wszystkimi etapami statystycznego procesu biznesowego i w ten sposób może służyć jako podstawa do kompleksowej oceny i zarządzania ryzykiem związanym z tymi nowymi źródłami danych. Wprowadza nowe wymiary jakości, które są specyficzne dla (lub o wysokim znaczeniu w przypadku) wykorzystania dużych danych w oficjalnej statystyce, takie jak środowisko instytucjonalne/biznesowe czy złożoność. Dzięki tym nowym wymiarom jakości można bardziej systematycznie identyfikować ryzyka związane z wykorzystaniem dużych zbiorów danych w oficjalnej statystyce.

W niniejszej pracy dążymy do zidentyfikowania ryzyk związanych z wykorzystaniem dużych zbiorów danych w kontekście statystyki publicznej. Przyjmujemy systemowe podejście do określenia ryzyk w ramach proponowanej struktury jakości. Skupiając się na nowo zaproponowanych wymiarach jakości, możemy opisać ryzyka, które obecnie są nieobecne lub mają niewielki wpływ na produkcję oficjalnej statystyki. Jednocześnie możemy określić istniejące ryzyka, które będą oceniane zupełnie inaczej w przypadku wykorzystania dużych zbiorów danych do uzyskiwania statystyk. Następnie przechodzimy do dalszego cyklu zarządzania ryzykiem i przedstawiamy ocenę prawdopodobieństwa oraz wpływu tych ryzyk. Ponieważ ocena ryzyk wiąże się z subiektywnością w ich przypisywaniu, prawdopodobieństwo i wpływ różnych ryzyk mierzymy zgodnością między dziesiątkami różnych zainteresowanych stron, które zostały przedstawione niezależnie. Następnie proponujemy opcje łagodzenia tych ryzyk zgodnie z czterema podstawowymi kategoriami: unikanie, redukcja, współdzielenie i zatrzymanie. Zgodnie z ISO jednym z zasad zarządzania ryzykiem powinno być tworzenie wartości, tj. zasoby na zmniejszenie ryzyk powinny być niższe niż w przypadku bezczynności. Zgodnie z tą zasadą dokonamy oceny potencjalnego wpływu niektórych działań mających na celu łagodzenie ryzyk na jakość ostatecznych wyników, aby dojść do bardziej kompleksowej oceny wykorzystania dużych zbiorów danych w statystyce publicznej.

1. Wprowadzenie

1.1. Tło

Rozwój "dużych danych" został scharakteryzowany przez Kennetha Neila Cukiera i Viktora Mayera-Schönbergera w ich artykule "Wzrost dużych danych" (2. www.foreignaffairs.com/articles/139104/kenneth-neil-cukier-and-viktor-mayer-schoenberger/therise-of-big-dataterminem „datafication”. Datafikacja jest opisana jako proces „przyjmowania wszystkich aspektów życia i przekształcania ich w dane”. Na przykład. Facebook zapewnia osobiste sieci, czujniki dla wszelkiego rodzaju warunków środowiskowych, smartfony do osobistej komunikacji i ruchów, dane noszone do osobistych warunków. Prowadzi to do niemal powszechnego zbierania i dostępności danych.

Jak w wielu innych sektorach, oficjalne statystyki dopiero niedawno zaczęły omawiać problem big data na poziomie strategicznym. Wciąż brakuje ogólnego i powszechnie przyjętego zrozumienia sposobu dalszego działania, niezależnie od tego, czy chodzi o wyzwanie, czy o możliwość, niezależnie od tego, czy jest ono małe, czy duże itd. W ramach Grupy Wysokiego Szczebla zajmującej się modernizacją produkcji oraz usług statystycznych (3 Jak duże jest Big Data? Badanie roli Big Data w oficjalnych statystykach: www1.unece.org/stat/platform/download/attachments/99484307/VirtualSprintBigDatapaper.docx?version=1&modificationDate=1395217470975&api=v2), a Pierwsza analiza SWOT, towarzysząca ogólnemu analizie ryzyka/kosztów, została przeprowadzona. Zauważono, że "dokładna analiza ryzyk będzie również obejmować takie aspekty jak prawdopodobieństwo i wpływ i może być również poszerzona w celu określenia strategii obniżania ryzyk i ich zarządzania".

Chociaż ten dokument jeszcze daleko jest od kompleksowej analizy ryzyk, ma na celu poprawę sytuacji poprzez stworzenie pierwszego strukturalnego przeglądu. Chcielibyśmy podkreślić, że ten przegląd powinien być traktowany jako punkt wyjścia do stymulowania ogólnej dyskusji w ramach Oficjalnej Społeczności Statystycznej (OSC).

1.2. Zakres

Artykuł ten poświęcony jest wyłącznie ryzykom, wyłączając nie tylko korzyści, ale także mocne i słabe strony, możliwości i zagrożenia. Oznacza to, że "ryzyka braku działania" (na przykład ryzyko, że OSC pozostanie w tyle za innymi graczami, jeśli nie zostanie zmodernizowana) nie wchodzą w zakres; to raczej zagrożenia. Zamiast tego próbujemy wydzielić ryzyka, które mogą wystąpić (a) jeśli OSC będzie wykorzystywać możliwości, jakie niesie ze sobą big data, i zacznie opracowywać lub udoskonalać konkretny "produkt oficjalnej statystyki oparty na big data" (BOSP); (b) ryzyka dla nowego "normalnego biznesu", tzn. ryzyka dla oficjalnej statystyki opartej na produkcji "big data". (Ponieważ wszelka produkcja oficjalnej statystyki związana jest z ryzykiem, ograniczamy się do (b) specyficznych dla "ryzyk big data", tzn. ryzyk, które nie istnieją lub są nieznaczne w kontekście "tradycyjnego" procesu zbierania oficjalnych statystyk.)

1.3. Struktura

W sekcji 2 przedstawiamy podstawowe zasady dotyczące tego zadania, zaczynając od wyraźnie niezbędnej podstawy zarządzania ryzykiem i zarządzania ryzykiem (sekcja 2.1). Prezentujemy również wstępną strukturę jakości danych statystycznych, uzyskanych na podstawie dużych zbiorów danych (sekcja 2.2), ponieważ powiązanie struktury jakości z ryzykami spełnia dwa cele:

  • Ustala kontekst dla określenia ryzyk. Określone wskaźniki jakości, wraz z rozważanymi cechami, wyrażają wartości obiektu, które uważane są za istotne i kluczowe do świadczenia usług klientom i użytkownikom.
  • Umożliwia to przypisanie konkretnych ryzyk do jakościowych pomiarów, które są osadzone w ogólnych hiperprzestrzeniach i związane z określonymi etapami w procesie produkcji produktów statystycznych.

W sekcjach 3, 4, 5 i 6 prezentujemy ryzyka zidentyfikowane dotychczas w różnych kontekstach (4 Dokumenty dotyczące przypadku biznesowego ESS (https://www.europeansocialsurvey.org/about/structure_and_governance.html) Projekt dużych danych, a także sieci ESS Big Data zawierają listę ryzyk częściowo związanych z projektem i częściowo z wykorzystaniem źródeł dużych danych do celów statystycznych. Dokument „Sugerowana struktura dla jakości dużych danych” wspomina o niektórych ryzykach związanych z wymiarami jakości.). W tym kontekście używamy klasyfikacji dostępu do danych, środowiska prawnego, prywatności i bezpieczeństwa danych, a także umiejętności; reorganizacja zgodna ze struktura jakości statystyki uzyskanej z dużych zbiorów danych (sekcja 2.2) powinna być rozważona, jak tylko ta struktura osiągnie bardziej zaawansowany status. Dla każdego z zidentyfikowanych ryzyk (i) dostarczamy ocenę prawdopodobieństwa oraz wpływu (zgodnie z sekcją 2.1.3) oraz (ii) proponujemy strategie ograniczania ryzyk i zarządzania nimi (patrz sekcja 2.1.4).

Na koniec omówimy nasze wnioski i nakreślimy niektóre następne kroki w sekcji 7

2. Podstawy

2.1. Ryzyka i zarządzanie ryzykiem

Zgodnie z normą ISO 31000: 20095 ryzyko definiuje się jako „wpływ niepewności na ustalone cele”. Oznacza to, że cele muszą być określone lub znane, zanim będzie można zidentyfikować ryzyka. Cele te zazwyczaj są definiowane w kontekście instytucjonalnym danej organizacji. Kolejnym ważnym zagadnieniem jest to, że ryzyka mają charakter niepewności, co oznacza, że nie jest pewne, czy opisane zdarzenie wystąpi. W związku z tym ryzyka są mierzone pod kątem prawdopodobieństwa wystąpienia zdarzenia oraz jego konsekwencji, tj. wpływu, jaki ma dane zdarzenie na osiągnięcie ustalonych celów. Ocena ryzyk powinna dostarczać bardziej obiektywnych informacji, które ostatecznie pozwolą znaleźć odpowiednią równowagę między realizacją możliwości uzyskania zysku a minimalizacją niekorzystnych konsekwencji. Zarządzanie ryzykiem jest nieodłączną częścią praktyki zarządzania i ważnym elementem odpowiednich praktyk korporacyjnych (6 Statistics Canada: 2014-2015 report on Plans and Priorities, www.statcan.gc.ca/aboutapercu/rpp/2014-2015/s01p06-eng.htm). Jest to iteracyjny proces, który w idealnym przypadku pozwala na ciągłe doskonalenie procesu podejmowania decyzji i sprzyja stałemu poprawianiu wydajności.

Ryzyka są również związane z jakością. Wdrożenie systemu jakości powinno pozwolić na wykorzystanie możliwości oferowanych przez różne źródła i metody do osiągnięcia wyniku określonego poziomu jakości w tym sensie, że ten wynik spełnia potrzeby użytkowników. Podobnie jak ryzyka, poziomy jakości mogą wynikać z kontekstu instytucjonalnego oraz celów określonych instytucji. W tym kontekście środowisko instytucjonalne definiuje ogólny poziom ryzyka, które organizacja jest gotowa ponieść w celu osiągnięcia swoich celów.

Proces oceny i zarządzania ryzykiem można podzielić na różne etapy, które obejmują ustalenie kontekstu, identyfikację ryzyk, analizę ryzyk pod kątem prawdopodobieństwa i wpływu, ocenę ryzyk i wreszcie zarządzanie ryzykami.

2.1.1. Kontekst instytucjonalny

Pierwszym krokiem jest ustalenie kontekstu strategicznego, organizacyjnego oraz kontekstu zarządzania ryzykiem, w którym będzie się odbywać reszta procesu. Obejmuje to ustalenie kryteriów, według których będą oceniane ryzyka oraz określenie struktury analizy.

2.1.2. Identyfikacja ryzyka

W drugim etapie należy określić zdarzenia, które mogą wpłynąć na osiągnięcie postawionych celów. Identyfikacja powinna obejmować pytania dotyczące rodzaju ryzyka, terminu zdarzenia, miejsca oraz tego, w jaki sposób zdarzenia mogą zapobiec, pogorszyć, opóźnić lub poprawić osiągnięcie celów.

2.1.3. Ocena ryzyka

Kolejnym krokiem jest określenie istniejących środków kontroli oraz analiza ryzyk w kontekście prawdopodobieństwa, a także potencjalnych konsekwencji. W kontekście tego artykułu, prawdopodobieństwo wystąpienia ryzyk używa skali od 1 (mało prawdopodobne) do 5 (częste). Wpływ wystąpienia zdarzeń mierzy się w skali od 1 (niewielki) do 5 (ekstremalny). Jak pokazano w tabeli 1, iloczyn prawdopodobieństwa i wpływu daje "poziom ryzyka" w zakresie od 1 do 25.

Strukturyzacja ryzyk i rozwiązań przy użyciu BigData do pozyskiwania oficjalnych statystyk

Oszacowane poziomy ryzyka można porównać z wcześniej określonymi kryteriami, aby ustalić równowagę między potencjalnymi korzyściami a niekorzystnymi rezultatami. Pozwala to na podejmowanie decyzji o priorytetach zarządzania.

Strukturyzacja ryzyk i rozwiązań przy użyciu BigData do pozyskiwania oficjalnych statystyk

Priorytet działań powinien być ukierunkowany na krytyczne ryzyka (patrz Tabela 2), czyli na te, które mogą wystąpić i mają poważne lub ekstremalne konsekwencje dla celów organizacji.

2.1.4. Reakcja na ryzyka

Ostatni krok polega na podejmowaniu decyzji dotyczących reakcji na ryzyko. Niektóre ryzyka, które są poniżej określonego poziomu, mogą być ignorowane lub akceptowane. W przypadku innych koszty neutralizacji ryzyk mogą być na tyle wysokie, że przewyższają potencjalne korzyści. W takim przypadku organizacja może zdecydować się na rezygnację z odpowiedniej działalności. Ryzyka mogą być również przekazywane stronom trzecim, takim jak ubezpieczenia, które rekompensują poniesione wydatki. Ostatnia opcja to uwzględnienie ryzyk przy określaniu strategii i działań, które równoważą koszty z potencjalnymi korzyściami. W ten sposób organizacja podejmie decyzje dotyczące wdrażania strategii maksymalizujących korzyści i minimalizujących potencjalne koszty.

Strukturyzacja ryzyk i rozwiązań przy użyciu BigData do pozyskiwania oficjalnych statystyk

2.2. Systemy jakości

Grupa docelowa złożona z przedstawicieli krajowych i międzynarodowych organizacji statystycznych opracowała w 2014 roku wstępną strukturę jakości dla statystyki pozyskiwanej z dużych zbiorów danych. Grupa robocza działała pod auspicjami projektu UNECE/HLG „Rola dużych zbiorów danych w modernizacji produkcji statystycznej”. Rozszerzyła ona istniejące systemy jakości opracowane do oceny statystyki pozyskiwanej z administracyjnych źródeł danych, wprowadzając wskaźniki jakości, które uznano za ważne dla dużych zbiorów danych.

W ramach tego systemu rozróżnia się trzy fazy procesu biznesowego: wprowadzenie, wydajność i wynik. Faza wprowadzenia odpowiada fazom „projektowania” i „zbierania” GSBP, wydajność dotyczy faz „procesu” i „analizy”, a dane wyjściowe są równoważne fazie „dystrybucji”.

W strukturze zastosowano hierarchiczną strukturę, która została zaczerpnięta z struktury danych administracyjnych opracowanej przez Urząd Statystyczny Holandii (7 Daas, P., S. Ossen, R. Vis-Visschers oraz J. Arends-Toth, (2009), Lista kontrolna oceny jakości źródeł danych administracyjnych. Statystyka Holandia, Haga/Heerlen). Pomiar jakości jest osadzony w hierarchicznej strukturze zwanej hiperspacjami. Trzy określone hipowymiarami to „źródło”, „metadane” i „dane”. Pomiar jakości osadzony jest w tych hipowymiarach i przypisywany każdemu z etapów produkcji. Dla fazy wejściowej zaproponowano dodatkowe aspekty „prywatność i poufność”, „skomplikowanie” (zgodnie ze strukturą danych), „kompletność” metadanych oraz „spójność” (możliwość powiązania danych z innymi danymi), aby uzupełnić model standardowej jakości. Dla każdego z wskaźników jakości proponuje się czynniki odnoszące się do ich opisu, a także możliwe wskaźniki.

W kontekście tego artykułu ryzyka mogą być wyłączone z tych czynników. Na przykład, czynniki, które należy wziąć pod uwagę przy pomiarze jakości „instytucjonalnego / biznesowego otoczenia”, to stabilność dostawcy danych. Związane z tym ryzyko może polegać na tym, że dane nie będą dostępne u dostawcy danych w przyszłości. Inny przykład dotyczy niedawno zaproponowanego aspektu jakości, prywatności i bezpieczeństwa. Jednym z ważnych czynników jest „percepcja”, co oznacza możliwą negatywną percepcję zamierzonego wykorzystania konkretnych źródeł danych przez różne zainteresowane strony.

3. Ryzyka związane z dostępem do danych

3.1. Brak dostępu do danych
3.1.1. Opis

To ryzyko dotyczy projektu związanego z rozwojem BOSP, który nie uzyskuje dostępu do niezbędnego źródła dużych danych (BDS).

Do tej pory OSC przyswoił sobie trudną drogę, że nawet wyjście z bloków startowych i uzyskanie tego dostępu są czasami nieprzezwyciężonymi przeszkodami. Czasami łatwo jest uzyskać dostęp do konkretnego źródła — jak zapisy danych o połączeniach (CDR), na potrzeby testów / badań, ale znacznie trudniej (z powodów prawnych lub komercyjnych) uzyskać dostęp do niego w celach produkcyjnych.

3.1.2. Prawdopodobieństwo

Prawdopodobieństwo w dużej mierze zależy od cech BDS. Jeśli dotyczy to dużych danych administracyjnych, może wynosić zaledwie 1, szczególnie gdy (jak w przypadku danych o ruchu, badanych przez Daas i in. 8 Daas, P., M. Puts, B. Buelens i P. van den Hurk. 2015. „Big Data as a Source for Official Statistics”. Journal of Official Statistics 31 (2). (Wkrótce; publikacja przewidywana na czerwiec 2015.)) nie ma problemów z ochroną danych osobowych. Jeśli przypadek BDS dotyczy osoby prywatnej, szczególnie jeśli jest wrażliwy (np. z punktu widzenia ochrony danych) lub wartościowy (z perspektywy handlowej), to prawdopodobieństwo może być bardzo wysokie (5).

3.1.3. Wpływ

Wpływ zależy od BOSP i sposobu użycia BDS. Jeśli BDS znajduje się w centrum, wpływ może być bardzo wysoki (4 = całkowicie niemożliwe wytworzenie BOSP), podczas gdy może być niższy, jeśli wciąż możliwe jest wytworzenie BOSP (choć z gorszą jakością), polegając na innych URB, co prowadzi do wpływu w zakresie 2-3.

3.1.4. Zapobieganie

Aby zredukować ryzyko braku dostępu, należy nawiązać wstępne kontakty z dostawcą danych i zawrzeć długoterminową umowę o dostęp do danych. Ponadto należy przeprowadzić kompleksową analizę prawną dotyczącą konkretnej kombinacji BDS i BOSP. Należy również ocenić możliwości dostępu do danych w oparciu o obowiązujące lub przyszłe przepisy prawne.

3.1.5. Łagodzenie

Jeśli istnieją alternatywne BDS, które można wykorzystać do BOSP, można je rozważyć jako zamiennik. Jeżeli nie ma możliwości wytworzenia BOSP bez BDS, i jeśli nie można pokonać braku dostępu, działania powinny zostać wstrzymane, a nowy BOSP nie ujrzy światła dziennego.

3.2. Utrata dostępu do danych
3.2.1. Opis

Ryzyko polega na tym, że zarządzanie statystyczne traci BDS, na którym oparty jest BOSP.

3.2.2. Prawdopodobieństwo

Jeśli BOSP jest już w produkcji, zazwyczaj istnieje określona stabilność, a w niektórych przypadkach ryzyko może być bardzo niskie (1). Jednak w przypadku prywatnych podmiotów, z którymi zawarto niewystarczająco solidne umowy, nic nie stoi na przeszkodzie, aby nowe kierownictwo zmieniło politykę udostępniania danych, co prowadzi do umiarkowanego ryzyka zerwania (3). Co więcej, jeśli BDS jest związane z niestabilną działalnością, zawsze istnieje ryzyko, że dostawca po prostu zbankrutuje, a ryzyko może być nawet wyższe (4).

3.2.3. Wpływ

Ponieważ istniejący BOSP może być niemożliwy do produkcji, często ma miejsce bardzo silny wpływ (5). W innych przypadkach, gdy BDS ma charakter pomocniczy, wpływ może być raczej utratą jakości z wpływem w zakresie 2-3.

3.2.4. Zapobieganie

Strategia zapobiegania jest podobna do strategii braku dostępu do danych, ale z większym naciskiem na stałą czujność również w warunkach produkcyjnych.

Nie wkładać wszystkich jajek do jednego koszyka (tzn. mieć kilka BDS, które leżą u podstaw każdego BSOP) również może być strategią, ale może to być albo niepraktyczne, albo zbyt kosztowne.

3.2.5. Łagodzenie

Jeśli BDS jest wynikiem niestabilnej działalności, możliwe, że stopniowo stanie się dostępne nowe BDS, odzwierciedlające ten sam fenomen społeczny. Jednak byłoby za późno, aby rozpocząć „skanowanie rynku”, gdy BSOP się zepsuje; wymagana jest stała czujność — co może być trudne do osiągnięcia.

4. Ryzyko związane z otoczeniem prawnym

4.1. Niedotrzymanie odpowiednich przepisów
4.1.1. Opis

To ryzyko dotyczy projektu związanego z opracowaniem BOSP, w którym nie uwzględniono odpowiednich przepisów, co czyni BOSP niezgodnym z danym prawodawstwem. Może to dotyczyć przepisów dotyczących ochrony danych, regulacji dotyczących obciążenia odpowiedzi itd.

4.1.2. Prawdopodobieństwo

Biorąc pod uwagę brak wiedzy OSC na temat wielkich danych, nie można wykluczyć, że przypadkowe (3) niedotrzymanie może mieć miejsce. Prawdopodobieństwo jest zazwyczaj związane z BDS, ponieważ im mniej „wrażliwe” jest źródło, tym mniejsze prawdopodobieństwo wystąpienia niezgodności.

4.1.3. Wpływ

Wpływ jest zazwyczaj krytyczny (4) w tym sensie, że dla niezgodnej produkcji konieczne będzie zatrzymanie BOSP (lub, jeśli nie osiągnął jeszcze etapu realizacji, jego rozwój należy przerwać). Może to być nawet ekstremalne (5), ponieważ ryzyka reputacyjne wynikające z niezgodności ("nielegalnych") oficjalnych statystyk mogą mieć konsekwencje.

4.1.4. Zapobieganie

Dla każdego BOSP niezbędna jest dokładna analiza prawna — i dzieje się to na kilku etapach (to, co jest akceptowane na etapie rozwoju / eksploracji, może nie być takie na etapie wdrożenia / produkcji). Może to z kolei prowadzić do reorganizacji BOSP, aby uczynić go zgodnym.

4.1.5. Łagodzenie

W zależności od powagi niezgodności, pierwszym krokiem może być przestawienie BOSP w tryb offline.

Reorganizacja BOSP, aby uczynić go zgodnym, może być opcją, ale to, czy BOSP zostanie "uratowany" w ten sposób, w dużej mierze zależy od charakteru niezgodności.

4.2. Niekorzystne zmiany w środowisku prawnym
4.2.1. Opis

Może zostać wprowadzone nowe ustawodawstwo dotyczące opracowywanego BOSP, co w praktyce czyni BOSP niezgodnym.

4.2.2. Prawdopodobieństwo

Nie jest wykluczone, że zwolennicy wzmocnionej ochrony danych zdołają wprowadzić nowe wymagania, które bezpośrednio lub pośrednio wpłyną na możliwość stworzenia konkretnych BOSP. Prawdopodobieństwo w zakresie 2-3 wydaje się realistyczną oceną.

4.2.3. Wpływ

Wpływ jest zazwyczaj krytyczny (4), w tym sensie, że niezgodna produkcja będzie wymagać zatrzymania BOSP.

4.2.4. Zapobieganie

Określona informacja biznesowa powinna być regularnie prowadzona w celu monitorowania rozwoju ustawodawstwa — być może także, aby wywrzeć na nie wpływ, przedstawiając argumenty na rzecz oficjalnych statystyk na odpowiednich (np. doradczych) forach.

4.2.5. Łagodzenie

Pod warunkiem, że przeprowadzono proaktywne monitorowanie, może być czas na reorganizację BOSP, aby dostosować go do nowego ustawodawstwa od pierwszego dnia jego wejścia w życie.

Jeśli jednak monitoring nie był przeprowadzany, więc nowe przepisy stały się "nieoczekiwane" — lub jeśli przepisy są na tyle radykalne, że nie ma sposobu, aby BOSP stał się niezgodny — jedyną opcją może być wyłączenie BOSP.

5. Ryzyka związane z prywatnością i bezpieczeństwem danych

5.1. Naruszenia bezpieczeństwa danych
5.1.1. Opis

To ryzyko odnosi się do nieautoryzowanego dostępu do danych przechowywanych w zarządzaniach statystycznych. Osoby trzecie mogą uzyskać dane, które są objęte embargiem, na przykład z powodu wydania harmonogramu. Dla każdego BOSP, który w pełni opiera się na jednej jedynej BDS, nieuchronnie dane będą niejawnie znane pierwotnemu właścicielowi danych, a jeśli metodologia jest przejrzysta, również pochodna statystyka będzie znana. Ta sytuacja nie jest tutaj brana pod uwagę, a raczej w ryzyku związanym z nadużyciem pozycji przez właścicieli. Ponadto te dane mogą nieść w sobie ryzyko naruszenia prywatności. To ryzyko będzie rozważane oddzielnie. Mogą to być na przykład dane, które oczekują inwestorzy na rynku giełdowym.

5.1.2. Prawdopodobieństwo

Jeśli chodzi o aspekty techniczne ochrony środowiska IT w jednostce statystycznej, ryzyko ma takie samo prawdopodobieństwo dla BDS, jak i dla tradycyjnych źródeł. Jednak istnieją dwa dodatkowe aspekty, które należy wziąć pod uwagę.

Po pierwsze, w przypadku niektórych BDS ogólne ryzyko nieco wzrasta z powodu tego, że bezpieczeństwo danych u pierwotnego właściciela może być zagrożone. Może to być spowodowane na przykład szpiegostwem przemysłowym lub włamaniem.

Po drugie, gdy potencjalnie cenne dane zaczynają być przechowywane w biurze, ryzyko przyciągnięcia złowrogich zamiarów wzrasta. Jeśli przechowywane dane mają bardzo wysoką wartość dla biznesu, należy być przygotowanym na bardzo wysokie prawdopodobieństwo ataków skierowanych na infrastrukturę IT, a zatem prawdopodobieństwo wystąpienia włamania może być potencjalnie wyższe.

Jeśli przechowywane dane nie są postrzegane jako mające wartość, ogólne prawdopodobieństwo wydaje się niezbyt wysokie — od (1) do (3) w zależności od źródła danych.

5.1.3. Wpływ

Potencjalna szkoda reputacji może być znaczna (5). Ważne w przypadku BDS jest to, że jeśli naruszenie bezpieczeństwa wystąpi u pierwotnego właściciela, wpływ na reputację zarządzania statystykami będzie, jak się oczekuje, niższy niż w przypadku naruszenia danych, które znajdują się w jego przechowaniu.

Z drugiej strony, możliwe jest, że naruszenie w zarządzaniu statystykami może mieć negatywne konsekwencje dla pierwotnego właściciela. W takim przypadku ponownie może wystąpić silny negatywny wpływ z powodu strat w zakresie zaufania między dostawcą a zarządzaniem statystykami (5).

5.1.4. Zapobieganie

Cechą charakterystyczną przypadku BDS jest to, że procedury bezpieczeństwa pierwotnego właściciela mogą być odpowiednie. Mało prawdopodobne jest, że zarządzania statystykami uzyskają uprawnienia audytorskie, aby to kontrolować. Właściciele, których dane są wykorzystywane do tworzenia zapisów z poufnymi harmonogramami publikacji, powinni być informowani o konsekwencjach dla oficjalnych statystyk potencjalnego naruszenia bezpieczeństwa w ich obiektach i powinni uzyskać oficjalne zapewnienie, że stosowane są odpowiednie procedury bezpieczeństwa.

Bezpośrednim sposobem na zapobieżenie poważnemu wpływowi naruszenia bezpieczeństwa w obiekcie właściciela na zarządzanie statystykami jest zapewnienie korzystania z wielu źródeł dla tego samego produktu, aby jedno skompromitowane źródło było niewystarczające do uzyskania ostatecznej liczby. Zaletą tego podejścia jest większa kontrola w rękach zarządzania statystykami.

Sposób zapobiegania negatywnym skutkom naruszenia bezpieczeństwa w biurze statystycznym dla pierwotnego właściciela danych polega na znalezieniu sposobu pracy, który nie zakłada przekazywania danych, które potencjalnie są wrażliwe z punktu widzenia właściciela, do zarządzania statystycznego. W surowej formie. Możliwym proaktywnym podejściem jest wykorzystanie danych zagregowanych. Należy jednak pamiętać, że niektóre formy agregacji, na przykład te, które mają na celu uniemożliwienie identyfikacji poszczególnych członków populacji, mogą nie być odpowiednie w tym przypadku. Jednym z powodów może być fakt, że ryzyko dla właściciela wiąże się z wartością rynkową danych, która może być znaczna nawet po osiągnięciu anonimowości.

5.1.5. Łagodzenie

W przypadku naruszenia danych w zarządzie statystycznym, środki łagodzące będą takie same jak w przypadku tradycyjnych źródeł, o ile nie doszło do negatywnego wpływu na pierwotnego właściciela.

W przypadku negatywnych skutków dla pierwotnego właściciela, zarząd statystyczny powinien przeanalizować i wzmocnić swoje procedury bezpieczeństwa oraz jasno komunikować i demonstrować swoje zaangażowanie w tę kwestię.

Jeśli naruszenie miało miejsce w pomieszczeniu pierwotnego właściciela, odpowiednia służba statystyczna powinna wyraźnie poinformować o sytuacji i nalegać na poprawę procedur bezpieczeństwa właściciela. W razie potrzeby można poszukiwać alternatywnego dostawcy.

5.2. Naruszenia prywatności danych

5.2.1. Opis

To ryzyko naruszenia prywatności jednej lub kilku osób z populacji statystycznej. Może to być związane z atakiem na infrastrukturę IT z powodu presji ze strony innych instytucji rządowych lub z powodu niewystarczających działań kontrolujących ujawnianie danych statystycznych.

5.2.2. Prawdopodobieństwo

Podobnie jak w przypadku ryzyka naruszenia bezpieczeństwa danych, techniczne warunki przechowywania mikrodanych nie zmieniają się znacznie po dodaniu BDS. Niemniej jednak tutaj również są pewne ostrzeżenia.

Mikrodane z określonych źródeł danych mogą mieć dużą wartość komercyjną, dlatego ich przechowywanie zwiększa prawdopodobieństwo ataków.

Ponadto niektóre mikrodane mogą być potencjalnie bardzo przydatne dla innych instytucji publicznych, takich jak służby mundurowe, podatki czy opieka zdrowotna. W pewnych okolicznościach przestrzeganie zasady statystycznej poufności może być pod dużą presją.

Jeśli chodzi o awarie w kontroli ujawniania informacji statystycznych, do tej pory istnieje już ustalona praktyka. BDS może umożliwić produkcję statystyk dla małych podgrup populacji lub dać możliwość łączenia skonsolidowanych danych z różnych BDS, co może zwiększyć ryzyko. Ponadto nowe źródła będą wymagały nowych opracowań metodologicznych, dlatego rzeczywiste niebezpieczeństwo polega na tym, że metodologia kontroli ujawniania danych nie jest odpowiednio aktualizowana.

Ogólnie rzecz biorąc, przy rozsądnych środkach zapobiegawczych prawdopodobieństwo może być utrzymywane na rozsądnych poziomach, jednak z uwagi na istnieje wiele różnych i zróżnicowanych czynników, właściwa ocena w tym przypadku stwierdza, że prawdopodobieństwo jest wysokie (4).

5.2.3. Wpływ

Potencjalne szkody dla reputacji mogą być znaczne (5). Podobnie jak w przypadku ryzyka naruszenia bezpieczeństwa danych, incydent w zarządzaniu statystycznym może mieć negatywne konsekwencje dla pierwotnego właściciela. W tym przypadku wpływ takiego zdarzenia może być potencjalnie jeszcze większy, szczególnie w świetle aktualnych tendencji w opinii publicznej. Szkody w relacjach między dostawcą danych a zarządzaniem statystycznym również będą, jak się oczekuje, bardzo duże.

5.2.4. Zapobieganie

Niezawodny sposób na zapobieganie takim ryzykom to całkowity brak mikrodata z BDS (choć przechowywanie innych mikrodata wiąże się wciąż z odpowiednim ryzykiem, ale o innej prawdopodobieństwie i wpływie). Taki sposób, podobnie jak w przypadku ryzyka naruszenia bezpieczeństwa danych, pociągnie za sobą konieczność opracowania innych metod wykorzystania danych w celach statystycznych. Ponadto różnorodny charakter źródeł oznacza, że konieczne będzie opracowanie nowych metodologii z konkurującymi celami wydobycia jak największej ilości użytecznych informacji oraz ochrony prywatności przed zagrożeniami.

W przypadku przechowywania mikrodata mechanizmy zapewnienia bezpieczeństwa IT i kontroli dostępu muszą być na wymaganym poziomie i regularnie monitorowane. Szczególną uwagę należy zwrócić na zapewnienie bezpieczeństwa nowych sposobów pozyskiwania danych. Ironią losu może być, że tym nowym sposobem może być fizyczny transport urządzeń pamięci (na przykład dysków twardych). Jeśli ta metoda jest stosowana, dostawa musi być fizycznie zabezpieczona, a szyfrowanie powinno być zastosowane.

5.2.5. Łagodzenie

Środki łagodzące w tym przypadku są zasadniczo takie same, jak w przypadku naruszenia bezpieczeństwa danych. Jeśli przyczyną naruszenia jest nacisk ze strony innego organu rządowego, warto wykorzystać tę okazję do wzmocnienia niezależności zarządzania, aby podobne naruszenia w przyszłości stały się jeszcze trudniejsze.

5.3. Manipulacje źródłem danych
5.3.1. Opis

Dostawcy danych osób trzecich, na przykład dane z mediów społecznościowych lub dane dobrowolnie przekazane, są narażeni na manipulacje. Może to być dokonane przez samego dostawcę danych lub osoby trzecie. Na przykład wiele fałszywych wiadomości w mediach społecznościowych może być generowanych, aby w jakiś sposób wpłynąć na indeks statystyczny obliczany na podstawie tych danych, jeśli wiadomo, że indeks jest obliczany na podstawie takich danych.

W przypadku dobrowolnie przekazanych danych może być tak, że ochotnicy reprezentują określoną grupę interesów z określoną agendą.

5.3.2. Prawdopodobieństwo

Dla danych, których manipulacja może przynieść znaczne korzyści, prawdopodobieństwo jest wyższe. Mogą to być dane, dla których statystyki są interesujące, na przykład rynek akcji. W świetle niedawnych skandali związanych z LIBOR i Forex, można założyć, że tak długo, jak istnieje motywacja, próby manipulacji danymi będą prawdopodobne.

Aby zrozumieć statystyki oparte na dobrowolnie przekazanych danych, wystarczy spojrzeć na niedawną praktykę PR rekrutacji osób, które udają, że mają określoną opinię i są płacone za publiczne wyrażanie jej (na przykład na forach internetowych), aby dojść do wniosku, że prawdopodobieństwo nie jest małe. Ogólnie wydaje się, że liczba od 3 do 4 jest odpowiednia.

5.3.3. Wpływ

Dużym problemem z manipulacjami jest to, że mogą one trwać długo bez wykrycia. Jeśli manipulacje trwają przez dłuższy czas, wpływ na jakość może być znaczący. Ponadto, szkody dla zaufania publicznego do oficjalnych statystyk również mogą być dużym zagrożeniem, szczególnie jeśli publicznie podkreśla się rolę urzędów statystycznych jako dostawców jakościowych danych. Z drugiej strony, jeśli manipulacje zostaną wykryte na czas, a następnie opublikowane, może to faktycznie poprawić postrzeganie publiczne. Z wyjątkiem ekstremalnie złych przypadków, można założyć maksymalny wpływ (3).

5.3.4. Profilaktyka

Przeprowadzanie regularnych ćwiczeń kontrolnych z alternatywnymi źródłami jest jednym z możliwych podejść profilaktycznych. Te alternatywne źródła mogą być tradycyjne lub inne. Wykorzystanie statystyki opartej na kombinacji źródeł może zapobiec znaczącym wpływom manipulacji. W przypadkach, gdy obawiano się manipulacji inicjowanych przez dostawcę, umowy prawne mogą być również jednym ze sposobów zapobiegania takiej praktyce.

5.3.5. Łagodzenie

Jeśli chodzi o szkody dla relacji publicznych, środki łagodzące, które powinny zostać podjęte w tym przypadku, niewiele różnią się od działań w przypadku jakiegokolwiek kryzysu.

Z punktu widzenia jakości danych byłoby pomocne, gdyby dane z przeszłości mogły być poprawione w taki sposób, aby nawet z dużym opóźnieniem możliwa była poprawna seria.
Sprowadza się to do regularnego benchmarkingu. Należy zauważyć, że celem analizy porównawczej w tym przypadku różni się nieco od celu zapobiegania. W przypadku zapobiegania ważne jest szybkie zauważenie i zbadanie podejrzanego rozbieżności między danymi testu referencyjnego a BDS. Aby złagodzić skutki, zawsze przydatne są stare przydatne dane.

Ponadto należy zadbać o to, aby w przyszłości nie doszło do podobnych manipulacji — w szczególnie delikatnych przypadkach może to oznaczać pozyskanie potencjalnie nadmiarowych danych od kilku dostawców do analizy porównawczej.

5.4. Negatywne postrzeganie społeczne wykorzystania dużych danych przez oficjalną statystykę
5.4.1. Opis

Media i opinia publiczna są bardzo wrażliwe na kwestie prywatności i wykorzystania danych osobowych z dużych źródeł danych, szczególnie w kontekście wtórnego wykorzystania danych przez organy administracyjne, które podejmują działania administracyjne lub prawne wobec obywateli. Negatywnie postrzeganym wykorzystaniem może być mierzenie prędkości na podstawie analizy danych nawigacyjnych (11 Zob. www.theguardian.com/technology/2011/apr/28/tomtom-satnav-data-police-speed-traps).
Konkretny przypadek TomTom Netherlands spowodował znaczny spadek popytu na urządzenia TomTom i doprowadził do decyzji firmy o ograniczeniu dostępu do danych. W tym konkretnym przypadku dane dotyczyły pojedynczych osób, ale także poziomów prędkości na odcinkach dróg.

Jednak mogą istnieć aplikacje wykorzystujące big data, które są pozytywnie postrzegane przez społeczeństwo. Przykładem mogą być aplikacje zapobiegające przestępstwom, takim jak włamania, na podstawie danych z metod big data.

Pozytywna, jak i negatywna opinia publiczna może znacząco wpłynąć na wykorzystanie BDS w kontekście produkcji oficjalnej statystyki.

Negatywne postrzeganie społeczne może skutkować tym, że:

  • BDS nie będzie już dostępny dla urzędów statystycznych, είτε ze względu na decyzje dostawcy danych, είτε decyzje rządowe o niewykorzystywaniu danych, albo
  • wykorzystanie danych będzie ograniczone, co może przeszkodzić produkcji, jeśli określone BOSP.

5.4.2. Prawdopodobieństwo

Czynniki, które mogą wpływać na prawdopodobieństwo takiego zdarzenia lub jego wpływ na produkcję statystyk:

  • poufność danych, tzn. w jakim stopniu można łatwo zidentyfikować osoby;
  • zakres informacji, które dane ujawniają o osobach fizycznych, na przykład zwiększa się poprzez łączenie danych z różnych źródeł;
  • typ danych, na przykład operacje finansowe są postrzegane jako bardziej poufne niż inne dane;
  • rodzaj potencjalnej czynności, która może być podjęta wobec obywateli, na przykład ukaranie osób za przekroczenie prędkości;
  • niejednoznaczne środowisko prawne, w którym działają dostawcy i użytkownicy danych, lub gdy warunki prawne są sprzeczne z ogólnymi normami etycznymi społeczeństwa;
  • stopień zależności od określonego źródła danych w celu uzyskania statystyk; na etapie badawczym czynnik ten może mieć niewielkie znaczenie. Jednak może to znacznie wpłynąć na uzyskiwanie statystyk na późniejszym etapie i dlatego powinno być również uwzględnione na etapie badawczym. Jednym z problemów może być to, że ostateczny zakres wykorzystania danych na początku jest nieznany, ponieważ źródła danych mogą potencjalnie obsługiwać więcej niż jeden obszar statystyczny.

Ocena czasu niepożądanych zjawisk jest niemożliwa, ponieważ mobilizacja opinii publicznej często jest inicjowana przez nagłośnienie zdarzeń mających negatywny wpływ na obywateli. Niemniej jednak, w miarę jak coraz więcej danych jest wykorzystywanych przez rządy i przedsiębiorstwa prywatne, a szczególnie w wyniku aktywnego marketingu danych w celach innych niż te, które doprowadziły do ich pierwotnego zbierania, jest bardziej prawdopodobne, że takie zdarzenia będą miały miejsce.

Zdarzenia, które mają znaczny wpływ na postrzeganie społeczne, są rzadkie, a raczej przypadkowe (3) i oddalone (2). Wraz ze zwiększonym wykorzystaniem dużych zbiorów danych prawdopodobieństwo również wzrasta.

5.4.3. Wpływ

Wpływ zdarzenia w dużej mierze zależy od czynników omówionych wcześniej. Ogólnie rzecz biorąc, wpływ jest poważniejszy dla istniejącego systemu produkcji danych statystycznych, ponieważ działanie może wymagać przerwania. Wpływ zależy również od dostępności alternatywnych źródeł danych, chociaż może się zdarzyć, że społeczne postrzeganie nie rozróżnia różnych źródeł danych w przypadku materializacji zdarzenia. W obecnym stanie wykorzystywania dużych zbiorów danych wydaje się, że te źródła nie są w stanie całkowicie zastąpić tradycyjnych źródeł danych, lecz raczej uzupełniają istniejącą statystykę. To zmniejszy wpływ zdarzeń. Dlatego wpływ zdarzenia oceniany jest w przedziale od 2 (nieznaczny) do 3 (główny). Na etapie produkcji wpływ może wzrosnąć do 4 (krytyczne znaczenie).

5.4.4. Profilaktyka

Środkami profilaktycznymi może być określenie zasad etycznych dla dużych zbiorów danych w oficjalnej statystyce. Etyczne zasady powinny opierać się na takich zasadach, jak kodeks praktyki dla europejskiej statystyki lub fundamentalne zasady oficjalnej statystyki (12 unstats.un.org/unsd/dnss/gp/fundprinciples.aspx). Kolejnym krokiem będzie określenie strategii komunikacyjnej, która będzie publikować wyniki etycznych zasad dla społeczeństwa i może być używana do informowania zainteresowanych stron o etycznym wykorzystaniu BDS dla BOSP.

Osobna ocena ryzyka dla konkretnego BDS może być przeprowadzona w celu identyfikacji ryzyk i zaproponowania działań profilaktycznych lub łagodzących na podstawie zasad etycznych. Osobna ocena ryzyka może również obejmować zainteresowane strony, takie jak agencje ochrony danych, aby zapewnić identyfikację wszystkich ryzyk i uzasadnienie działań.

5.4.5. Łagodzenie

Strategia komunikacyjna powinna również obejmować działania w przypadku narastającego negatywnego nastawienia opinii publicznej. Oddzielna ocena ryzyka powinna zbierać pozytywne przykłady wykorzystania danych oraz środki zapobiegające nadużyciom danych, które mogą być niezbędne na poziomie politycznym, a społeczność statystyczna może nie mieć efektywnego wpływu na nie.

5.5. Utrata zaufania – uzyskana nie w wyniku obserwacji
5.5.1. Opis

Użytkownicy oficjalnych statystyk zazwyczaj mają wysoką pewność co do dokładności i rzetelności danych statystycznych. Oparta jest na tym fakt, że produkcja danych statystycznych jest osadzona w solidnej i ogólnodostępnej metodologicznej bazie, a także w dokumentacji dotyczącej jakości produktu statystycznego. Ponadto, większość danych statystycznych oparta jest na obserwacjach, tzn. uzyskiwanych z badań lub spisów ludności, które ustalają łatwo zrozumiałą relację między obserwacją a danymi statystycznymi. Wykorzystanie BDS, które nie są zbierane w głównym celu statystyki, wiąże się z ryzykiem utraty tych relacji, a użytkownicy mogą stracić zaufanie do danych oficjalnych statystyk. Przykład związany z ostatnią edycją (2010 r.) spisu ludności dotyczy tego, że w niektórych krajach dane statystyczne były pozyskiwane przy użyciu kilku źródeł i modeli statystycznych. W niektórych przypadkach zainteresowane strony kwestionowały dane statystyczne.

5.5.2. Prawdopodobieństwo

Prawdopodobieństwo wystąpienia ryzyka zależy od takich czynników, jak złożoność modelu statystycznego / metodologicznego, wiarygodność relacji między BSD a BOSP czy zgodność z innymi danymi statystycznymi. Prawdopodobieństwo powinno mieścić się w zakresie od 3 (przypadkowe) do 4 (prawdopodobne), co oznacza, że może się zdarzyć kilkakrotnie lub często.

5.5.3. Wpływ

Wpływ powstania ryzyka w znacznej mierze będzie zależał od tego, czy NSO skutecznie udowodnią dokładność i wiarygodność danych statystycznych. W przypadku, gdy nie uda się tego osiągnąć, konsekwencje w zakresie utraty zaufania mogą również dotknąć inne obszary statystyki, to znaczy wiarygodność nie tylko niektórych danych statystycznych, ale także samą organizację. NSO stracą przewagę konkurencyjną w stosunku do innych prywatnych organizacji działających w tej dziedzinie.

5.5.4. Prewencja

Działania prewencyjne będą polegały na opracowaniu i publikacji metodyki opartej na naukowych danych, która zostanie uznana przez społeczność naukową, wzbogaceniu danych metadanymi jakości, zapewnieniu spójności BOSP z innymi danymi, oraz przeprowadzeniu rygorystycznej kontroli jakości.

Zanim rozpocznie się produkcję statystyczną, BOSP mógłby zostać opublikowany jako eksperymentalny, a zainteresowanym stronom zalecałoby się kwestionowanie BOSP w celu potwierdzenia lub poprawy BOSP.

5.5.5. Łagodzenie

Istnieją dwa przypadki do rozróżnienia. W przypadku, gdy dane statystyczne są kwestionowane, ale mają wysoką / wystarczającą jakość (poprawne / dokładne), wystarczyłoby wyjaśnić i przekazać dane statystyczne społeczności, podając łatwe do zrozumienia przykłady.

6. Ryzyka związane z umiejętnościami

6.1. Brak specjalistów
6.1.1. Opis

Analiza cyfrowych śladów pozostawionych przez ludzi w trakcie ich działalności wymaga określonych narzędzi analizy danych, które obecnie nie są najpowszechniejsze w oficjalnej statystyce. Po pierwsze, wykorzystanie danych pośrednich o działalności ludzi zamiast bezpośrednich ankiety wymaga stosowania modeli statystycznych i, w związku z tym, umiejętności wnioskowania i uczenia maszynowego. Po drugie, te cyfrowe zapisy składają się z danych, które często nie mają zwyczajowego formatu tabeli, typowego dla wyników badań, z wierszami odpowiadającymi jednostce statystycznej i kolumnami z konkretnymi cechami tych jednostek statystycznych. Cyfrowe ślady są także przedstawiane w formie tekstu, dźwięku, obrazu i wideo. Wyodrębnienie odpowiednich informacji statystycznych z tych rodzajów danych wymaga umiejętności przetwarzania języka naturalnego, przetwarzania sygnału audio i przetwarzania obrazów. Po trzecie, te źródła danych mają tendencję do dostarczania masywnych zbiorów danych, których przetwarzanie wymaga dobrego zrozumienia metodologii obliczeń rozproszonych.

Ryzyko braku ekspertów polega na pozyskiwaniu danych z jednego z tych nowych dużych źródeł danych, ponieważ zarządzanie statystyczne nie ma możliwości odpowiedniego przetwarzania i analizy tego z powodu braku niezbędnych umiejętności w jego zespole.

6.1.2. Prawdopodobieństwo

Prawdopodobieństwo tego ryzyka będzie zależało od trzech czynników: 1) konkretnych typów umiejętności wymaganych dla każdego typu źródła wielkich danych oraz prawdopodobieństwa, że zarządzanie statystyczne znajdzie możliwość zbadania takiego źródła; 2) bieżącej dostępności niezbędnych umiejętności w zarządzaniu statystycznym; oraz 3) kultury organizacyjnej zarządzania statystycznego.

Jeśli chodzi o typy umiejętności, które mogą być wymagane, należy zauważyć, że nie wszystkie źródła wymagają wszystkich powyżej wymienionych umiejętności. Niektóre (np. dane z Google Trends) nie wymagają obliczeń rozproszonych, ponieważ zostały już wstępnie przetworzone przez podmiot, który posiada dane, lub wymagają umiejętności przetwarzania sygnałów, a w głównej mierze będą potrzebować umiejętności modelowania statystycznego. Niemniej jednak istnieje duże zróżnicowanie źródeł wielkich danych, dla większości z nich wymagane są umiejętności obliczeń rozproszonych, przetwarzania sygnałów oraz uczenia maszynowego. Równocześnie odpowiednie badanie tych cyfrowych śladów będzie wymagało przetwarzania kilku źródeł. W ten sposób istnieje duże prawdopodobieństwo, że duże źródła danych, które stają się dostępne do zarządzania statystycznego, będą wymagały tych nietypowych umiejętności, a prawdopodobieństwo tego ryzyka jest bardzo wysokie (5).

Jeśli chodzi o aktualną dostępność niezbędnych umiejętności, będzie to zależne od konkretnego zarządzania statystycznego. Nawet jeśli metodologia badania jest mniej powszechna niż metodologia ankiety, jest również stosowana w oficjalnej statystyce w niektórych dziedzinach. Dlatego, nawet jeśli może to wymagać pewnej reorganizacji zasobów ludzkich, zarządzania statystyczne mogą znaleźć rozwiązanie własnymi siłami. Co do umiejętności obliczeń rozproszonych, które głównie związane są z IT, będą one zależne od tego, jak zarządzana jest infrastruktura IT w organizacji. W zależności od tego, jak bardzo dział IT stoi z boku, rozwiązania mogą być znalezione w kontekście istniejących umów. Niemniej jednak umiejętności przetwarzania sygnałów oraz uczenia maszynowego zazwyczaj nie istnieją w większości oficjalnych zarządów statystycznych, a zastosowanie tych umiejętności nie może być outsourcowane, ponieważ muszą być stosowane przez ekspertów w dziedzinie statystyki. W związku z tym, z tego punktu widzenia, prawdopodobieństwo tego ryzyka również wydaje się bardzo wysokie (5).

Kultura organizacyjna również wpłynie na prawdopodobieństwo tego ryzyka. Posiadanie personelu gotowego do nabywania niezbędnych umiejętności poprzez samokształcenie może dać organizacji możliwość reakcji na sytuację z nowym źródłem danych, wymagającym umiejętności różniących się od typowych. To będzie zależało od kultury zarządzania statystycznego, a mianowicie od tego, czy będzie ona zachęcać pracowników do nauki nowych umiejętności i czy daje im czas na samodzielne uczenie się.

W związku z tym prawdopodobieństwo, że zarządzanie statystyczne nie będzie w stanie przetwarzać i analizować nowych źródeł danych z powodu braku umiejętności u swoich pracowników, będzie między prawdopodobnym (4) a częstym (5), w zależności od kultury samokształcenia organizacji.

6.1.3. Wpływ

Zarządzanie statystyczne, które nie jest w stanie przetwarzać i analizować dużych źródeł danych z powodu braku umiejętności u swoich pracowników, może mieć dwa możliwe negatywne konsekwencje: 1) źródło danych nie zostanie zbadane, przynajmniej nie w pełni; 2) źródło zostanie niewłaściwie wykorzystane.

Brak możliwości pełnego zbadania potencjału cennego źródła dużych danych będzie miał niewielki wpływ (2) w krótkim okresie, ponieważ zarządzania statystyczne rzeczywiście dysponują narzędziami statystycznymi, aby zaspokoić bieżące potrzeby. Jednak w dłuższej perspektywie (a być może nawet w średnim okresie) konsekwencje utraty tej możliwości będą miały decydujące znaczenie (4), ponieważ zarządzania statystyczne coraz częściej stają w obliczu konkurencji prywatnych dostawców, którzy nie mają takiej samej struktury instytucjonalnej, która pozwoliłaby im zapewnić społeczeństwu niezależność danych statystycznych.

Jednak niewłaściwe wykorzystanie źródła może mieć niezwykle negatywne konsekwencje dla urzędów statystycznych, ponieważ oficjalna statystyka w dużej mierze polega na swojej reputacji w realizacji swojej misji. Niemniej jednak możemy stwierdzić, że najważniejszą umiejętnością, której brak może prowadzić do uzyskania błędnych wyników, jest wnioskowanie statystyczne, a szczególnie wnioskowanie oparte na modelu, które również jest najmniej prawdopodobne, aby go zabrakło. Dlatego oczekiwany wpływ będzie raczej krytyczny (4) niż ekstremalny.

6.1.4. Zapobieganie

Urzędy statystyczne mogą aktywnie zapobiegać temu ryzyku na dwa sposoby: 1) szkolenie; oraz 2) rekrutacja.

Urzędy statystyczne mogą zapewnić personelowi niezbędne umiejętności, szczegółowo określając umiejętności wymagane do wykorzystania dużych źródeł danych w produkcji statystycznej, sporządzając listę istniejących umiejętności personelu, identyfikując potrzeby w zakresie szkoleń, a następnie organizując kursy edukacyjne.

Urzędy statystyczne mogą również rekrutować nowych pracowników posiadających wymagane umiejętności. Wydaje się, że ma to poważne ograniczenia, ponieważ urzędy statystyczne nie będą w stanie zrekrutować krytycznej liczby pracowników w sytuacji, gdy wykorzystanie dużych źródeł danych stanie się szeroko rozpowszechnione w wydziale, a nowym pracownikom nadal może zająć kilka lat, aby osiągnąć poziom doświadczenia obecnych pracowników. Jednak przynajmniej niektórzy nowi pracownicy rekrutowani w ramach normalnej aktualizacji personelu mogą mieć umiejętności związane z big data.

6.1.5. Łagodzenie

W obliczu sytuacji, gdy nowe źródła dużych danych są dostępne bez pracowników z wymaganymi umiejętnościami, urzędy statystyczne mogą złagodzić negatywne skutki na dwa sposoby: 1) podwykonawstwo; oraz 2) współpraca.

Statystyki zarządzające mogą zawierać umowy na przetwarzanie danych i analizę nowych źródeł dużych danych z innymi organizacjami, które świadczą te usługi. Wydaje się, że jest to opłacalne rozwiązanie, ponieważ pojawia się nowy sektor przedsiębiorstw, które specjalizują się w przetwarzaniu takich danych. Jednakże rozwiązanie to wiąże się z pewnymi ryzykami, ponieważ statystyki zarządzające będą miały mniejszą kontrolę nad produkcją potencjalnie wrażliwych produktów statystycznych. Rozwiązanie to ma również wadę, ponieważ nie pozwala pracownikom statystyk zarządzających uczyć się i zdobywać niezbędne umiejętności.

Współpraca z innymi organizacjami, w których są pracownicy o wymaganych umiejętnościach i którzy są także zainteresowani badaniem źródeł dużych danych, wydaje się bardziej obiecującym rozwiązaniem. Taka współpraca może przybierać formę wspólnych projektów, w których pracownicy statystyk zarządzających i pracownicy innych organizacji będą się dzielić swoimi wiedzą na równych zasadach. Umożliwiłoby to nie tylko zmniejszenie ryzyka niedoboru umiejętności, ale także umożliwiłoby pracownikom statystyk zarządzających zdobycie tych umiejętności.

6.2. Utrata ekspertów do innych organizacji
6.2.1. Opis

Ryzyko to polega na tym, że statystyki zarządzające tracą swój personel na rzecz innych organizacji po tym, jak ci zdobyli umiejętności związane z dużymi danymi.

6.2.2. Prawdopodobieństwo

Prawdopodobieństwo tego ryzyka będzie zależało od dwóch czynników: 1) istniejących atrakcyjnych możliwości w organizacjach spoza oficjalnej statystyki; 2) warunków pracy w statystykach zarządzających.

Jeśli chodzi o możliwości w organizacjach poza oficjalnymi statystykami, prawdopodobieństwo tego ryzyka wydaje się realne (4). Istnieje wysokie zapotrzebowanie na osoby z umiejętnościami pracy z dużymi danymi w sektorze prywatnym, a także w innych organizacjach sektora publicznego. Po nabyciu umiejętności pracy z dużymi danymi, oficjalne statystyki uzyskają przewagę konkurencyjną, będąc doświadczonymi specjalistami w dziedzinie statystyki. Oprócz specyficznych umiejętności pracy z dużymi danymi, innym organizacjom potrzebni są specjaliści ds. danych, mający bardziej tradycyjne umiejętności, takie jak ocena potrzeb użytkowników i opracowywanie kluczowych wskaźników efektywności (KPI), które są wspólne dla oficjalnych statystyków. Dodatkowo, oczekuje się, że pracownicy, którzy będą bardziej skłonni do nabywania nowych umiejętności, będą również bardziej otwarci na zmiany w karierze i odejdą z urzędów statystycznych.

Jeśli chodzi o warunki pracy w urzędach statystycznych, to będzie to oczywiście zależało głównie od konkretnego biura. Niemniej jednak, urzęd statystycznych w ogóle wciąż oferują atrakcyjne możliwości zawodowe dla osób z umiejętnościami ilościowymi. Urzędy statystyczne oferują najszerszy zakres możliwych dziedzin pracy i największy wybór danych do analizy. To w pewnym sensie zmniejszy prawdopodobieństwo, że urzęd statystycznych stracą swoich pracowników z powodu nieprzewidzianych okoliczności (3).

6.2.3. Wpływ

Wpływ tego ryzyka będzie taki sam, jak ryzyko braku personelu z odpowiednimi umiejętnościami w pierwszej kolejności. W związku z tym wpływ będzie krytyczny (4), jak podano powyżej.

6.2.4. Zapobieganie

Wygląda na to, że jedynym sposobem, w jaki statystyczne urzędnictwa mogą zapobiec temu ryzykowi, jest zapewnienie atrakcyjnych warunków pracy dla swoich pracowników. Dotyczy to ogólnie całego personelu. Jednak w konkretnym przypadku, gdy pracownicy są otwarci na naukę nowych umiejętności, a mianowicie umiejętności związanych z analizą dużych danych, warunki pracy mogą zostać poprawione poprzez umożliwienie im dostępu do szkoleń, w których mogą rozwijać swoje zainteresowania zawodowe. Statystyczne urzędnictwa mogą również szczególnie zwrócić uwagę na otwartość na nowe innowacyjne projekty i pomysły związane z nowymi źródłami dużych danych, pochodzącymi od statystyków pracujących w kilku dziedzinach statystyki. Wreszcie, zapobieganie utracie personelu na rzecz innych organizacji w obszarze ich umiejętności pracy z dużymi danymi będzie zależało od dobrej identyfikacji pracowników zdolnych i gotowych do pracy z takimi danymi oraz od zapewnienia dobrych możliwości ich rozwoju zawodowego.

6.2.5. Łagodzenie

Redukcja tego ryzyka zostanie podjęta w odniesieniu do ryzyka braku personelu z odpowiednimi umiejętnościami: 1) podwykonawstwo; oraz 2) współpraca.

7. Dyskusja

Z tej pierwszej analizy wynika, że niemożliwe jest ustalenie jednolitego prawdopodobieństwa lub wpływu dla danego „ryzyka dużych danych” — zazwyczaj oba te wskaźniki w dużym stopniu zależą od źródła dużych danych, a także od „oficjalnej statystyki opartej na dużych danych”.
produkt „.

W związku z tym dochodzimy do wniosku, że logicznym następnych krokiem w tym kierunku byłoby wprowadzenie szeregu możliwych projektów pilotażowych (z których każdy obejmuje kombinację jednego lub wielu BDSów i jednego lub wielu BDOSów) jako punktu wyjścia i – dla każdego takiego pilota – dążyć do oceny prawdopodobieństwa i wpływu każdego ryzyka.

W tym celu stoimy u progu uruchomienia ankiety dla zainteresowanych stron, starając się ocenić oszacowanie OSC prawdopodobieństwa, wpływu (i możliwych działań mających na celu zapobieganie / łagodzenie skutków) w odniesieniu do szeregu możliwych projektów pilotażowych – oraz poprosić OSC o propozycje dotyczące ryzyk, których nie uwzględniliśmy w tym dokumencie.

8. BIBLIOGRAFIAUNECE (2014), „Zaproponowany ramowy system oceny jakości danych o wielkiej skali”, materiały UNECE Big Data Quality Task Team, www1.unece.org/stat/platform/download/attachments/108102944/BigDat
a%20Quality%20Framework%20-%20final-%20Jan08-2015.pdf?version=1&modificationDate=1420725063663&api=v2

UNECE (2014), „Jak duże są dane o wielkiej skali? Badanie roli danych o wielkiej skali w oficjalnej statystyce”, www1.unece.org/stat/platform/download/attachments/99484307/VirtualSprintBigDatapaper.docx?version=1&modificationDate=1395217470975&api=v2

Daas, P., S. Ossen, R. Vis-Visschers, i J. Arends-Toth, (2009), Lista kontrolna oceny jakości źródeł danych administracyjnych, Statistics Netherlands, Haga/Heerlen

Dorfman, Mark S. (2007), Wprowadzenie do zarządzania ryzykiem (wyd. e), Cambridge, UK, Woodhead-Faulkner, s. 18, ISBN 0-85941-332-22)

Eurostat (2014), „Procedura akredytacji dla danych statystycznych z nieoficjalnych źródeł” w Analizie metodologii wykorzystania Internetu do zbierania danych o społeczeństwie informacyjnym i innych statystykach, www.cros-portal.eu/content/analysismethodologies-using-internet-collection-information-society-and-other-statistics-1

Reimsbach-Kounatze, C. (2015), „Proliferacja danych o wielkiej skali i jej konsekwencje dla oficjalnej statystyki oraz agencji statystycznych: wstępna analiza”, OECD Digital Economy Papers, nr 245, OECD Publishing. dx.doi.org/10.1787/5js7t9wqzvg8-en

Reis, F., Ferreira, P., Perduca, V. (2014) „Wykorzystanie dowodów aktywności sieciowej do zwiększenia aktualności wskaźników oficjalnych statystyk”, artykuł przedstawiony na konferencji IAOS 2014, iaos2014.gso.gov.vn/document/reis1.p1.v1.docx

Nawet jeśli nie wspomniano wyraźnie o ryzykach, ten artykuł faktycznie dotyka wielu ryzyk związanych z wykorzystaniem danych o aktywności w sieci dla oficjalnych statystyk. Eurostat (2007), Podręcznik metod i narzędzi oceny jakości danych, ec.europa.eu/eurostat/documents/64157/4373903/05-Handbook-ondata-quality-assessment-methods-and-tools.pdf/c8bbb146-4d59-4a69-b7c4-218c43952214

Źródło: habr.com

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster