Prefacio del traductor
Me interesó este material, principalmente por la tabla a continuación:

Teniendo en cuenta que a los estadísticos (y los rusos, genéticamente hablando) no les gusta, por decirlo suavemente, todo lo que se aparta de la dependencia lineal, estos chicos lograron incorporar el uso de funciones de activación en forma parabólica para determinar el grado de riesgo de usar Big Data en la estadística oficial. Bien hecho. Naturalmente, los estadísticos añadieron su nota a este trabajo: «1 Cualquier error u omisión es responsabilidad exclusiva de los autores. Las opiniones expresadas en este documento son personales y no necesariamente reflejan la postura oficial de la Comisión Europea». Pero el trabajo fue publicado. Creo que por hoy esto es suficiente, y ellos (los autores) no prohibieron a nadie buscar sus escalas en estos aspectos.
El trabajo se puede dividir de manera bastante estructurada en dónde y cómo los métodos estadísticos difieren de los métodos de investigación para Big Data. En mi opinión, el mayor beneficio de este trabajo será en las conversaciones con el cliente y para refutar sus afirmaciones como:
— Nosotros mismos recopilamos la estadística, ¿qué más quieren investigar?
— Ustedes preséntenos sus resultados de tal manera que podamos conciliarlos con nuestra estadística. En este tema, los autores sugieren que sería bueno leer este trabajo (3 )
En este trabajo, los autores han expresado su visión sobre el nivel de riesgo. Este parámetro está entre paréntesis, no confundir con referencia a fuentes.
Segunda observación. Los autores utilizan el término BDS, que es un análogo del concepto Big Data. (parece un guiño a la estadística oficial).
Prefacio de los autores
Un número creciente de oficinas de estadísticas está explorando la posibilidad de utilizar grandes fuentes de datos para la preparación de estadísticas oficiales. Actualmente, existen solo unos pocos ejemplos en los que estas fuentes han sido completamente integradas en la producción estadística real. Por lo tanto, el alcance completo de las consecuencias de su integración aún no se ha determinado. Mientras tanto, se han realizado los primeros intentos de analizar las condiciones y el impacto de los grandes datos en diversos aspectos de la producción estadística, como la calidad o la metodología. Recientemente, un grupo de trabajo desarrolló una base cualitativa para la preparación de datos estadísticos basada en grandes datos en el contexto del proyecto de grandes datos de la Comisión Económica para Europa de las Naciones Unidas (CEPE ONU). De acuerdo con el código de práctica estadística europeo, proporcionar información estadística de alta calidad es una tarea fundamental para las oficinas de estadísticas. Dado que el riesgo se define como la influencia de la incertidumbre en los objetivos (por ejemplo, la norma internacional ISO 31000), consideramos apropiado categorizar los riesgos de acuerdo con las dimensiones de calidad que afectan.
La estructura de calidad propuesta para los datos estadísticos obtenidos de grandes fuentes de datos proporciona una representación estructurada de la calidad en todos los etapas del proceso de negocio estadístico y, por lo tanto, puede servir como base para una evaluación integral y gestión de los riesgos asociados con estas nuevas fuentes de datos. Introduce nuevas dimensiones cualitativas que son específicas para el uso de grandes datos para estadísticas oficiales, como el entorno institucional/empresarial o la complejidad. Al utilizar estas nuevas dimensiones cualitativas, es posible identificar de manera más sistemática los riesgos asociados con el uso de grandes fuentes de datos en estadísticas oficiales.
En este trabajo, buscamos identificar los riesgos asociados con el uso de grandes datos en el contexto de la estadística oficial. Adoptamos un enfoque sistemático para definir los riesgos dentro de la estructura de calidad propuesta. Centrándonos en las nuevas métricas de calidad sugeridas, podemos describir riesgos que actualmente están ausentes o que no afectan la producción de estadísticas oficiales. Al mismo tiempo, podemos identificar los riesgos actuales que serán evaluados de manera completamente diferente al usar grandes datos para obtener estadísticas. Luego avanzamos en el ciclo de gestión de riesgos y proporcionamos una evaluación de la probabilidad y el impacto de estos riesgos. Dado que la evaluación de riesgos implica una subjetividad en su atribución, medimos la probabilidad y el impacto de los diferentes riesgos mediante el consenso entre decenas de partes interesadas diferentes, proporcionadas de manera independiente. Posteriormente, proponemos opciones para mitigar estos riesgos de acuerdo con cuatro categorías principales: evitar, reducir, compartir y retener. Según la ISO, uno de los principios de la gestión de riesgos debe ser la creación de valor, es decir, los recursos destinados a mitigar los riesgos deben ser inferiores a los de la inacción. De acuerdo con este principio, finalmente realizaremos una evaluación del posible impacto de algunas medidas de mitigación sobre la calidad de los resultados finales, con el objetivo de llegar a una evaluación más integral del uso de grandes datos para la estadística oficial.
1. Introducción
1.1. Antecedentes
El desarrollo de "grandes datos" fue caracterizado por Kenneth Neil Cukier y Viktor Mayer-Schönberger en su artículo "El crecimiento de los grandes datos" (2. ) el término "dataficación". La dataficación se describe como el proceso de "tomar todos los aspectos de la vida y convertirlos en datos". Por ejemplo, Facebook proporciona redes personales, sensores para todo tipo de condiciones ambientales, teléfonos inteligentes para la comunicación personal y los desplazamientos, y datos portátiles para condiciones personales. Esto conduce a la recopilación y disponibilidad de datos casi omnipresentes.
Al igual que en muchos otros sectores, la estadística oficial solo ha comenzado a abordar recientemente el problema de los grandes datos a un nivel estratégico. Aún no hay un entendimiento común y ampliamente aceptado sobre el camino a seguir, ya sea un desafío u oportunidad, sea pequeño o grande, etc. En el marco del Grupo de Alto Nivel sobre la Modernización de la Producción y los Servicios Estadísticos (3 ¿Qué tan grandes son los Grandes Datos? Explorando el papel de los Grandes Datos en la Estadística Oficial: ), se realizó un análisis FODA inicial acompañado de un análisis preliminar de riesgos/beneficios. Se observó que 'un análisis completo de riesgos también incluiría aspectos como la probabilidad y el impacto, y podría ampliarse para identificar estrategias para mitigar y gestionar los riesgos'.
Aunque este documento está lejos de ser un análisis completo de riesgos, busca mejorar la situación mediante la creación de la primera revisión estructurada. Nos gustaría enfatizar que esta revisión debe considerarse como un punto de partida para fomentar un debate general dentro de la Comunidad Estadística Oficial (OSC).
1.2. Ámbito
Este artículo se centra exclusivamente en los riesgos, excluyendo no solo los beneficios, sino también las fortalezas y debilidades, oportunidades y amenazas. Esto significa que 'los riesgos de la inacción' (por ejemplo, el riesgo de que la OSC quede fuera de competencia con otros actores si no se moderniza) no están incluidos en el alcance; son más bien amenazas. En su lugar, intentamos resaltar los riesgos que pueden surgir (a) si la OSC utiliza las oportunidades que ofrecen los grandes datos y comienza a desarrollar o mejorar un 'producto oficial de estadística basado en grandes datos' (BOSP); (b) los riesgos para el nuevo 'negocio habitual', es decir, los riesgos para la estadística oficial basada en la producción de 'grandes datos'. (Dado que toda la producción de estadística oficial está relacionada con riesgos, nos limitamos a (b) a los 'riesgos específicos de grandes datos', es decir, riesgos que no existen o son insignificantes para el proceso 'tradicional' de recolección de estadística oficial.)
1.3. Estructura
En la sección 2 presentamos los principios fundamentales relacionados con esta tarea, comenzando con la base claramente necesaria para la gestión de riesgos y la administración de riesgos (sección 2.1). También presentamos una estructura preliminar de calidad de los datos estadísticos obtenidos a partir de grandes datos (sección 2.2), ya que vincular la estructura de calidad con los riesgos cumple con dos objetivos:
- Establece el contexto para la definición de riesgos. Ciertos indicadores de calidad junto con las características discutidas expresan los valores del objeto que se consideran importantes y decisivos para la prestación de servicios a clientes y usuarios.
- Esto permite asignar riesgos específicos a mediciones de calidad, que están incrustadas en espacios hiperespaciales y vinculadas a etapas particulares en el proceso de producción de productos estadísticos.
En las secciones 3, 4, 5 y 6, presentamos los riesgos identificados hasta ahora en varios contextos (4 Los documentos del caso de negocio del proyecto ESS Big Data, así como en las redes ESS Big Data, contienen una lista de riesgos, parcialmente relacionados con el proyecto y parcialmente con el uso de fuentes de grandes datos para fines estadísticos. El documento «Un marco sugerido para la calidad de los grandes datos» menciona algunos riesgos relacionados con dimensiones de calidad.). Aquí utilizamos la clasificación de acceso a datos, el entorno legal, la privacidad y seguridad de los datos, así como las habilidades; la reorganización de acuerdo con la estructura de calidad de la estadística obtenida de grandes datos (sección 2.2) debe considerarse de inmediato, tan pronto como esta estructura alcance un estado más completo. Para cada uno de los riesgos identificados, proporcionamos (i) una evaluación de la probabilidad, así como el impacto (de acuerdo con la sección 2.1.3) y (ii) proponemos estrategias para mitigar y gestionar riesgos (ver sección 2.1.4).
Al final, discutiremos nuestras conclusiones y trazaremos algunos pasos siguientes en la Sección 7
2. Fundamentos
2.1. Riesgos y gestión de riesgos
Según la norma ISO 31000: 20095, el riesgo se define como "el efecto de la incertidumbre sobre los objetivos establecidos". Esto significa que los objetivos deben estar definidos o ser conocidos antes de que se puedan identificar los riesgos. Estos objetivos generalmente se determinan teniendo en cuenta el contexto institucional de la organización correspondiente. Otro aspecto importante es que los riesgos conllevan una característica de incertidumbre, es decir, no está claro si el evento descrito ocurrirá. Así, los riesgos se miden en función de la probabilidad de que ocurra el evento y sus consecuencias, es decir, el impacto que tiene este evento en el logro de los objetivos establecidos. La evaluación de riesgos debe proporcionar información más objetiva que, en última instancia, permita encontrar el adecuado equilibrio entre la realización de oportunidades de ganancias y la minimización de efectos adversos. La gestión de riesgos es una parte integral de la práctica de gestión y un elemento importante de la debida práctica corporativa (6 Statistics Canada: 2014-2015 report on Plans and Priorities, ). Este es un proceso iterativo que, idealmente, permite mejorar continuamente el proceso de toma de decisiones y contribuye a la mejora constante del rendimiento.
Los riesgos también están relacionados con la calidad. La aplicación de un sistema de calidad debe permitir aprovechar las oportunidades que ofrecen diversas fuentes y metodologías para lograr un resultado de cierto nivel de calidad en el sentido de que este resultado satisface las necesidades de los usuarios. Al igual que los riesgos, los niveles de calidad pueden derivarse del entorno institucional y de los objetivos de ciertas instituciones. En este contexto, el entorno institucional define el nivel general de riesgo que la organización está dispuesta a asumir para alcanzar sus objetivos.
El proceso de evaluación y gestión de riesgos puede dividirse en diversas etapas, que incluyen el establecimiento del contexto, la identificación de riesgos, el análisis de riesgos en términos de probabilidad e impacto, la evaluación de riesgos y, por último, el tratamiento de riesgos.
2.1.1. Contexto institucional
Como primer paso, es necesario establecer el contexto estratégico, organizativo y de gestión de riesgos en el que se llevará a cabo el resto del proceso. Esto incluye el establecimiento de criterios por los cuales se evaluarán los riesgos y la definición de la estructura del análisis.
2.1.2. Identificación del riesgo
En la segunda etapa, se deben identificar los eventos que pueden afectar el logro de los objetivos establecidos. La identificación debe incluir cuestiones relacionadas con el tipo de riesgos, el momento del evento, el lugar o cómo los eventos pueden prevenir, empeorar, retrasar o mejorar el logro de los objetivos.
2.1.3. Evaluación del riesgo
El siguiente paso consiste en determinar los controles existentes y analizar los riesgos desde el punto de vista de la probabilidad, así como desde la perspectiva de las consecuencias potenciales. En el contexto de este artículo, la probabilidad o la posibilidad de que ocurran riesgos se mide en una escala del 1 (poco probable) al 5 (frecuente). El impacto de la ocurrencia de eventos se mide en una escala del 1 (insignificante) al 5 (extremo). Como se muestra en la tabla 1, el producto de la probabilidad y el impacto da como resultado el "nivel de riesgo" que oscila entre 1 y 25.

Los niveles de riesgo evaluados se pueden comparar con criterios predefinidos para establecer un equilibrio entre los beneficios potenciales y los resultados desfavorables. Esto permite hacer juicios sobre las prioridades de gestión.

La prioridad para las acciones debe concentrarse en los riesgos críticos (ver Tabla 2), es decir, aquellos que pueden ocurrir y tienen consecuencias graves o extremas para los objetivos de la organización.
2.1.4. Respuesta a los riesgos
El último paso consiste en decidir cómo reaccionar ante los riesgos. Algunos riesgos que están por debajo de un nivel de riesgo predefinido pueden ser ignorados o aceptados. Para otros, los costos de mitigación pueden ser tan altos que superan los beneficios potenciales. En este caso, la organización puede decidir abandonar la actividad correspondiente. Los riesgos también pueden ser transferidos a terceros, como el seguro, que compensa los gastos incurridos. La última opción es considerar los riesgos al definir estrategias y acciones que equilibren los costos con los beneficios potenciales. De esta manera, la organización tomará decisiones sobre la implementación de estrategias para maximizar los beneficios y minimizar los costos potenciales.

2.2. Sistemas de calidad
El grupo objetivo, compuesto por representantes de organizaciones estadísticas nacionales e internacionales, desarrolló en 2014 un marco preliminar de calidad para las estadísticas obtenidas de grandes datos. El grupo objetivo trabajó bajo los auspicios del proyecto UNECE/HLG "El papel de los grandes datos en la modernización de la producción estadística". Amplió los sistemas de calidad existentes, diseñados para evaluar las estadísticas obtenidas de fuentes de datos administrativas, con indicadores de calidad que se consideraron relevantes para grandes fuentes de datos.
En el marco de este sistema se distingue entre tres fases del proceso empresarial: entrada, rendimiento y salida. La fase de entrada corresponde a las fases de "diseño" y "recolección" del GSBP, el rendimiento a las fases de "proceso" y "análisis", y los resultados son equivalentes a la fase de "distribución".
Se aplica una estructura jerárquica, que fue tomada de la estructura de datos administrativos desarrollada por la Oficina de Estadística de los Países Bajos (7 Daas, P., S. Ossen, R. Vis-Visschers, y J. Arends-Toth, (2009), Checklist for the Quality evaluation of Administrative Data Sources. Statistics Netherlands, The Hague/Heerlen). Las dimensiones de la calidad están incrustadas en una estructura jerárquica llamada hiperespacios. Las tres hiperdimensiones definidas son “fuente”, “metadatos” y “datos”. Las dimensiones de calidad se asignan a estos hiperespacios y a cada una de las etapas de producción. Para la fase de entrada, se han propuesto aspectos adicionales como “privacidad y confidencialidad”, “complejidad” (de acuerdo con la estructura de datos), “completitud” de los metadatos y “conectividad” (la capacidad de relacionar datos con otros datos), para añadir al modelo estándar de calidad. Para cada uno de los indicadores de calidad se proponen factores que se relacionan con su descripción, así como posibles indicadores.
En el contexto de este artículo, se pueden excluir los riesgos de estos factores. Por ejemplo, los factores que deben considerarse para medir la calidad del “entorno institucional/empresarial” son la sostenibilidad del proveedor de datos. Un riesgo asociado podría ser que los datos no estén disponibles del proveedor de datos en el futuro. Otro ejemplo se relaciona con el aspecto de calidad recientemente propuesto, la privacidad y seguridad. Uno de los factores importantes es la “percepción”, que significa la posible percepción negativa del uso previsto de fuentes de datos específicas por diversas partes interesadas.
3. Riesgos relacionados con el acceso a los datos
3.1. Falta de acceso a los datos
3.1.1. Descripción
Este riesgo consiste en un proyecto relacionado con el desarrollo de BOSP que no obtiene acceso a la fuente de grandes datos (BDS) necesaria.
Hasta ahora, OSC ha aprendido por las malas que incluso salir de los bloques de inicio y obtener este acceso a veces son obstáculos insuperables. A veces es fácil acceder a una fuente específica, como los registros de datos de llamadas (CDR), para fines de prueba/investigación, pero es mucho más difícil (por razones legales o comerciales) acceder a ella para fines operativos.
3.1.2. Probabilidad
La probabilidad depende en gran medida de las características del BDS. Si se trata de grandes datos administrativos, puede ser tan baja como 1, especialmente si (como en el caso de los datos de bucle de tráfico, investigados por Daas et al. 8 Daas, P., M. Puts, B. Buelens y P. van den Hurk. 2015. «Big Data as a Source for Official Statistics». Journal of Official Statistics 31 (2). (Próximamente; publicación prevista para junio de 2015.)) no hay problemas de protección de datos personales. Si el caso de BDS pertenece a un individuo, especialmente si es sensible (por ejemplo, en términos de protección de datos) o valioso (desde una perspectiva comercial), la probabilidad puede ser muy alta (5).
3.1.3. Impacto
El impacto depende del BOSP y de cómo se utilice el BDS. Si el BDS está en el centro, el impacto puede ser muy alto (4 = es prácticamente imposible producir BOSP), mientras que puede ser menor si aún es posible producir BOSP (aunque con una calidad inferior), dependiendo de otros URB, lo que resulta en un impacto en el rango de 2-3.
3.1.4. Prevención
Para reducir el riesgo de falta de acceso, se deben establecer contactos previos con el proveedor de datos y firmar un acuerdo a largo plazo sobre el acceso a los datos. Además, se debe realizar un análisis legal integral relacionado con la combinación específica de BDS y BOSP. También se deben evaluar las posibilidades de acceso a los datos según la legislación vigente o futura.
3.1.5. Mitigación
Si hay BDS alternativos que se pueden usar para el BOSP, se deberían explorar en su lugar. Si no hay forma de producir BOSP sin el BDS, y si no es posible superar la falta de acceso, los esfuerzos deben cesar, y un nuevo BOSP no verá la luz.
3.2. Pérdida de acceso a los datos
3.2.1. Descripción
Este riesgo radica en que la gestión estadística pierde el BDS subyacente al BOSP.
3.2.2. Probabilidad
Si el BOSP ya se está produciendo, generalmente existe cierta estabilidad, y en algunos casos, el riesgo puede ser muy bajo (1). Sin embargo, en particular, en el caso de entidades privadas con acuerdos que no son lo suficientemente sólidos, nada impide, por ejemplo, que una nueva dirección cambie la política de provisión de datos, lo que lleva a un riesgo moderado de ruptura (3). Además, si el BDS está relacionado con actividades inestables, siempre existe el riesgo de que el proveedor simplemente quiebre, y el riesgo puede ser incluso mayor (4).
3.2.3. Impacto
Dado que el BOSP existente puede ser imposible de producir, a menudo hay un impacto muy fuerte (5). En otros casos, cuando el BDS es auxiliar, el impacto puede ser más bien una pérdida de calidad con un impacto en el rango de 2-3.
3.2.4. Prevención
La estrategia de prevención es similar a la estrategia de falta de acceso a los datos, pero con un enfoque adicional en la vigilancia constante también en condiciones de producción.
No poner todos los huevos en una sola canasta (es decir, tener varios BDS subyacentes a cada BSOP) también puede ser una estrategia, pero esto puede resultar poco práctico o demasiado costoso.
3.2.5. Mitigación
Si el BDS es resultado de una actividad inestable, es posible que poco a poco se vuelva accesible un nuevo BDS que refleje el mismo fenómeno social. Sin embargo, sería demasiado tarde comenzar a "escanear el mercado" una vez que el BSOP falle; se requerirá vigilancia constante, y esto puede ser difícil de lograr.
4. Riesgo asociado con el entorno legal
4.1. Incumplimiento de la legislación aplicable
4.1.1. Descripción
Este riesgo proviene de un proyecto relacionado con el desarrollo del BOSP, en el que no se tiene en cuenta la legislación aplicable, lo que hace que el BOSP no cumpla con la legislación especificada. Esto puede referirse a la legislación sobre protección de datos, regulaciones relacionadas con la carga de respuesta, etc.
4.1.2. Probabilidad
Dada la falta de conocimiento del OSC sobre grandes datos, no se puede descartar que pueda ocurrir un incumplimiento accidental (3). La probabilidad, por lo general, está relacionada con el BDS, ya que cuanto menos "sensible" sea la fuente, menor será la probabilidad de incumplimiento.
4.1.3. Impacto
El impacto suele ser crítico (4) en el sentido de que para una producción no conforme se requerirá detener el BOSP (o, si aún no ha alcanzado la fase de implementación, su desarrollo debe ser detenido). Esto puede ser incluso extremo (5), ya que los riesgos reputacionales que surgen de estadísticas oficiales no conformes («ilegales») pueden tener consecuencias.
4.1.4. Prevención
Para cualquier BOSP, se necesita realizar un análisis legal exhaustivo, y esto ocurre en varias etapas (lo que es aceptable en la etapa de desarrollo / exploración puede no serlo en la etapa de implementación / producción). Esto, a su vez, puede llevar a la reingeniería del BOSP para hacerlo compatible.
4.1.5. Mitigación
Dependiendo de la gravedad de la inconformidad, el primer paso puede ser pasar el BOSP a modo offline.
La reingeniería del BOSP para hacerlo compatible puede ser una opción, pero si el BOSP será 'salvado' de esta manera depende en gran medida del tipo de inconformidad.
4.2. Cambios desfavorables en el entorno legal
4.2.1. Descripción
Puede introducirse nueva legislación relacionada con el BOSP en desarrollo, lo que efectivamente hace que el BOSP sea incompatible.
4.2.2. Probabilidad
No es descartable que los partidarios de una mayor protección de datos logren introducir nuevos requisitos que afecten directa o indirectamente la capacidad de crear BOSP específicos. Una probabilidad en el rango de 2-3 parece una estimación realista.
4.2.3. Impacto
El impacto, en general, es crítico (4), en el sentido de que una producción no conforme requerirá detener el BOSP.
4.2.4. Prevención
Cierta información empresarial debe monitorearse regularmente para seguir el desarrollo de la legislación — quizás también para influir en ella, planteando argumentos a favor de las estadísticas oficiales en foros pertinentes (por ejemplo, consultivos).
4.2.5. Mitigación
Siempre que se haya realizado un monitoreo proactivo, puede haber tiempo para reingeniería del BOSP con el fin de alinearlo con la nueva legislación desde el primer día de su entrada en vigor.
Si, por otro lado, no se realizó el monitoreo, de manera que la nueva legislación "sorpresa" — o si la legislación es tan radical que no hay forma de hacer que BOSP sea incompatible — la única opción puede ser desactivar BOSP.
5. Riesgos relacionados con la privacidad y la seguridad de los datos
5.1. Violaciones de la seguridad de los datos
5.1.1. Descripción
Este riesgo se refiere al acceso no autorizado a los datos almacenados en las gestiones estadísticas. Terceros pueden obtener datos que están bajo embargo, por ejemplo, debido a la liberación de un cronograma (9 Para cualquier BOSP que se basa completamente en un único BDS, es inevitable que los datos sean implícitamente conocidos por el propietario original de los datos, y si la metodología es transparente, la estadística derivada también será conocida. Esta situación no se considera aquí, sino más bien en el riesgo relacionado con el abuso de poder por parte de los propietarios.) (10 Además, estos datos pueden conllevar un riesgo de violación de la privacidad. Este riesgo se abordará por separado.). Pueden ser, por ejemplo, datos que los inversores esperan en el mercado de valores.
5.1.2. Probabilidad
En cuanto a los aspectos técnicos de la protección del entorno de TI en la unidad estadística, el riesgo tiene la misma probabilidad para los BDS como para las fuentes tradicionales. Sin embargo, hay dos aspectos adicionales que deben tenerse en cuenta.
En primer lugar, con algunos BDS el riesgo general se incrementa ligeramente porque la seguridad de los datos del propietario original puede estar amenazada. Esto puede estar relacionado, por ejemplo, con espionaje industrial o hacking.
En segundo lugar, una vez que datos potencialmente valiosos comienzan a almacenarse en la oficina, el riesgo de atraer intenciones maliciosas aumenta. Si los datos almacenados tienen un valor muy alto para el negocio, se debe estar preparado para una probabilidad muy alta de ataques dirigidos a la infraestructura de TI, por lo que la probabilidad de hackeos puede ser potencialmente mayor (4).
Si los datos almacenados no se perciben como valiosos, la probabilidad general parece no ser muy alta — de (1) a (3) dependiendo de la fuente de datos.
5.1.3. Impacto
El daño potencial a la reputación puede ser considerable (5). Lo importante en el caso de BDS es que, si ocurre una violación de seguridad en el propietario original, se espera que el impacto en la reputación de la gestión estadística sea menor que si la violación ocurriera con los datos en su almacenamiento.
Por otro lado, es posible que una violación en la gestión estadística tenga consecuencias negativas para el propietario original. En este caso, nuevamente podría haber un gran impacto negativo debido al daño en términos de confianza entre el proveedor y la gestión estadística (5).
5.1.4. Prevención
Lo característico del caso BDS es que los procedimientos de seguridad del propietario original pueden ser pertinentes. Es poco probable que las gestiones estadísticas obtengan facultades de auditoría para controlar esto. Los propietarios cuyos datos se utilizan para crear registros con cronogramas de publicación confidenciales deben ser informados sobre las consecuencias para la estadística oficial de una posible violación de seguridad en sus instalaciones y deben recibir garantías oficiales de que se están aplicando los procedimientos de seguridad adecuados.
Una forma directa de prevenir un impacto serio de una violación de seguridad en las instalaciones del propietario sobre la gestión estadística es asegurar el uso de múltiples fuentes para un mismo producto, de modo que una única fuente comprometida no sea suficiente para obtener la cifra final. La ventaja de este enfoque es que se mantiene un mayor control en manos de la gestión estadística.
La forma de prevenir las consecuencias negativas de la violación de la seguridad en la oficina estadística para el propietario original de los datos consiste en encontrar una manera de trabajar que no implique la transferencia de datos que podrían ser sensibles desde la perspectiva del propietario, a la gestión estadística. En su forma cruda. Un posible enfoque preventivo es el uso de datos agregados. Sin embargo, se debe tener en cuenta que algunas formas de agregación, por ejemplo, aquellas destinadas a evitar la identificación de individuos en la población, pueden no ser adecuadas en este caso. Una de las razones puede ser el hecho de que el riesgo para el propietario está relacionado con el valor comercial de los datos, que puede ser significativo incluso después de alcanzar el anonimato.
5.1.5. Mitigación
En caso de una violación de datos bajo la responsabilidad de la gestión estadística, las medidas de mitigación serán las mismas que en el caso de fuentes tradicionales, a menos que haya un impacto negativo en el propietario original.
En caso de consecuencias negativas para el propietario original, la gestión estadística debe revisar y fortalecer sus procedimientos de seguridad y comunicar y demostrar claramente su compromiso con ello.
Si la violación ocurrió en las instalaciones del propietario original, el organismo estadístico correspondiente debe comunicar claramente la situación y insistir en la mejora de los procedimientos de seguridad del propietario. Si es necesario, se puede buscar un proveedor alternativo.
5.2. Violaciones de la privacidad de datos
5.2.1. Descripción
Este es el riesgo de que la privacidad de una o más personas de la población estadística sea violada. Esto puede estar relacionado con un ataque a la infraestructura de TI debido a la presión de otras agencias gubernamentales o a medidas inadecuadas de control sobre la divulgación de datos estadísticos.
5.2.2. Probabilidad
Al igual que en el caso del riesgo de violación de la seguridad de los datos, las condiciones técnicas para el almacenamiento de microdatos no cambian significativamente con la adición de BDS. Sin embargo, aquí también hay advertencias.
Los microdatos de ciertas fuentes de datos pueden tener un alto valor comercial, por lo que su almacenamiento aumentará la probabilidad de ataques.
Además, algunos microdatos pueden ser potencialmente muy útiles para otras instituciones gubernamentales, como las fuerzas del orden, la tributación o la sanidad. En ciertas circunstancias, el compromiso con el principio de confidencialidad estadística puede estar bajo una gran presión.
En cuanto a las fallas en el control de la divulgación de información estadística, ya existe una práctica establecida. BDS puede permitir generar estadísticas para pequeños subgrupos de la población o proporcionar la posibilidad de vincular datos agregados de diferentes BDS, lo que podría aumentar la probabilidad de riesgo. Además, nuevas fuentes, sin embargo, requerirán nuevos desarrollos metodológicos, por lo que el verdadero peligro radica en que la metodología de control de divulgación no se actualice adecuadamente.
En general, con medidas preventivas razonables, la probabilidad puede mantenerse en niveles razonables, pero, dado que hay múltiples y diversas variables, la evaluación correspondiente aquí parece indicar que la probabilidad es alta (4).
5.2.3. Impacto
El daño potencial a la reputación puede ser considerable (5). Al igual que en el caso del riesgo de violación de seguridad de datos, una violación en la gestión estadística puede tener consecuencias negativas para el propietario original. El impacto de tal evento aquí puede ser potencialmente incluso mayor, especialmente si las tendencias actuales en la opinión pública se mantienen. Se espera que el daño en las relaciones entre el proveedor de datos y la gestión estadística también sea muy significativo.
5.2.4. Prevención
Una manera infalible de prevenir tal riesgo es no tener microdatos de BDS (aunque almacenar otros microdatos conlleva riesgos correspondientes, aunque con diferentes probabilidades e impactos). Este enfoque, al igual que el riesgo de violación de la seguridad de los datos, requerirá el desarrollo de otros métodos para el uso de datos con fines estadísticos. Además, aquí la naturaleza diversa de las fuentes significará que será necesario desarrollar nuevas metodologías con objetivos opuestos de extraer la mayor cantidad posible de información útil mientras se protege la privacidad de los riesgos.
En el caso de almacenamiento de microdatos, los mecanismos de seguridad IT y control de acceso deben estar a un nivel requerido y ser monitoreados constantemente. Se debe prestar especial atención a la seguridad de los nuevos métodos de obtención de datos. Irónicamente, este nuevo método puede ser el transporte físico de dispositivos de almacenamiento (por ejemplo, discos duros). Si se utiliza este método, la entrega debe estar protegida físicamente y debe utilizarse cifrado.
5.2.5. Mitigación
Las medidas de mitigación aquí son en principio las mismas que en el caso de violaciones de seguridad de datos. Si la causa de la violación es la presión de otra autoridad gubernamental, se debe aprovechar la oportunidad para fortalecer la independencia de la gestión, de manera que tales violaciones sean aún más difíciles en el futuro.
5.3. Manipulación de la fuente de datos
5.3.1. Descripción
Los proveedores de datos de terceros, como los datos de redes sociales o datos proporcionados voluntariamente, están en riesgo de manipulación. Esto puede ser realizado por el propio proveedor de datos o por terceros. Por ejemplo, muchos mensajes falsos en redes sociales pueden ser generados para influir en el índice estadístico obtenido a partir de esos datos, de alguna manera, si se sabe que el índice se calcula con base en dichos datos.
Para los datos proporcionados voluntariamente, puede haber un caso en el que los voluntarios representen un determinado grupo de intereses con una agenda específica.
5.3.2. Probabilidad
Para los datos cuya manipulación puede ser muy beneficiosa, la probabilidad es mayor. Estos pueden ser datos que son de interés estadístico, como el mercado de valores. A la luz de los recientes escándalos relacionados con LIBOR y Forex, se puede suponer que mientras exista un incentivo, los intentos de manipulación de datos serán probables.
Para las estadísticas basadas en datos proporcionados voluntariamente, solo hay que mirar la reciente práctica de relaciones públicas de contratar personas que fingen tener una opinión determinada y a las que se les paga por expresarse públicamente (por ejemplo, en foros de internet) para concluir que la probabilidad no es baja. En general, una cifra de entre 3 y 4 parece adecuada.
5.3.3. Influencia
Un gran problema con las manipulaciones es que pueden durar mucho tiempo sin ser detectadas. Si las manipulaciones continúan durante un largo período, el impacto en la calidad puede ser significativo. Además, el daño a la confianza pública en las estadísticas oficiales también puede ser grande, especialmente si se enfatiza públicamente el papel de las oficinas estadísticas como proveedores de datos de calidad. Por otro lado, si las manipulaciones se detectan a tiempo y luego se publican, esto puede mejorar la percepción pública. A excepción de casos extremadamente malos, se puede imaginar un impacto máximo (3).
5.3.4. Prevención
Realizar ejercicios de control regulares con fuentes alternativas es uno de los posibles enfoques preventivos. Estas fuentes alternativas pueden ser tradicionales o de otro tipo. Utilizar estadísticas basadas en una combinación de fuentes puede mitigar los impactos significativos de las manipulaciones. En casos donde se teme que haya manipulaciones iniciadas por el proveedor, los acuerdos legales también pueden ser una forma de prevenir dicha práctica.
5.3.5. Mitigación
Desde el punto de vista del daño a las relaciones públicas, las medidas de mitigación que deben tomarse aquí no son muy diferentes de las medidas para enfrentar cualquier crisis.
Desde el punto de vista de la calidad de los datos, sería útil si los datos pasados pudieran ser corregidos de modo que incluso con un gran retraso se pudiera tener una serie correcta.
se produce. Para ello, puede ser útil un benchmarking regular. Tenga en cuenta que el objetivo del análisis comparativo en este caso es un poco diferente del objetivo de prevención. Para prevenir, es importante detectar e investigar rápidamente las discrepancias sospechosas entre los datos de la prueba de referencia y BDS. Para mitigar las consecuencias, siempre son útiles los datos históricos.
Además, se debe tener cuidado de no permitir que tales manipulaciones ocurran en el futuro; en casos especialmente delicados, esto puede significar obtener datos potencialmente redundantes de varios proveedores para análisis comparativo.
5.4. Percepción negativa del público sobre el uso de grandes datos por parte de las estadísticas oficiales
5.4.1. Descripción
Los medios de comunicación y el público en general son muy sensibles a las cuestiones de privacidad y al uso de datos personales de grandes fuentes de datos, especialmente en el contexto de la reutilización secundaria de datos por parte de organismos administrativos que toman medidas legales o administrativas contra ciudadanos. El uso que se percibe negativamente puede incluir el control de velocidad basado en el análisis de datos de navegación (11 Véase ).
El caso específico de TomTom Netherlands provocó una caída significativa en la demanda de dispositivos TomTom y llevó a la empresa a limitar el acceso a los datos. En este caso específico, los datos se referían a individuos, pero a niveles de velocidad en tramos de carretera.
Sin embargo, puede haber aplicaciones de grandes datos que son percibidas positivamente por el público. Un ejemplo puede ser aplicaciones que previenen delitos como el robo con métodos basados en grandes datos.
La opinión pública positiva, así como la negativa, puede tener un fuerte impacto en el uso de BDS en el contexto de la producción de estadísticas oficiales.
Las consecuencias de una percepción negativa del público pueden ser que:
- BDS ya no estará disponible para las oficinas estadísticas, ya sea por decisiones del proveedor de datos o decisiones gubernamentales de no utilizar los datos, o
- el uso de los datos estará limitado, lo que puede obstaculizar la producción si ciertos BOSP.
5.4.2. Probabilidad
Factores que pueden influir en la probabilidad de tal evento o su impacto en la producción estadística:
- la confidencialidad de los datos, es decir, cuán fácilmente se pueden identificar a las personas;
- la cantidad de información que los datos revelan sobre personas físicas, por ejemplo, aumenta al vincular datos de diferentes fuentes;
- el tipo de datos, por ejemplo, las transacciones financieras se perciben como más confidenciales que otros datos;
- el tipo de acción potencial que se puede realizar con respecto a los ciudadanos, por ejemplo, multar a las personas por exceso de velocidad;
- un entorno legal difuso, en el que operan proveedores y usuarios de datos o cuando las condiciones legales entran en conflicto con las opiniones/estándares éticos sociales;
- el grado de dependencia de una fuente de datos específica para obtener estadísticas; en la etapa de exploración, este factor puede ser de poca importancia. Sin embargo, esto puede tener un gran impacto en la obtención de estadísticas en etapas posteriores y, por lo tanto, debe considerarse también en la etapa de exploración. Uno de los problemas puede ser que el volumen final de uso de los datos inicialmente sea desconocido, ya que las fuentes de datos pueden atender potencialmente a más de un área estadística.
La evaluación del tiempo de fenómenos no deseados es imposible, ya que la movilización del público a menudo se inicia con la cobertura de eventos que tienen un impacto negativo en los ciudadanos. Sin embargo, con el aumento del uso de grandes datos por parte de gobiernos y empresas privadas, y especialmente con la comercialización activa de datos para otros fines que los que llevaron a su recolección inicial, es más probable que ocurran tales eventos.
Los eventos que tienen un fuerte impacto en la percepción pública son poco frecuentes y más bien aleatorios (3) y lejanos (2). Con el aumento del uso de grandes fuentes de datos, la probabilidad también aumentará.
5.4.3. Impacto
El impacto de un evento depende en gran medida de los factores discutidos anteriormente. En general, el efecto es más serio para la producción ya existente de datos estadísticos, ya que es posible que se deba detener la acción. El impacto también depende de la disponibilidad de fuentes de datos alternativas, aunque puede suceder que la percepción pública no distinga entre diferentes fuentes de datos en caso de que se materialice un evento. En el estado actual del uso de grandes datos, parece que estas fuentes no pueden reemplazar completamente las fuentes de datos tradicionales, sino que complementan la estadística existente. Esto reducirá el impacto de los eventos. Por lo tanto, el impacto de un evento se considera en el rango de 2 (insignificante) a 3 (principal). En la etapa de producción, el impacto puede aumentar a 4 (valor crítico).
5.4.4. Prevención
Las medidas preventivas pueden incluir la definición de principios éticos para los grandes datos en la estadística oficial. Las directrices éticas deben basarse en principios como el código de prácticas para la estadística europea o los principios fundamentales de la estadística oficial (12 ). La siguiente medida será la definición de una estrategia de comunicación que publique los resultados de las directrices éticas para el público y que puede utilizarse para informar a las partes interesadas sobre el uso ético de los GDS para el BOSP.
Una evaluación de riesgo separada para un GDS específico puede llevarse a cabo para identificar riesgos y proponer medidas preventivas o mitigadoras basadas en principios éticos. La evaluación de riesgos también puede incluir a partes interesadas, como agencias de protección de datos, para asegurar la identificación de todos los riesgos y la justificación de las acciones.
5.4.5. Mitigación
La estrategia de comunicación también debe incluir medidas en caso de un creciente descontento público. Una evaluación de riesgos separada debe recopilar ejemplos positivos del uso de datos y medidas para prevenir el abuso de datos, que deben ser adoptadas a nivel político, y la comunidad estadística puede no ser capaz de influir eficazmente en ellas.
5.5. Pérdida de confianza — obtenida no a través de observación
5.5.1. Descripción
Los usuarios de estadísticas oficiales generalmente tienen alta confianza en la precisión y veracidad de los datos estadísticos. Esto se basa en el hecho de que la producción de datos estadísticos está integrada en una base metodológica confiable y accesible, así como en la documentación sobre la calidad del producto estadístico. Además, la mayoría de los datos estadísticos se basan en observaciones, es decir, se obtienen de encuestas o censos, estableciendo una relación fácilmente comprensible entre la observación y los datos estadísticos. El uso de BDS que no se recopilan con el objetivo principal de la estadística conlleva el riesgo de que estas relaciones se pierdan, y los usuarios pierdan confianza en los datos de la estadística oficial. Un ejemplo relacionado con el último censo (2010) está relacionado con que en algunos países los datos estadísticos se obtuvieron utilizando varias fuentes y modelos estadísticos. En varios casos, las partes interesadas impugnaron los datos estadísticos.
5.5.2. Probabilidad
La probabilidad de que ocurra el riesgo depende de factores como la complejidad del modelo estadístico / metodológico, la validez de las relaciones entre BSD y BOSP o la conformidad con otros datos estadísticos. La probabilidad debe estar en un rango de 3 (aleatorios) a 4 (probables), lo que significa que podría ocurrir algunas veces o frecuentemente.
5.5.3. Impacto
El impacto del surgimiento de riesgos dependerá en gran medida de si las NSOs pueden demostrar con éxito la precisión y fiabilidad de los datos estadísticos. Si esto no se puede lograr, el efecto en términos de pérdida de confianza podría también afectar otras áreas estadísticas, es decir, la credibilidad no solo de algunos datos estadísticos, sino cuestionar la organización misma. Las NSOs perderían su ventaja competitiva frente a otras organizaciones privadas que operan en este ámbito.
5.5.4. Prevención
Las acciones preventivas consistirán en el desarrollo y publicación de una metodología fundamentada científicamente, que sea reconocida por la comunidad científica, enriquecer los datos con metadatos de calidad, garantizar la coherencia del BOSP con el no BOSP, y ejercer un estricto control de calidad.
Antes de iniciar la producción estadística, el BOSP podría publicarse como experimental, y se recomendaría a las partes interesadas desafiar el BOSP para confirmar o mejorar el BOSP.
5.5.5. Mitigación
Hay dos casos a distinguir. En el caso de que los datos estadísticos sean impugnados, pero tengan una alta / suficiente calidad (correctos / precisos), sería suficiente explicar y comunicar los datos estadísticos al público, proporcionando ejemplos fáciles de entender.
6. Riesgos relacionados con las habilidades
6.1. Falta de especialistas
6.1.1. Descripción
El análisis de los rastros digitales dejados por las personas durante sus actividades requiere ciertas herramientas de análisis de datos, que actualmente no son las más comunes en la estadística oficial. En primer lugar, el uso de datos indirectos sobre la actividad de las personas en lugar de encuestas directas en los sondeos requiere la utilización de modelos estadísticos y, por lo tanto, habilidades de inferencia y aprendizaje automático. En segundo lugar, estos registros digitales consisten en datos que a menudo no tienen un formato tabular convencional, habitual en los resultados de encuestas, con filas correspondientes a la unidad estadística y columnas con características específicas de estas unidades. Las huellas digitales también se presentan en forma de texto, sonido, imagen y video. Extraer información estadística relevante de estos tipos de datos requiere habilidades en procesamiento de lenguaje natural, procesamiento de señales de audio y procesamiento de imágenes. En tercer lugar, estas fuentes de datos tienden a proporcionar conjuntos de datos masivos, cuya manipulación requiere un buen entendimiento de metodologías de computación distribuida.
El riesgo de escasez de expertos radica en la obtención de datos de una de estas nuevas grandes fuentes de datos, ya que la administración estadística no tiene la capacidad de procesar y analizar adecuadamente dichos datos debido a que su personal carece de las habilidades necesarias.
6.1.2. Probabilidad
La probabilidad de este riesgo dependerá de tres factores: 1) los tipos específicos de habilidades necesarias para cada tipo de fuente de grandes datos y la probabilidad de que la administración estadística encuentre la oportunidad de estudiar una fuente así; 2) la disponibilidad actual de las habilidades necesarias en la administración estadística; y 3) la cultura organizacional de la administración estadística.
En cuanto a los tipos de habilidades que pueden ser necesarias, es importante señalar que no todas las fuentes requieren todas las habilidades mencionadas anteriormente. Algunas (por ejemplo, datos de Google Trends) no requieren computación distribuida, ya que ya han sido procesadas previamente por el custodio de datos o cuentan con habilidades de procesamiento de señales, y principalmente necesitarán habilidades de modelado estadístico. Sin embargo, hay una gran variedad de fuentes de grandes datos, para la mayoría de las cuales se requieren habilidades de computación distribuida, procesamiento de señales y aprendizaje automático. Al mismo tiempo, la correcta investigación de estas huellas digitales requerirá el procesamiento de múltiples fuentes. Por lo tanto, existe una alta probabilidad de que las grandes fuentes de datos que se vuelven accesibles para la gestión estadística requieran estas habilidades inusuales, y la probabilidad de este riesgo es muy alta (5).
En cuanto a la disponibilidad actual de las habilidades necesarias, esto dependerá de la gestión estadística específica. Incluso si la metodología de encuestas es menos común que la metodología de análisis, también se utiliza en estadísticas oficiales en áreas específicas. Por lo tanto, aunque pueda requerir cierta redistribución de recursos humanos, las gestiones estadísticas pueden encontrar soluciones por sí mismas. En cuanto a las habilidades de computación distribuida, que están principalmente relacionadas con TI, dependerán de cómo se gestione la infraestructura de TI en la organización. Dependiendo de cuán alineado esté el departamento de TI, se pueden encontrar soluciones en el contexto de los acuerdos existentes. Sin embargo, las habilidades de procesamiento de señales y aprendizaje automático generalmente no existen en la mayoría de las gestiones estadísticas oficiales, y la aplicación de estas habilidades no puede subcontratarse, ya que deben ser aplicadas por expertos en estadística. Por lo tanto, desde este punto de vista, la probabilidad de este riesgo también parece ser muy alta (5).
La cultura organizacional también influirá en la probabilidad de este riesgo. La disponibilidad de personal dispuesto a adquirir las habilidades necesarias a través del autoaprendizaje puede brindar a la organización la capacidad de responder a situaciones que impliquen nuevas fuentes de datos, que requieren habilidades diferentes a las habituales. Esto dependerá de la cultura organizacional de la gestión estadística, es decir, de si esta fomenta a los empleados a adquirir nuevas habilidades y si les permite tiempo para el autoaprendizaje.
Por lo tanto, la probabilidad de que la gestión estadística no pueda procesar y analizar nuevas fuentes de datos debido a la falta de habilidades en su personal estará entre probable (4) y frecuente (5), dependiendo de la cultura de autoaprendizaje de la organización.
6.1.3. Influencia
La gestión estadística que no puede procesar y analizar grandes fuentes de datos debido a la falta de habilidades en su personal puede tener dos posibles consecuencias negativas: 1) la fuente de datos no será estudiada, al menos no en su totalidad; 2) la fuente será mal utilizada.
La falta de capacidad para explorar completamente el potencial de una valiosa fuente de big data tendrá un impacto leve (2) a corto plazo, ya que las gestiones estadísticas realmente cuentan con herramientas estadísticas para satisfacer las necesidades actuales. Sin embargo, a largo plazo (y, posiblemente, incluso a mediano plazo), las consecuencias de perder esta oportunidad serán críticas (4), ya que las gestiones estadísticas se enfrentan cada vez más a la competencia de proveedores privados que no cuentan con la misma estructura institucional que les permita garantizar a la sociedad la independencia de los datos estadísticos.
Sin embargo, el uso incorrecto de la fuente tendrá consecuencias extremadamente negativas para las oficinas de estadísticas, ya que la estadística oficial depende en gran medida de su reputación al cumplir con su misión. No obstante, podemos afirmar que la habilidad más importante, que si se omite puede conducir a resultados incorrectos, es la inferencia estadística, en particular la inferencia basada en modelos, que también es menos probable que falte. Por lo tanto, el impacto esperado será más bien crítico (4) que extremo.
6.1.4. Prevención
Las oficinas de estadísticas pueden prevenir activamente este riesgo de dos maneras: 1) formación; y 2) contratación.
Las oficinas de estadísticas pueden proporcionar al personal las habilidades necesarias, definiendo detalladamente las habilidades requeridas para utilizar grandes fuentes de datos en la producción estadística, elaborando un inventario de las habilidades existentes del personal, identificando las necesidades de capacitación y luego organizando cursos de formación.
Las oficinas de estadísticas también pueden contratar nuevos empleados con las habilidades necesarias. Esto parece tener serias limitaciones, dado que las oficinas de estadísticas no podrán reunir una masa crítica de personal para la situación en la que el uso de grandes fuentes de datos se generalice en la sucursal, y los nuevos empleados aún necesitarán varios años para alcanzar el nivel de experiencia de los empleados existentes. Sin embargo, al menos algunos de los nuevos empleados contratados como parte de una renovación de personal normal pueden tener habilidades relacionadas con grandes datos.
6.1.5. Mitigación
Ante una situación en la que nuevas fuentes de grandes datos están disponibles sin empleados con las habilidades necesarias, las oficinas de estadísticas pueden mitigar las consecuencias negativas de dos maneras: 1) subcontratación; y 2) colaboración.
Las oficinas estadísticas pueden celebrar acuerdos para el procesamiento de datos y el análisis de nuevas fuentes de grandes datos con otras organizaciones que ofrecen estos servicios. Parece ser una solución viable, ya que aparece un nuevo sector empresarial especializado en el procesamiento de este tipo de datos. Sin embargo, esta solución conlleva ciertos riesgos, ya que la oficina estadística tendrá menos control sobre la producción de productos estadísticos potencialmente sensibles. Además, esta opción tiene la desventaja de que no permite a los empleados de la oficina estadística aprender y adquirir las habilidades necesarias.
Colaborar con otras organizaciones que cuentan con personal con las habilidades necesarias y que también están interesadas en estudiar la fuente de grandes datos se presenta como una solución más prometedora. Esta colaboración puede tomar la forma de proyectos conjuntos entre empleados de la oficina estadística y empleados de otras organizaciones en igualdad de condiciones, compartiendo sus conocimientos. Esto no solo reduciría el riesgo de falta de habilidades, sino que también permitiría a los empleados de la oficina estadística adquirir esas habilidades.
6.2. Fuga de expertos a otras organizaciones
6.2.1. Descripción
Este riesgo consiste en que las oficinas estadísticas pierden su personal hacia otras organizaciones una vez que han adquirido habilidades relacionadas con grandes datos.
6.2.2. Probabilidad
La probabilidad de este riesgo dependerá de dos factores: 1) oportunidades atractivas existentes en organizaciones fuera de la estadística oficial; 2) las condiciones de trabajo en las oficinas estadísticas.
En cuanto a las oportunidades en organizaciones fuera de la estadística oficial, la probabilidad de este riesgo parece ser alta (4). Hay una gran demanda de personas con habilidades en el manejo de grandes datos en el sector privado, así como en otras organizaciones del sector público. Después de adquirir habilidades en el manejo de grandes datos, las estadísticas oficiales obtendrán una ventaja comparativa al ser especialistas experimentados en el campo estadístico. Además de las habilidades específicas en grandes datos, otras organizaciones requieren especialistas en datos que posean habilidades más tradicionales, como la evaluación de las necesidades de los usuarios y el desarrollo de indicadores clave de rendimiento (KPI), que son comunes para los estadísticos oficiales. Además, se espera que los empleados que estén más dispuestos a adquirir nuevas habilidades también sean quienes estén más abiertos a cambios en su carrera y abandonen la administración estadística.
En cuanto a las condiciones de trabajo en las administraciones estadísticas, esto, evidentemente, dependerá principalmente de la oficina específica. Sin embargo, las administraciones estadísticas, en general, todavía ofrecen atractivas oportunidades profesionales para las personas con un enfoque cuantitativo. Las administraciones estadísticas ofrecen el mayor rango de dominios posibles para trabajar y la mayor variedad de datos con los que trabajar. Esto, de alguna manera, reducirá la probabilidad de que las administraciones estadísticas pierdan su personal debido a circunstancias imprevistas (3).
6.2.3. Impacto
El impacto de este riesgo será el mismo que el riesgo de la falta de personal con las habilidades adecuadas, en primer lugar. Por lo tanto, el impacto será crítico (4), como se mencionó anteriormente.
6.2.4. Prevención
Parece que la única manera para que las oficinas de estadística prevengan este riesgo es asegurando condiciones de trabajo atractivas para sus empleados. Esto es, en general, cierto para todo el personal. Sin embargo, en el caso específico de aquellos empleados interesados en adquirir nuevas habilidades, especialmente en el manejo de grandes datos, se pueden mejorar las condiciones laborales proporcionando oportunidades de formación donde puedan desarrollar sus intereses profesionales. Las oficinas de estadística también pueden prestar especial atención a estar abiertas a nuevos proyectos e ideas innovadoras relacionadas con las nuevas fuentes de grandes datos que provienen de estadísticos que trabajan en varios campos de la estadística. Finalmente, prevenir la pérdida de personal hacia otras organizaciones que requieran su habilidad en el manejo de grandes datos dependerá de la buena identificación del personal dispuesto y capaz de trabajar con estos datos, así como de ofrecer buenas oportunidades para su desarrollo profesional.
6.2.5. Mitigación
La reducción de este riesgo se realizará en relación con la falta de personal con las habilidades adecuadas: 1) subcontratación; y 2) colaboración.
7. Discusión
De esta primera revisión, es evidente que no es posible establecer una única probabilidad o impacto para este «riesgo de grandes datos»; generalmente, ambos indicadores dependen en gran medida de la fuente de grandes datos, así como de la «estadística oficial basada en grandes datos».
producto «.
Por lo tanto, llegamos a la conclusión de que el siguiente paso lógico en esta dirección es adoptar una serie de posibles proyectos piloto (cada uno de los cuales incluye una combinación de uno o varios BDS y uno o varios BDOS) como punto de partida y, para cada uno de estos pilotos, el objetivo es evaluar la probabilidad y el impacto de cada riesgo.
Con este fin, estamos a punto de lanzar una encuesta a las partes interesadas, tratando de evaluar la estimación de OSC sobre la probabilidad, el impacto (y las posibles acciones para prevenir/mitigar) en relación con una serie de posibles proyectos piloto, y solicitar propuestas de OSC sobre los riesgos que no hemos incluido en este documento.
8. REFERENCIASUNECE (2014), «Un marco sugerido para la calidad de los grandes datos», Entregables del Grupo de Trabajo sobre la Calidad de Big Data de la UNECE,
a%20Quality%20Framework%20-%20final-%20Jan08-2015.pdf?version=1&modificationDate=1420725063663&api=v2
UNECE (2014), «¿Qué tan grandes son los grandes datos? Explorando el papel de los grandes datos en las estadísticas oficiales»,
Daas, P., S. Ossen, R. Vis-Visschers, y J. Arends-Toth, (2009), Lista de control para la evaluación de la calidad de las fuentes de datos administrativos, Estadísticas de los Países Bajos, La Haya/Heerlen
Dorfman, Mark S. (2007), Introducción a la Gestión del Riesgo (ed. e), Cambridge, Reino Unido, Woodhead-Faulkner, p. 18, ISBN 0-85941-332-22)
Eurostat (2014), «Procedimiento de acreditación para datos estadísticos de fuentes no oficiales» en Análisis de Métodos para el uso de Internet para la recopilación de estadísticas de la sociedad de la información y otras estadísticas,
Reimsbach-Kounatze, C. (2015), “La proliferación de los “grandes datos” y las implicaciones para las estadísticas oficiales y las agencias estadísticas: Un análisis preliminar”, Documentos de la Economía Digital de la OCDE, No. 245, Publicación de la OCDE.
Reis, F., Ferreira, P., Perduca, V. (2014) «El uso de evidencia de actividad web para aumentar la puntualidad de los indicadores de estadísticas oficiales», trabajo presentado en la conferencia IAOS 2014,
Incluso si no menciona explícitamente los riesgos, este artículo, de hecho, aborda los muchos riesgos asociados con el uso de datos de actividad web para estadísticas oficiales. Eurostat (2007), Manual sobre Métodos y Herramientas de Evaluación de la Calidad de los Datos,
Fuente: habr.com
