Durante los últimos ocho años he trabajado como gerente de proyectos (no escribo código en mi trabajo), lo que, por supuesto, impacta negativamente en mi base tecnológica. Decidí reducir mi desventaja tecnológica y obtener la profesión de ingeniero de datos. La habilidad principal del ingeniero de datos es la capacidad de desarrollar, construir y mantener almacenes de datos.
He elaborado un plan de estudios que creo que será útil no solo para mí. El plan está orientado al autoaprendizaje de cursos, dando prioridad a los cursos gratuitos en ruso.
Secciones:
- Algoritmos y estructuras de datos. Sección clave. Si la entiendes, todo lo demás también saldrá bien. Es importante practicar la escritura de código y el uso de estructuras y algoritmos básicos.
- Bases y almacenes de datos, Inteligencia Empresarial. De los algoritmos pasamos al almacenamiento y procesamiento de datos.
- Hadoop y Big Data. Cuando la base de datos no cabe en el disco duro, o cuando los datos necesitan ser analizados pero Excel ya no puede cargarlos, empieza el Big Data. En mi opinión, se debe pasar a esta sección solo después de un estudio profundo de las dos anteriores.
Algoritmos y estructuras de datos
En mi plan he incluido el estudio de Python, la revisión de fundamentos de matemáticas y algoritmos.
Bases de datos y almacenamiento de datos, Inteligencia Empresarial
- Libro: Martin Kleppmann - Aplicaciones de alta carga. Programación, escalado, soporte. El libro describe cómo funcionan diferentes modelos de datos, su implementación interna, limitaciones y elecciones según la tarea.
Los temas relacionados con la construcción de almacenes de datos, ETL, cubos OLAP dependen en gran medida de las herramientas, por lo que en este documento no doy enlaces a cursos. Es recomendable estudiar estos sistemas al trabajar en un proyecto específico en una empresa concreta. Para familiarizarse con ETL, se puede probar o .
En mi opinión, es importante estudiar la metodología moderna de diseño de almacenes de datos Data Vault. , . Y la mejor manera de aprenderlo es implementarlo en un ejemplo sencillo. En GitHub hay varios ejemplos de implementación de Data Vault . Libro moderno sobre almacenes de datos: Modeling the Agile Data Warehouse with Data Vault de Hans Hultgren.
Para familiarizarse con las herramientas de Business Intelligence para los usuarios finales, se puede utilizar el constructor gratuito de informes, paneles y mini almacenes de datos Power BI Desktop. Materiales de capacitación: , .
Hadoop y Big Data
- Hay que comenzar con la implementación independiente de MapReduce sin bibliotecas externas. Esto permitirá entender mejor las implementaciones multihilo en el futuro. Un excelente ejemplo en Python se describe .
Conclusión
No todo lo que se estudia se puede aplicar en el trabajo. Por lo tanto, se necesita un proyecto de graduación en el que intentarás aplicar nuevos conocimientos.
En el plan no hay temas relacionados con el análisis de datos y Machine Learning, ya que esto se relaciona más con la profesión de Data Scientist. Tampoco hay temas relacionados con las nubes de AWS, Azure, ya que estos temas dependen en gran medida de la elección de la plataforma.
Preguntas a la comunidad:
¿Qué tan adecuado es mi plan de desarrollo? ¿Qué debería quitar o agregar?
¿Qué proyecto recomendarías como trabajo de graduación?
Fuente: habr.com
