In den letzten acht Jahren habe ich als Projektleiter gearbeitet (ich schreibe keinen Code in meiner Arbeit), was natürlich negative Auswirkungen auf mein technisches Wissen hat. Ich habe beschlossen, mein technologisches Rückstand zu verringern und den Beruf des Data Engineers zu ergreifen. Die Hauptkompetenz eines Data Engineers besteht darin, Datenlager zu entwickeln, aufzubauen und zu verwalten.
Ich habe einen Lernplan erstellt, von dem ich denke, dass er nicht nur für mich nützlich sein wird. Der Plan ist auf selbstständiges Lernen von Kursen ausgerichtet. Der Schwerpunkt liegt auf kostenlosen Kursen in russischer Sprache.
Abschnitte:
- Algorithmen und Datenstrukturen. Ein zentraler Abschnitt. Wenn du ihn verstehst, wird dir alles andere auch gelingen. Es ist wichtig, die Grundlagen des Programmierens und der Nutzung grundlegender Strukturen und Algorithmen zu beherrschen.
- Datenbanken und Data Warehousing, Business Intelligence. Von Algorithmen gehen wir zu Speicherung und Verarbeitung von Daten über.
- Hadoop und Big Data. Wenn eine Datenbank nicht auf die Festplatte passt oder wenn Daten analysiert werden müssen, aber Excel sie nicht mehr laden kann, beginnt die Welt der Big Data. Meiner Meinung nach sollte man zu diesem Abschnitt erst wechseln, nachdem man die beiden vorherigen gründlich studiert hat.
Algorithmen und Datenstrukturen
In meinen Plan habe ich das Erlernen von Python, das Wiederholen der Grundlagen der Mathematik und der Algorithmik aufgenommen.
Datenbanken und Datenspeicher, Business Intelligence
- Buch: Martin Kleppmann – Hochbelastete Anwendungen. Programmierung, Skalierung, Wartung. Das Buch beschreibt, wie verschiedene Datenmodelle funktionieren, deren interne Implementierung, Einschränkungen und Auswahl je nach Aufgabe.
Themen zu data warehousing, ETL und OLAP-Würfeln hängen stark von den verwendeten Tools ab, daher gebe ich in diesem Dokument keine Links zu Kursen an. Es ist sinnvoll, solche Systeme im Rahmen eines konkreten Projekts in einem bestimmten Unternehmen zu studieren. Für ein erstes Kennenlernen von ETL kann man ausprobieren oder .
Meiner Meinung nach ist es wichtig, die moderne Methodik des Datenarchitekturdesigns Data Vault zu lernen , . Und der beste Weg, es zu lernen, besteht darin, es an einem einfachen Beispiel zu implementieren. Auf GitHub gibt es einige Beispiele für die Implementierung von Data Vault. . Das aktuelle Buch zu Datenspeichern: Modeling the Agile Data Warehouse with Data Vault von Hans Hultgren.
Um sich mit Business-Intelligence-Tools für Endanwender vertraut zu machen, kann der kostenlose Berichtsgenerator, Dashboards und Mini-Datenlager Power BI Desktop verwendet werden. Schulungsmaterialien: , .
Hadoop und Big Data
- Beginnen sollte man mit der eigenständigen Implementierung von MapReduce ohne externe Bibliotheken. Das wird helfen, mehr über Multithreading-Implementierungen zu verstehen. Ein hervorragendes Beispiel in Python wird beschrieben .
Fazit
Nicht alles, was man lernt, lässt sich im Job anwenden. Daher ist ein Abschlussprojekt notwendig, in dem du versuchst, dein neu erlerntes Wissen anzuwenden.
Im Plan sind keine Themen zu Datenanalyse und Machine Learning enthalten, da dies mehr mit dem Beruf des Data Scientist zu tun hat. Auch Themen zu den Cloud-Plattformen AWS und Azure fehlen, da diese stark von der Wahl der Plattform abhängen.
Fragen an die Community:
Wie angemessen ist mein Aufwärtsplan? Was sollte ich entfernen oder hinzufügen?
Welches Projekt empfehlen Sie als Abschlussarbeit?
Quelle: habr.com
