Laut , der Beruf des Data Engineers ist derzeit einer der am schnellsten wachsenden Berufe. Data Engineers spielen eine entscheidende Rolle in Organisationen – sie erstellen und warten Pipelines sowie Datenbanken, die zur Verarbeitung, Transformation und Speicherung von Daten genutzt werden. Welche Fähigkeiten sind für diese Berufsgruppe besonders wichtig? Weicht die Liste von den Anforderungen an Data Scientists ab? All das erfahren Sie in meinem Artikel.
Ich habe die Stellenanzeigen für die Position des Data Engineers analysiert, wie sie im Januar 2020 vorlagen, um herauszufinden, welche technologischen Fähigkeiten am gefragtesten sind. Anschließend habe ich die Ergebnisse mit den Statistiken zu Stellenanzeigen für Data Scientists verglichen – dabei traten einige interessante Unterschiede zutage.
Lassen Sie uns auf lange Einleitungen verzichten – hier sind die zehn am häufigsten in Stellenanzeigen genannten Technologien:

Erwähnungen von Technologien in Stellenanzeigen für die Position des Data Engineers im Jahr 2020
Lassen Sie uns das klären.
Aufgaben eines Data Engineers
Heutzutage spielt die Arbeit von Data Engineers eine entscheidende Rolle für Unternehmen. Diese Fachkräfte sind dafür verantwortlich, Informationen zu speichern und sie so aufzubereiten, dass andere Mitarbeiter damit arbeiten können. Data Engineers erstellen Pipelines, um Daten aus verschiedenen Quellen in Echtzeit oder in Paketen zu erfassen. Diese Pipelines führen dann Extraktions-, Transformations- und Ladeprozesse (ETL-Prozesse) durch, um die Daten für die weitere Verwendung aufzubereiten. Anschließend werden die Daten an Analysten und Data Scientists übergeben, um eine tiefere Verarbeitung zu ermöglichen. Schließlich finden die Daten ihren Platz in Dashboards, Berichten und Modellen für maschinelles Lernen.
Ich suche nach Informationen, die mir helfen, zu verstehen, welche Technologien derzeit am meisten nachgefragt werden in der Arbeit eines Data Engineers.
Methoden
Ich habe Informationen von drei Jobportalen gesammelt — , und und habe untersucht, welche Schlüsselwörter häufig im Zusammenhang mit 'Data Engineer' in den Stellenanzeigen erscheinen, die für US-Bürger gedacht sind. Für diese Aufgabe habe ich zwei Python-Bibliotheken verwendet — und Ich habe sowohl die Schlüsselwörter aus der vorherigen Liste für die Analyse von Stellenangeboten für Data Scientists als auch die manuell ausgewählten Schlüsselwörter aus den Stellenangeboten für Data Engineers einbezogen. LinkedIn wurde nicht als Quelle genutzt, da ich dort nach dem letzten Versuch, Daten zu sammeln, gesperrt wurde.
Für jedes Schlüsselwort habe ich den Prozentsatz der Treffer im Verhältnis zur Gesamtzahl der Texte auf jeder der Websites einzeln berechnet und dann den Durchschnitt über die drei Quellen ermittelt.
Ergebnisse
Im Folgenden sind dreißig technische Begriffe aus dem Bereich Data Engineering aufgeführt, die in allen drei Jobportalen die höchsten Werte aufweisen.

Hier sind die gleichen Zahlen, aber in Tabellenform dargestellt:

Lassen Sie uns der Reihe nach vorgehen.
Übersicht der Ergebnisse
Sowohl SQL als auch Python kommen in mehr als zwei Dritteln der untersuchten Stellenangebote vor. Diese beiden Technologien sind besonders sinnvoll, um sie zuerst zu lernen. – eine sehr beliebte Programmiersprache, die für die Arbeit mit Daten, die Erstellung von Websites und das Schreiben von Skripten verwendet wird. steht für Structured Query Language (Structured Query Language); es ist ein Standard, der von einer Gruppe von Sprachen umgesetzt wird und zur Abfrage von Daten aus relationalen Datenbanken verwendet wird. Es ist schon lange etabliert und hat sich durch hohe Zuverlässigkeit ausgezeichnet.
In etwa der Hälfte der Stellenangebote wird über Spark gesprochen. ist eine 'vereinte Analyse-Engine zur Verarbeitung großer Datenmengen mit integrierten Modulen für Streaming, SQL, maschinelles Lernen und Graphverarbeitung'. Es erfreut sich besonderer Beliebtheit bei denen, die mit großen Datenbanken arbeiten.
AWS kommt in etwa 45% der Stellenangebote vor. Es handelt sich um eine Cloud-Computing-Plattform von Amazon; sie hat den größten Marktanteil unter allen Cloud-Plattformen.
Gefolgt von Java und Hadoop – etwa 40% pro Stück. ein weit verbreitetes, erprobtes Programmiersprache, die in kam auf den zehnten Platz unter den Programmiersprachen, die bei Entwicklern Schrecken auslösen. Im Gegensatz dazu belegte Python den zweiten Platz unter den am meisten geschätzten Sprachen. Die Sprache Java wird von Oracle geführt, und alles, was man darüber wissen muss, lässt sich in diesem Screenshot der offiziellen Seite von Januar 2020 erfassen.

Wie mit einer Zeitmaschine gefahren.
verwendet ein Softwaremodell namens MapReduce mit Serverclustern für Big Data. Dieses Modell wird inzwischen zunehmend als unzureichend angesehen.
Darüber hinaus sehen wir Hive, Scala, Kafka und NoSQL – jede dieser Technologien wird in einem Viertel der vorgestellten Stellenangebote erwähnt. Apache Hive ist ein Datenlager, das "das Lesen, Schreiben und Verwalten großer Datensätze, die in verteilten Speichern liegen, mithilfe von SQL erleichtert." ist eine Programmiersprache, die aktiv zur Verarbeitung von Big Data eingesetzt wird. Insbesondere wurde Spark auf Scala entwickelt. Im bereits erwähnten Ranking der gefürchtetsten Sprachen belegt Scala den elften Platz. ist eine verteilte Plattform zur Verarbeitung von Streaming-Nachrichten. Sie ist sehr beliebt als Mittel zur Datenübertragung.
stehen SQL gegenüber. Sie zeichnen sich dadurch aus, dass sie nicht relational, nicht strukturiert und horizontal skalierbar sind. NoSQL hat an Popularität gewonnen, doch die fieberhafte Begeisterung für diesen Ansatz, einschließlich der Prophezeiungen, dass er SQL als dominante Speicherparadigmen ablösen wird, scheint hinter uns zu liegen.
Vergleich von Begriffen in Stellenanzeigen für Data Scientists
Hier sind dreißig technologische Begriffe, die bei Arbeitgebern im Bereich Data Science am häufigsten vorkommen. Diese Liste habe ich auf die gleiche Weise erstellt, wie ich es zuvor für Data Engineering beschrieben habe.

Erwähnungen von Technologien in Stellenangeboten für Data Scientists im Jahr 2020
Im Vergleich zur zuvor betrachteten Gruppe gab es insgesamt 28 % mehr Stellenangebote (12.013 gegenüber 9.396). Lassen Sie uns untersuchen, welche Technologien in Stellenanzeigen für Data Scientists seltener vorkommen als für Data Engineers.
Beliebter im Data Engineering
In der folgenden Grafik sind Keywords dargestellt, die einen durchschnittlichen Unterschied von über 10 % oder unter -10 % aufweisen.

Die größten Unterschiede in der Häufigkeit von Schlüsselbegriffen zwischen Data Engineers und Data Scientists
Der signifikanteste Anstieg wird bei AWS beobachtet: Im Bereich Data Engineering erscheint er 25 % häufiger als im Bereich Data Science (ungefähr 45 % und 20 % der Gesamtzahl der Stellenangebote). Der Unterschied ist spürbar!
Hier sind die gleichen Daten in einer etwas anderen Darstellung – in der Grafik sind die Ergebnisse für dasselbe Schlüsselwort in den Stellenangeboten für Data Engineer und Data Scientist nebeneinander angeordnet.

Die größten Unterschiede in der Häufigkeit von Schlüsselbegriffen zwischen Data Engineers und Data Scientists
Der nächstgrößte Anstieg, den ich festgestellt habe, betrifft Spark – Data Engineers arbeiten oft mit großen Datenmengen. Es gab ebenfalls einen Anstieg von 20 %, was fast dem Viertel gegenüber den Stellenangeboten für Data Scientist entspricht. Die Datenübertragung ist eine der zentralen Aufgaben eines Data Engineers. Schließlich gab es 15 % mehr Erwähnungen im Bereich Data Engineering für Java, NoSQL, Redshift, SQL und Hadoop.
Weniger verbreitet in Data Engineering
Lassen Sie uns nun einen Blick darauf werfen, welche Technologien in den Stellenangeboten für Data Engineers weniger populär sind.
Der drastischste Rückgang im Vergleich zum Bereich Data Science fand bei statt, wo er in etwa 56 % der Stellenangebote vorkam, hier jedoch nur in 17 %. Beeindruckend. R ist eine Programmiersprache, die bei Wissenschaftlern und Statistikern beliebt ist und den achten Platz im Ranking der gefürchtetsten Sprachen einnimmt.
in Stellenangeboten für die Position des Data Engineers deutlich seltener zu finden – die Differenz beträgt 14 %. SAS ist eine proprietäre Sprache, die für die Arbeit mit Statistiken und Daten entwickelt wurde. Interessanterweise deuten die Ergebnisse , dass sie in letzter Zeit stark an Bedeutung verloren hat – stärker als jede andere Technologie.
Gefragt sind sowohl im Data Engineering als auch im Data Science
Es ist zu beachten, dass acht der zehn besten Positionen in beiden Datensätzen übereinstimmen. SQL, Python, Spark, AWS, Java, Hadoop, Hive und Scala gehören zu den Top Ten sowohl in der Data Engineering-Branche als auch im Data Science. Im Diagramm unten können Sie die fünfzehn gefragtesten Technologien bei Arbeitgebern von Data Engineers sehen, daneben deren Indikator in den Stellenangeboten für Data Scientists.

Empfehlungen
Wenn Sie sich mit Data Engineering beschäftigen möchten, empfehle ich Ihnen, folgende Technologien zu erlernen – ich liste sie in der Reihenfolge ihrer ungefähren Priorität auf.
Lernen Sie SQL. Ich empfehle Ihnen PostgreSQL, da es quelloffen ist, in der Gemeinschaft sehr beliebt ist und sich in einer Wachstumsphase befindet. Wie man die Sprache benutzt, erfahren Sie aus dem Buch My Memorable SQL – eine Pilotversion ist verfügbar. .
Lernen Sie Python, aber nicht auf dem härtesten Niveau. Das Buch "My Memorable Python" richtet sich genau an Anfänger. Sie können es kaufen auf , eine elektronische oder physische Kopie, je nach Wahl, oder es im PDF- oder EPUB-Format herunterladen .
Sobald Sie mit Python vertraut sind, wenden Sie sich an pandas – die Python-Bibliothek, die zur Datenbereinigung und -verarbeitung verwendet wird. Wenn Sie in einem Unternehmen arbeiten wollen, das Kenntnisse in Python verlangt (und das sind die meisten), können Sie sicher sein, dass das Wissen über pandas vorausgesetzt wird. Ich beende gerade ein Einführungshandbuch für pandas – Sie können , um den Veröffentlichungszeitpunkt nicht zu verpassen.
Lernen Sie AWS. Wenn Sie Data Engineer werden möchten, ist eine Cloud-Plattform in Ihrer Toolbox unerlässlich und AWS ist die beliebteste unter ihnen. Mir haben die Kurse sehr geholfen, , als ich , ich denke, dass sie auch gute Materialien zu AWS haben werden.
Wenn Sie bereits diese gesamte Liste durchgearbeitet haben und Ihren Wert als Data Engineer steigern möchten, empfehle ich, Apache Spark hinzuzufügen, um mit großen Daten zu arbeiten. Obwohl meine Recherche zu Stellenanzeigen im Bereich Data Science einen Rückgang des Interesses gezeigt hat, erscheint Spark dennoch in fast jeder zweiten Anzeige für Data Engineers.
Abschließend
Ich hoffe, dieser Überblick über die gefragtesten Technologien für Data Engineers war für Sie nützlich. Wenn Sie interessiert sind, wie die Lage bei den Stellenangeboten für Analysten aussieht, lesen Sie . Viel Erfolg beim Engineering!
Quelle: habr.com
