Die gefragtesten Fähigkeiten im Beruf des Data Engineers

Laut Statistik des Jahres 2019, ist Data Engineer derzeit ein Beruf, dessen Nachfrage schneller wächst als die anderer. Data Engineers spielen eine entscheidende Rolle in Organisationen – sie erstellen und warten Pipelines und Datenbanken, die für die Verarbeitung, Transformation und Speicherung von Daten verwendet werden. Welche Fähigkeiten sind für Vertreter dieses Berufs in erster Linie erforderlich? Unterscheidet sich die Liste von dem, was von Data Scientists gefordert wird? All dies erfahren Sie in meinem Artikel.

Ich habe die Stellenangebote für die Position des Data Engineers so analysiert, wie sie im Januar 2020 vorliegen, um herauszufinden, welche technologischen Fähigkeiten am gefragtesten sind. Anschließend verglich ich die Ergebnisse mit der Statistik für Stellenangebote für Data Scientists – dabei kamen einige interessante Unterschiede ans Licht.

Lassen Sie uns ohne lange Einleitungen direkt zu den zehn wichtigsten Technologien kommen, die in den Stellenanzeigen am häufigsten erwähnt werden:

Die gefragtesten Fähigkeiten im Beruf des Data Engineers

Erwähnungen von Technologien in den Stellenanzeigen für Data Engineers im Jahr 2020

Lass uns das klären.

Aufgaben eines Data Engineers

Heutzutage ist die Arbeit der Data Engineers für Organisationen von großer Bedeutung – diese Personen sind verantwortlich für die Speicherung von Informationen und bringen sie in eine Form, die es anderen Mitarbeitern ermöglicht, damit zu arbeiten. Data Engineers bauen Pipelines auf, um die Datenbeschaffung entweder über Streams oder in Paketen aus einer Vielzahl von Quellen zu ermöglichen. Diese Pipelines führen dann Operationen zur Extraktion, Transformation und zum Laden durch (kurz ETL-Prozesse), um die Daten für eine spätere Verwendung besser nutzbar zu machen. Danach werden die Daten Analysten und Data Scientists zur tiefergehenden Verarbeitung übergeben. Schließlich endet die Datenreise auf Informationsdashboards, in Berichten und in Modellen für maschinelles Lernen.

Ich suchte nach Informationen, die einen Hinweis darauf geben könnten, welche Technologien derzeit in der Arbeit eines Data Engineers am gefragtesten sind.

Methoden

Ich sammelte Informationen von drei Jobportalen – SimplyHired, Indeed und Monster und untersuchte, welche Schlüsselwörter in Verbindung mit „Data Engineer“ in den Stellenanzeigen für Personen, die in den USA wohnen, vorkommen. Für diese Aufgabe nutzte ich zwei Python-Bibliotheken – Requests und Beautiful Soup. Ich habe sowohl die Schlüsselwörter aufgenommen, die im vorherigen Analysebericht für die Position des Data Scientist genannt wurden, als auch diejenigen, die ich manuell ausgewählt habe, während ich die Stellenangebote für Data Engineers gelesen habe. LinkedIn war nicht Teil der Quellen, da ich dort nach meinem letzten Versuch, Daten zu sammeln, gesperrt wurde.

Für jedes Schlüsselwort habe ich den Anteil der Treffer an der Gesamtzahl der Texte auf jeder der Webseiten einzeln berechnet und dann den Durchschnittswert über die drei Quellen ermittelt.

Ergebnisse

Unten stehen dreißig technische Begriffe aus dem Bereich Data Engineering mit den höchsten Werten auf allen drei Stellenportalen.

Die gefragtesten Fähigkeiten im Beruf des Data Engineers

Hier sind dieselben Zahlen, aber in Tabellenform dargestellt:

Die gefragtesten Fähigkeiten im Beruf des Data Engineers

Lass uns der Reihe nach vorgehen.

Überblick über die Ergebnisse

Sowohl SQL als auch Python kommen in mehr als zwei Dritteln der betrachteten Stellenangebote vor. Diese beiden Technologien machen es sinnvoll, sie zuerst zu lernen. Python – eine sehr beliebte Programmiersprache, die zur Arbeit mit Daten, zur Erstellung von Webseiten und zum Schreiben von Skripten verwendet wird. SQL steht für Structured Query Language (Sprache für strukturierte Abfragen); sie stellt einen Standard dar, der von einer Gruppe von Sprachen implementiert wird, und wird zum Abrufen von Daten aus relationalen Datenbanken verwendet. Sie ist schon lange vorhanden und hat sich durch hohe Zuverlässigkeit ausgezeichnet.

Spark wird in etwa der Hälfte der Stellenangebote erwähnt. Apache Spark – das ist "ein vereinheitlichter Analyse-Engine für die Verarbeitung großer Datenmengen mit integrierten Modulen für Streaming, SQL, maschinelles Lernen und Graphverarbeitung". Es ist besonders beliebt bei denjenigen, die mit großen Datenbanken arbeiten.

AWS findet man in etwa 45% der Stellenangebote. Dies ist die Cloud-Computing-Plattform von Amazon; sie hat den größten Marktanteil unter allen Cloud-Plattformen.
An zweiter Stelle stehen Java und Hadoop – etwas über 40% für jedes. Java – eine weit verbreitete, bewährte Sprache, die in der Umfrage unter Entwicklern von Stack Overflow 2019 den zehnten Platz unter den Sprachen belegte, die Programmierern Angst einflößen. Im Gegensatz dazu belegte Python den zweiten Platz unter den am meisten geliebten Sprachen. Java wird von Oracle geleitet, und alles, was man darüber wissen muss, kann man aus diesem Screenshot der offiziellen Seite von Januar 2020 entnehmen.

Die gefragtesten Fähigkeiten im Beruf des Data Engineers

Wie mit einer Zeitmaschine gereist
Apache Hadoop verwendet das Programmiermodell MapReduce mit Server-Clustern für Big Data. Diese Modell wird zunehmend weniger verwendet.

Darüber hinaus sehen wir Hive, Scala, Kafka und NoSQL – jede dieser Technologien wird in einem Viertel der vorgestellten Stellenangebote erwähnt. Apache Hive ist ein Datenlager, das "das Lesen, Schreiben und Verwalten großer Datensätze in verteilten Speichern mit SQL vereinfacht." Scala - eine Programmiersprache, die häufig bei der Arbeit mit Big Data eingesetzt wird. Insbesondere wurde Spark in Scala entwickelt. Im bereits erwähnten Ranking der gefragtesten Programmiersprachen belegt Scala den elften Platz. Apache Kafka - eine verteilte Plattform zur Verarbeitung von Streaming-Nachrichten. Sie ist sehr beliebt als Mittel zur Datenübertragung.

NoSQL-Datenbanken stellen sich SQL entgegen. Sie unterscheiden sich dadurch, dass sie nicht relational, nicht strukturiert sind und horizontale Skalierbarkeit bieten. NoSQL hat eine gewisse Popularität gewonnen, jedoch scheint die fieberhafte Begeisterung für diesen Ansatz, bis hin zu Prophezeiungen, dass er SQL als dominierende Speicherparadigma ersetzen wird, bereits vorüber zu sein.

Vergleich mit Begriffen in Stellenangeboten für Data Scientists

Hier sind dreißig Technologietermine, die bei Arbeitgebern im Bereich Data Science am häufigsten vorkommen. Diese Liste habe ich auf die gleiche Weise erstellt, wie ich sie zuvor für Data Engineering beschrieben habe.

Die gefragtesten Fähigkeiten im Beruf des Data Engineers

Nennungen von Technologien in Stellenanzeigen für Data Scientists im Jahr 2020

Im Gesamten betrachtet, im Vergleich zum früher betrachteten Set, gab es 28% mehr Stellenangebote (12.013 gegenüber 9.396). Lassen Sie uns sehen, welche Technologien in Stellenangeboten für Data Scientists seltener vorkommen als für Data Engineers.

Beliebter im Data Engineering

Die folgende Grafik zeigt Schlüsselwörter mit einem durchschnittlichen Differenzwert von mehr als 10% oder weniger als -10%.

Die gefragtesten Fähigkeiten im Beruf des Data Engineers

Die größten Unterschiede in der Häufigkeit von Schlüsselwörtern zwischen Data Engineer und Data Scientist

Der größte Anstieg wird bei AWS festgestellt: Im Data Engineering taucht es 25% häufiger auf als im Data Science (ungefähr 45% gegenüber 20% der Gesamtzahl der Stellenangebote). Der Unterschied ist spürbar!

Hier sind dieselben Daten in einer etwas anderen Darstellung – in der Grafik sind die Ergebnisse für dasselbe Schlüsselwort in den Stellenangeboten für Data Engineer und Data Scientist nebeneinander angeordnet.

Die gefragtesten Fähigkeiten im Beruf des Data Engineers

Die größten Unterschiede in der Häufigkeit von Schlüsselwörtern zwischen Data Engineer und Data Scientist

Den nächsten großen Anstieg habe ich bei Spark bemerkt – Data Engineers müssen häufig mit großen Daten arbeiten. Kafka ist ebenfalls um 20% gestiegen, also fast viermal so viel im Vergleich zum Ergebnis bei den Stellenangeboten für Data Scientists. Die Datenübertragung ist eine der Hauptaufgaben von Data Engineers. Schließlich war die Anzahl der Erwähnungen um 15% höher im Bereich Data Engineering für Java, NoSQL, Redshift, SQL und Hadoop.

Weniger beliebte Technologien im Data Engineering

Schauen wir uns nun an, welche Technologien in den Stellenangeboten für Data Engineers weniger beliebt sind.
Der stärkste Rückgang im Vergleich zum Bereich Data Science trat bei Rstatt: Dort war es in etwa 56% der Stellenangebote vertreten, hier nur in 17%. Beeindruckend. R ist eine Programmiersprache, die bei Wissenschaftlern und Statistikern beliebt ist und den achten Platz im Ranking der gefürchtetsten Programmiersprachen einnimmt.

SAS wird in den Stellenangeboten für Data Engineers ebenfalls deutlich seltener erwähnt – die Differenz beträgt 14%. SAS ist eine proprietäre Sprache, die für die Arbeit mit Statistik und Daten konzipiert ist. Interessanter Punkt: Laut den Ergebnissen meiner Untersuchung zu Stellenangeboten für Data Scientists, hat es in letzter Zeit massiv an Bedeutung verloren – stärker als jede andere Technologie.

Gefragt sowohl im Data Engineering als auch im Data Science

Es ist zu beachten, dass acht der zehn besten Positionen in beiden Sets übereinstimmen. SQL, Python, Spark, AWS, Java, Hadoop, Hive und Scala gehören zur Top Ten sowohl im Bereich Data Engineering als auch im Data Science. Im folgenden Diagramm sehen Sie die fünfzehn beliebtesten Technologien bei Arbeitgebern von Data Engineers, sowie deren Werte für Stellenangebote für Data Scientists.

Die gefragtesten Fähigkeiten im Beruf des Data Engineers

Empfehlungen

Wenn Sie im Data Engineering tätig sein möchten, würde ich empfehlen, die folgenden Technologien zu erlernen – ich liste sie in der Reihenfolge ihrer ungefähren Priorität auf.

Lernen Sie SQL. Ich empfehle Ihnen speziell PostgreSQL, weil es Open Source ist, große Beliebtheit in der Community hat und sich in einer Wachstumsphase befindet. Wie man die Sprache nutzt, erfahren Sie aus dem Buch My Memorable SQL – die Pilotversion ist verfügbar hier.

Lernen Sie Python, auch wenn nicht auf dem härtesten Niveau. Das Buch My Memorable Python ist genau für Anfänger gedacht. Es kann gekauft werden auf Amazon, eine elektronische oder gedruckte Version, je nach Ihrer Wahl, oder als pdf- oder epub-Datei heruntergeladen werden auf dieser Webseite.

Sobald Sie sich mit Python vertraut gemacht haben, wechseln Sie zu pandas – der Python-Bibliothek, die bei der Datenbereinigung und -verarbeitung verwendet wird. Wenn Sie darauf abzielen, in einem Unternehmen zu arbeiten, in dem Python-Kenntnisse erforderlich sind (und das sind die meisten), können Sie sicher sein, dass Kenntnisse in pandas als selbstverständlich angesehen werden. Ich beende gerade ein Einführungshandbuch zur Arbeit mit pandas – Sie können abonnieren, um den Veröffentlichungstermin nicht zu verpassen.

Lernen Sie AWS. Wenn Sie Data Engineer werden möchten, kommen Sie um eine Cloud-Plattform nicht herum, und AWS ist die beliebteste unter ihnen. Mir haben die Kurse sehr geholfen, Linux Academyals ich Data Engineering auf Google Cloud gelernt habe,, ich denke, dass es auch gute Materialien zu AWS gibt.

Wenn Sie bereits die gesamte Liste bewältigt haben und in den Augen der Arbeitgeber als Data Engineer weiter wachsen möchten, empfehle ich, Apache Spark für die Arbeit mit großen Daten hinzuzufügen. Obwohl meine Untersuchung zu Data Science-Stellen einen Rückgang des Interesses gezeigt hat, ist es bei Data Engineers trotzdem fast in jeder zweiten Stelle zu sehen.

Zum Schluss

Hoffentlich war dieser Überblick über die gefragtesten Technologien für Data Engineers für Sie nützlich. Wenn Sie sich dafür interessieren, wie es bei den Stellenangeboten für Analysten aussieht, lesen Sie meinen anderen Artikel. Erfolgreiches Engineering!

Quelle: habr.com

60GB SSD 8Gb DDR4