Najbardziej pożądane umiejętności w zawodzie data engineer

Zgodnie z statystyki z 2019 roku, data engineer obecnie jest zawodem, na który popyt rośnie najszybciej. Data engineer odgrywa w organizacjach krytyczną rolę – tworzy i utrzymuje działające pipeline'y i bazy danych, które są używane do przetwarzania, transformacji i przechowywania danych. Jakie umiejętności są najważniejsze dla przedstawicieli tego zawodu? Czy lista różni się od wymagań dla data scientistów? O tym wszystkim dowiesz się z mojego artykułu.

Analizowałem oferty pracy na stanowisko data engineer w styczniu 2020 roku, aby zrozumieć, jakie umiejętności technologiczne są najbardziej popularne. Następnie porównałem uzyskane wyniki z danymi dotyczącymi ofert pracy na stanowisko data scientist – ujawniając pewne interesujące różnice.

Obejdźmy się bez długich wstępów – oto dziesięć technologii, które najczęściej pojawiają się w tekstach ofert pracy:

Najbardziej pożądane umiejętności w zawodzie data engineer

Wzmianki o technologiach w ofertach pracy na stanowisko data engineer w 2020 roku

Przejdźmy do sedna.

Obowiązki data engineer

Obecnie praca wykonywana przez data engineers ma ogromne znaczenie dla organizacji – to właśnie ci ludzie odpowiadają za przechowywanie informacji i przetwarzanie jej na taką formę, aby inni pracownicy mogli z niej korzystać. Data engineers budują pipeline'y, aby zorganizować pozyskiwanie danych w strumieniach lub paczkach z wielu źródeł. Następnie pipeline'y przeprowadzają operacje ekstrakcji, transformacji i ładowania (w skrócie procesy ETL), czyniąc dane bardziej użytecznymi do dalszego wykorzystania. Ostatecznie dane przekazywane są analitykom i data scientistom do głębszej analizy. W końcu dane kończą swoją podróż na tablicach informacyjnych, w raportach i modelach do uczenia maszynowego.

Szukam informacji, które pozwoliłyby wywnioskować, jakie technologie są najbardziej pożądane w pracy data engineer w obecnym momencie.

Metody

Zbierałem informacje z trzech stron internetowych z ofertami pracy – SimplyHired, Indeed i Monster i sprawdzałem, jakie słowa kluczowe pojawiają się w zestawieniu z „data engineer” w tekstach ofert pracy skierowanych do mieszkańców USA. Do tego zadania użyłem dwóch bibliotek Python – Requests i Beautiful Soup. Do kluczowych słów włączyłem zarówno te, które znalazły się w poprzedniej liście analizy ofert pracy na stanowisko data scientist, jak i te, które ręcznie wybrałem, przeglądając ogłoszenia o pracę dla data engineers. LinkedIn nie był jednym z źródeł, ponieważ zostałem tam zablokowany po mojej poprzedniej próbie zebrania danych.

Dla każdego słowa kluczowego obliczyłem procent wystąpień w odniesieniu do ogólnej liczby tekstów na każdej ze stron osobno, a następnie obliczyłem średnią wartość z trzech źródeł.

Wyniki

Poniżej przedstawiono trzydzieści terminów technicznych z dziedziny data engineering z najwyższymi wskaźnikami na wszystkich trzech stronach ofert pracy.

Najbardziej pożądane umiejętności w zawodzie data engineer

A oto te same dane, ale przedstawione w formie tabeli:

Najbardziej pożądane umiejętności w zawodzie data engineer

Przejdźmy do rzeczy.

Przegląd wyników

Zarówno SQL, jak i Python pojawiają się w ponad dwóch trzecich rozważanych ofert pracy. Właśnie te dwie technologie mają sens studia w pierwszej kolejności. Python – bardzo popularny język programowania, stosowany do pracy z danymi, tworzenia stron internetowych i pisania skryptów. SQL rozszyfrowywane jako Structured Query Language (język zapytań strukturalnych); zakłada standard realizowany przez grupę języków i jest stosowane do wydobywania danych z baz relacyjnych. Pojawił się już dawno i zyskał uznanie dzięki swojej wysokiej odporności.

O Sparku mówi się w około połowie ofert pracy. Apache Spark – to «zintegrowany silnik analityczny do przetwarzania dużych danych z wbudowanymi modułami do strumieniowania, SQL, uczenia maszynowego i przetwarzania grafów». Cieszy się szczególną popularnością wśród osób pracujących z bazami danych dużych rozmiarów.

AWS znajduje się w około 45% tekstów ofert pracy. To platforma obliczeniowa w chmurze produkcji Amazon; ma największy udział w rynku wśród wszystkich platform chmurowych.
Następnie mamy Javę i Hadoop – trochę ponad 40% dla każdego z nich. Java – szeroko rozpowszechniony, sprawdzony w boju język, który w ankie programistów na Stack Overflow w 2019 roku zajął dziesiąte miejsce wśród języków wywołujących przerażenie u programistów. W przeciwieństwie do niego, Python uplasował się na drugim miejscu wśród języków cieszących się największą miłością. Językiem Java zarządza Oracle, a wszystko, co należy o nim wiedzieć, można zrozumieć z tego zrzutu ekranu z oficjalnej strony z stycznia 2020 roku.

Najbardziej pożądane umiejętności w zawodzie data engineer

Jakby przejechał w czasie
Apache Hadoop używa modelu oprogramowania MapReduce z klastrami serwerów do przetwarzania dużych danych. Model ten zaczyna być coraz częściej porzucany.

Następnie widzimy Hive, Scalę, Kafkę i NoSQL – każda z tych technologii pojawia się w co czwartej ofercie pracy. Apache Hive to program magazynu danych, który "upraszcza odczyt, zapis i zarządzanie dużymi zbiorami danych znajdującymi się w rozproszonych magazynach przy użyciu SQL". Scala – jest językiem programowania, który jest aktywnie wykorzystywany w pracy z dużymi danymi. W szczególności na Scali zbudowano Spark. W już wcześniej wspomnianym rankingu popularnych języków Scala zajmuje jedenastą pozycję. Apache Kafka – to rozproszona platforma do przetwarzania wiadomości strumieniowych. Jest bardzo popularna jako narzędzie do przesyłania danych.

Bazy danych NoSQL stawiają się w opozycji do SQL. Różnią się tym, że nie są relacyjne, są niestrukturalne i mają możliwość poziomej skalowalności. NoSQL zyskał pewną popularność, jednak jego intensywne zainteresowanie, włącznie z przepowiedniami, że zastąpi SQL jako dominującą paradygmat przechowywania, wydaje się być już za nami.

Porównanie z terminami w ofertach pracy dla data scientistów

Oto trzydzieści technologicznych terminów, które są najczęściej spotykane przez pracodawców w dziedzinie data science. Listę tę otrzymałem w ten sam sposób, który opisałem wcześniej dla data engineering.

Najbardziej pożądane umiejętności w zawodzie data engineer

Wzmianki o technologiach w ofertach pracy na stanowisko data scientist w 2020 roku

Mówiąc o ogólnej liczbie, w porównaniu do wcześniej omawianego zestawu, liczba ofert pracy wzrosła o 28% (12 013 w porównaniu do 9 396). Przyjrzyjmy się, jakie technologie występują w ofertach pracy dla data scientistów rzadziej niż dla data engineerów.

Bardziej popularne w data engineering

Na poniższym wykresie przedstawione są słowa kluczowe z średnią różnicą wartości większą niż 10% lub niższą niż -10%.

Najbardziej pożądane umiejętności w zawodzie data engineer

Największe różnice w częstotliwości słów kluczowych między data engineerami a data scientistami

Największy wzrost odnotowuje AWS: w data engineering pojawia się o 25% częściej niż w data science (około 45% i 20% wszystkich ofert pracy odpowiednio). Różnica jest znacząca!

Oto te same dane w nieco innej formie – na wykresie wyniki dla tego samego słowa kluczowego w ofertach pracy na stanowisko data engineer i data scientist są przedstawione obok siebie.

Najbardziej pożądane umiejętności w zawodzie data engineer

Największe różnice w częstotliwości słów kluczowych między data engineerami a data scientistami

Kolejny znaczny wzrost zauważyłem w przypadku Sparka – inżynier danych często musi pracować z dużymi zbiorami danych. Kafka również wzrósł o 20%, co oznacza prawie czterokrotny wzrost w porównaniu z wynikami dla ofert pracy dla data scientist. Przesyłanie danych to jeden z kluczowych obowiązków inżyniera danych. Ostatecznie liczba odniesień wzrosła o 15% w obszarze inżynierii danych w przypadku Java, NoSQL, Redshift, SQL i Hadoop.

Mniej popularne w inżynierii danych

Teraz przyjrzyjmy się, jakie technologie są mniej popularne w ofertach pracy dla inżynierów danych.
Najbardziej wyraźny spadek w porównaniu do obszaru nauki o danych wystąpił w przypadku R: pojawiał się w około 56% ofert pracy, tutaj – tylko w 17%. Imponujące. R to język programowania, który jest popularny wśród naukowców i statystyków, a także zajmuje ósme miejsce w rankingu języków budzących przerażenie.

SAS również występuje w ofertach pracy na stanowisko inżyniera danych znacznie rzadziej – różnica wynosi 14%. SAS to zastrzeżony język, który jest przeznaczony do pracy z danymi i statystyką. Ciekawy fakt: według wyników mojego badania ofert pracy dla data scientists, w ostatnim czasie znacznie stracił na znaczeniu – bardziej niż jakakolwiek inna technologia.

Poszukiwane zarówno w inżynierii danych, jak i w nauce o danych

Należy zauważyć, że osiem z dziesięciu pierwszych pozycji w obu zbiorach jest identycznych. SQL, Python, Spark, AWS, Java, Hadoop, Hive i Scala znalazły się w pierwszej dziesiątce zarówno w branży inżynierii danych, jak i w nauce o danych. Na poniższym wykresie możesz zobaczyć piętnaście najpopularniejszych technologii wśród pracodawców inżynierów danych, a obok – ich wskaźnik w ofertach pracy dla data scientists.

Najbardziej pożądane umiejętności w zawodzie data engineer

Zalecenia

Jeśli chcesz pracować w inżynierii danych, poleciłbym opanować następujące technologie – wymieniam je w kolejności przybliżonego priorytetu.

Poznaj SQL. Namawiam cię szczególnie do PostgreSQL, ponieważ ma otwarty kod, dużą popularność w społeczności i znajduje się w fazie wzrostu. Jak korzystać z tego języka, można dowiedzieć się z książki My Memorable SQL – jej wersja pilotażowa jest dostępna tutaj.

Opanuj Pythona, choćby nie na najbardziej zaawansowanym poziomie. Książka My Memorable Python jest zaprojektowana właśnie dla nowicjuszy. Można ją kupić na Amazon, w wersji elektronicznej lub fizycznej, do wyboru, lub pobrać w formacie pdf lub epub na tej stronie..

Gdy poznasz Pythona, przejdź do pandas – biblioteki Pythona, która jest używana do czyszczenia i przetwarzania danych. Jeśli planujesz pracować w firmie, gdzie wymagane są umiejętności programowania w Pythonie (a takich jest większość), możesz być pewny, że znajomość pandas będzie uważana za standard. Aktualnie kończę wprowadzenie do pracy z pandas – możesz zapisać się, aby nie przegapić daty wydania.

Opanuj AWS. Jeśli chcesz zostać inżynierem danych, nie możesz obejść się bez platformy chmurowej, a AWS to najpopularniejsza z nich. Bardzo pomogły mi kursy Linux Academy, kiedy uczyłem się inżynierii danych na Google Cloud, myślę, że również w przypadku AWS mają dobre materiały.

Jeśli już opanowałeś tę listę i chcesz jeszcze bardziej wyróżnić się w oczach pracodawców jako inżynier danych, proponuję dodać Apache Spark do pracy z danymi dużymi. Mimo że moje badania dotyczące ofert pracy w dziedzinie data science wykazały spadek zainteresowania, w przypadku inżynierów danych wciąż pojawia się on w niemal co drugiej ofercie.

Na koniec

Mam nadzieję, że ten przegląd najbardziej poszukiwanych technologii dla inżynierów danych okazał się dla Ciebie przydatny. Jeśli interesuje Cię, jak wygląda sytuacja w ofertach pracy dla analityków, przeczytaj mój inny artykuł. Życzę udanej inżynierii!

Źródło: habr.com

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster