Zgodnie z , data engineer obecnie jest zawodem, na który popyt rośnie najszybciej. Data engineer odgrywa w organizacjach krytyczną rolę – tworzy i utrzymuje działające pipeline'y i bazy danych, które są używane do przetwarzania, transformacji i przechowywania danych. Jakie umiejętności są najważniejsze dla przedstawicieli tego zawodu? Czy lista różni się od wymagań dla data scientistów? O tym wszystkim dowiesz się z mojego artykułu.
Analizowałem oferty pracy na stanowisko data engineer w styczniu 2020 roku, aby zrozumieć, jakie umiejętności technologiczne są najbardziej popularne. Następnie porównałem uzyskane wyniki z danymi dotyczącymi ofert pracy na stanowisko data scientist – ujawniając pewne interesujące różnice.
Obejdźmy się bez długich wstępów – oto dziesięć technologii, które najczęściej pojawiają się w tekstach ofert pracy:

Wzmianki o technologiach w ofertach pracy na stanowisko data engineer w 2020 roku
Przejdźmy do sedna.
Obowiązki data engineer
Obecnie praca wykonywana przez data engineers ma ogromne znaczenie dla organizacji – to właśnie ci ludzie odpowiadają za przechowywanie informacji i przetwarzanie jej na taką formę, aby inni pracownicy mogli z niej korzystać. Data engineers budują pipeline'y, aby zorganizować pozyskiwanie danych w strumieniach lub paczkach z wielu źródeł. Następnie pipeline'y przeprowadzają operacje ekstrakcji, transformacji i ładowania (w skrócie procesy ETL), czyniąc dane bardziej użytecznymi do dalszego wykorzystania. Ostatecznie dane przekazywane są analitykom i data scientistom do głębszej analizy. W końcu dane kończą swoją podróż na tablicach informacyjnych, w raportach i modelach do uczenia maszynowego.
Szukam informacji, które pozwoliłyby wywnioskować, jakie technologie są najbardziej pożądane w pracy data engineer w obecnym momencie.
Metody
Zbierałem informacje z trzech stron internetowych z ofertami pracy – , i i sprawdzałem, jakie słowa kluczowe pojawiają się w zestawieniu z „data engineer” w tekstach ofert pracy skierowanych do mieszkańców USA. Do tego zadania użyłem dwóch bibliotek Python – i . Do kluczowych słów włączyłem zarówno te, które znalazły się w poprzedniej liście analizy ofert pracy na stanowisko data scientist, jak i te, które ręcznie wybrałem, przeglądając ogłoszenia o pracę dla data engineers. LinkedIn nie był jednym z źródeł, ponieważ zostałem tam zablokowany po mojej poprzedniej próbie zebrania danych.
Dla każdego słowa kluczowego obliczyłem procent wystąpień w odniesieniu do ogólnej liczby tekstów na każdej ze stron osobno, a następnie obliczyłem średnią wartość z trzech źródeł.
Wyniki
Poniżej przedstawiono trzydzieści terminów technicznych z dziedziny data engineering z najwyższymi wskaźnikami na wszystkich trzech stronach ofert pracy.

A oto te same dane, ale przedstawione w formie tabeli:

Przejdźmy do rzeczy.
Przegląd wyników
Zarówno SQL, jak i Python pojawiają się w ponad dwóch trzecich rozważanych ofert pracy. Właśnie te dwie technologie mają sens studia w pierwszej kolejności. – bardzo popularny język programowania, stosowany do pracy z danymi, tworzenia stron internetowych i pisania skryptów. rozszyfrowywane jako Structured Query Language (język zapytań strukturalnych); zakłada standard realizowany przez grupę języków i jest stosowane do wydobywania danych z baz relacyjnych. Pojawił się już dawno i zyskał uznanie dzięki swojej wysokiej odporności.
O Sparku mówi się w około połowie ofert pracy. – to «zintegrowany silnik analityczny do przetwarzania dużych danych z wbudowanymi modułami do strumieniowania, SQL, uczenia maszynowego i przetwarzania grafów». Cieszy się szczególną popularnością wśród osób pracujących z bazami danych dużych rozmiarów.
AWS znajduje się w około 45% tekstów ofert pracy. To platforma obliczeniowa w chmurze produkcji Amazon; ma największy udział w rynku wśród wszystkich platform chmurowych.
Następnie mamy Javę i Hadoop – trochę ponad 40% dla każdego z nich. – szeroko rozpowszechniony, sprawdzony w boju język, który w zajął dziesiąte miejsce wśród języków wywołujących przerażenie u programistów. W przeciwieństwie do niego, Python uplasował się na drugim miejscu wśród języków cieszących się największą miłością. Językiem Java zarządza Oracle, a wszystko, co należy o nim wiedzieć, można zrozumieć z tego zrzutu ekranu z oficjalnej strony z stycznia 2020 roku.

Jakby przejechał w czasie
używa modelu oprogramowania MapReduce z klastrami serwerów do przetwarzania dużych danych. Model ten zaczyna być coraz częściej porzucany.
Następnie widzimy Hive, Scalę, Kafkę i NoSQL – każda z tych technologii pojawia się w co czwartej ofercie pracy. Apache Hive to program magazynu danych, który "upraszcza odczyt, zapis i zarządzanie dużymi zbiorami danych znajdującymi się w rozproszonych magazynach przy użyciu SQL". – jest językiem programowania, który jest aktywnie wykorzystywany w pracy z dużymi danymi. W szczególności na Scali zbudowano Spark. W już wcześniej wspomnianym rankingu popularnych języków Scala zajmuje jedenastą pozycję. – to rozproszona platforma do przetwarzania wiadomości strumieniowych. Jest bardzo popularna jako narzędzie do przesyłania danych.
stawiają się w opozycji do SQL. Różnią się tym, że nie są relacyjne, są niestrukturalne i mają możliwość poziomej skalowalności. NoSQL zyskał pewną popularność, jednak jego intensywne zainteresowanie, włącznie z przepowiedniami, że zastąpi SQL jako dominującą paradygmat przechowywania, wydaje się być już za nami.
Porównanie z terminami w ofertach pracy dla data scientistów
Oto trzydzieści technologicznych terminów, które są najczęściej spotykane przez pracodawców w dziedzinie data science. Listę tę otrzymałem w ten sam sposób, który opisałem wcześniej dla data engineering.

Wzmianki o technologiach w ofertach pracy na stanowisko data scientist w 2020 roku
Mówiąc o ogólnej liczbie, w porównaniu do wcześniej omawianego zestawu, liczba ofert pracy wzrosła o 28% (12 013 w porównaniu do 9 396). Przyjrzyjmy się, jakie technologie występują w ofertach pracy dla data scientistów rzadziej niż dla data engineerów.
Bardziej popularne w data engineering
Na poniższym wykresie przedstawione są słowa kluczowe z średnią różnicą wartości większą niż 10% lub niższą niż -10%.

Największe różnice w częstotliwości słów kluczowych między data engineerami a data scientistami
Największy wzrost odnotowuje AWS: w data engineering pojawia się o 25% częściej niż w data science (około 45% i 20% wszystkich ofert pracy odpowiednio). Różnica jest znacząca!
Oto te same dane w nieco innej formie – na wykresie wyniki dla tego samego słowa kluczowego w ofertach pracy na stanowisko data engineer i data scientist są przedstawione obok siebie.

Największe różnice w częstotliwości słów kluczowych między data engineerami a data scientistami
Kolejny znaczny wzrost zauważyłem w przypadku Sparka – inżynier danych często musi pracować z dużymi zbiorami danych. również wzrósł o 20%, co oznacza prawie czterokrotny wzrost w porównaniu z wynikami dla ofert pracy dla data scientist. Przesyłanie danych to jeden z kluczowych obowiązków inżyniera danych. Ostatecznie liczba odniesień wzrosła o 15% w obszarze inżynierii danych w przypadku Java, NoSQL, Redshift, SQL i Hadoop.
Mniej popularne w inżynierii danych
Teraz przyjrzyjmy się, jakie technologie są mniej popularne w ofertach pracy dla inżynierów danych.
Najbardziej wyraźny spadek w porównaniu do obszaru nauki o danych wystąpił w przypadku : pojawiał się w około 56% ofert pracy, tutaj – tylko w 17%. Imponujące. R to język programowania, który jest popularny wśród naukowców i statystyków, a także zajmuje ósme miejsce w rankingu języków budzących przerażenie.
również występuje w ofertach pracy na stanowisko inżyniera danych znacznie rzadziej – różnica wynosi 14%. SAS to zastrzeżony język, który jest przeznaczony do pracy z danymi i statystyką. Ciekawy fakt: według wyników , w ostatnim czasie znacznie stracił na znaczeniu – bardziej niż jakakolwiek inna technologia.
Poszukiwane zarówno w inżynierii danych, jak i w nauce o danych
Należy zauważyć, że osiem z dziesięciu pierwszych pozycji w obu zbiorach jest identycznych. SQL, Python, Spark, AWS, Java, Hadoop, Hive i Scala znalazły się w pierwszej dziesiątce zarówno w branży inżynierii danych, jak i w nauce o danych. Na poniższym wykresie możesz zobaczyć piętnaście najpopularniejszych technologii wśród pracodawców inżynierów danych, a obok – ich wskaźnik w ofertach pracy dla data scientists.

Zalecenia
Jeśli chcesz pracować w inżynierii danych, poleciłbym opanować następujące technologie – wymieniam je w kolejności przybliżonego priorytetu.
Poznaj SQL. Namawiam cię szczególnie do PostgreSQL, ponieważ ma otwarty kod, dużą popularność w społeczności i znajduje się w fazie wzrostu. Jak korzystać z tego języka, można dowiedzieć się z książki My Memorable SQL – jej wersja pilotażowa jest dostępna .
Opanuj Pythona, choćby nie na najbardziej zaawansowanym poziomie. Książka My Memorable Python jest zaprojektowana właśnie dla nowicjuszy. Można ją kupić na , w wersji elektronicznej lub fizycznej, do wyboru, lub pobrać w formacie pdf lub epub .
Gdy poznasz Pythona, przejdź do pandas – biblioteki Pythona, która jest używana do czyszczenia i przetwarzania danych. Jeśli planujesz pracować w firmie, gdzie wymagane są umiejętności programowania w Pythonie (a takich jest większość), możesz być pewny, że znajomość pandas będzie uważana za standard. Aktualnie kończę wprowadzenie do pracy z pandas – możesz , aby nie przegapić daty wydania.
Opanuj AWS. Jeśli chcesz zostać inżynierem danych, nie możesz obejść się bez platformy chmurowej, a AWS to najpopularniejsza z nich. Bardzo pomogły mi kursy , kiedy uczyłem się , myślę, że również w przypadku AWS mają dobre materiały.
Jeśli już opanowałeś tę listę i chcesz jeszcze bardziej wyróżnić się w oczach pracodawców jako inżynier danych, proponuję dodać Apache Spark do pracy z danymi dużymi. Mimo że moje badania dotyczące ofert pracy w dziedzinie data science wykazały spadek zainteresowania, w przypadku inżynierów danych wciąż pojawia się on w niemal co drugiej ofercie.
Na koniec
Mam nadzieję, że ten przegląd najbardziej poszukiwanych technologii dla inżynierów danych okazał się dla Ciebie przydatny. Jeśli interesuje Cię, jak wygląda sytuacja w ofertach pracy dla analityków, przeczytaj . Życzę udanej inżynierii!
Źródło: habr.com
