Les compétences les plus demandées dans la profession d'ingénieur de données

Selon statistiques de 2019, le data engineer est actuellement une profession dont la demande augmente plus rapidement que pour toute autre. Le data engineer joue un rÎle crucial dans les organisations - il crée et maintient des pipelines et des bases de données qui sont utilisés pour le traitement, la transformation et le stockage des données. Quelles compétences sont principalement requises pour cette profession ? La liste diffÚre-t-elle de celle des data scientists ? Vous découvrirez tout cela dans mon article.

J'ai analysé les offres d'emploi pour le poste de data engineer tel qu'elles apparaissent en janvier 2020, afin de comprendre quelles compétences technologiques sont les plus recherché. J'ai ensuite comparé les résultats avec les statistiques des offres pour le poste de data scientist - ce qui a mis en évidence quelques différences intéressantes.

Passons sans plus tarder aux dix principales technologies mentionnées le plus souvent dans les annonces d'emploi :

Les compétences les plus demandées dans la profession d'ingénieur de données

Mention des technologies dans les offres d'emploi pour le poste de data engineer en 2020

Voyons cela de plus prĂšs.

Responsabilités du data engineer

Aujourd'hui, le travail effectué par les data engineers est d'une immense importance pour les organisations - ce sont ces personnes qui sont responsables du stockage des informations et les mettent dans un format qui permet à d'autres employés de travailler avec. Les data engineers construisent des pipelines pour établir un flux de données en temps réel ou par lots à partir de multiples sources. Ensuite, ces pipelines réalisent des opérations d'extraction, de transformation et de chargement (en d'autres termes, des processus ETL), rendant les données plus adaptées à une utilisation ultérieure. AprÚs cela, les données sont transmises aux analystes et aux data scientists pour un traitement plus approfondi. Enfin, les données terminent leur voyage sur des tableaux de bord, dans des rapports et des modÚles pour l'apprentissage automatique.

J'ai recherché des informations qui permettraient de conclure quelles technologies sont les plus en demande pour le travail de data engineer à l'heure actuelle.

Méthodes

J'ai rassemblĂ© des informations provenant de trois sites de recherche d'emploi - SimplyHired, Indeed et Monster et j'ai examinĂ© quels mots-clĂ©s apparaissent en relation avec « data engineer » dans les textes des offres d'emploi destinĂ©es aux rĂ©sidents des États-Unis. Pour cette tĂąche, j'ai utilisĂ© deux bibliothĂšques Python - Requests et Beautiful SoupJ'ai inclus dans les mots-clĂ©s Ă  la fois ceux de la prĂ©cĂ©dente liste pour l'analyse des offres d'emploi pour le poste de data scientist et ceux que j'ai sĂ©lectionnĂ©s manuellement en lisant les offres pour data engineers. LinkedIn n'a pas Ă©tĂ© inclus parmi les sources, car j'y ai Ă©tĂ© banni aprĂšs ma prĂ©cĂ©dente tentative de collecter des donnĂ©es.

Pour chaque mot-clé, j'ai calculé le pourcentage d'occurrences par rapport au nombre total de textes sur chaque site individuellement, puis j'ai calculé la moyenne sur les trois sources.

Résultats

Voici trente termes techniques du domaine de l'ingénierie des données avec les taux les plus élevés sur les trois sites d'offres d'emploi.

Les compétences les plus demandées dans la profession d'ingénieur de données

Voici les mĂȘmes chiffres prĂ©sentĂ©s sous forme de tableau :

Les compétences les plus demandées dans la profession d'ingénieur de données

Allons-y dans l'ordre.

Aperçu des résultats

À la fois SQL et Python sont mentionnĂ©s dans plus des deux tiers des offres examinĂ©es. Ces deux technologies sont celles qu'il est judicieux d'apprendre en premier. Python – un langage de programmation trĂšs populaire, utilisĂ© pour manipuler des donnĂ©es, crĂ©er des sites web et Ă©crire des scripts. SQL signifie Structured Query Language (langage de requĂȘte structurĂ©) ; il implique une norme mise en Ɠuvre par un groupe de langages, et est utilisĂ© pour extraire des donnĂ©es de bases de donnĂ©es relationnelles. Il existe depuis un certain temps et a prouvĂ© sa robustesse.

Spark est mentionnĂ© dans environ la moitiĂ© des offres. Apache Spark – un "moteur analytique unifiĂ© pour le traitement de grandes donnĂ©es avec des modules intĂ©grĂ©s pour le streaming, SQL, l'apprentissage machine et le traitement de graphiques". Il est particuliĂšrement populaire parmi ceux qui travaillent avec de grandes bases de donnĂ©es.

AWS apparaßt dans environ 45 % des textes d'offres d'emploi. C'est une plateforme de calcul en nuage d'Amazon ; elle détient la plus grande part de marché parmi toutes les plateformes de cloud.
Ensuite, il y a Java et Hadoop – un peu plus de 40 % chacun. Java – un langage trĂšs rĂ©pandu, Ă©prouvĂ© dans la bataille, qui dans l'enquĂȘte des dĂ©veloppeurs de Stack Overflow de 2019 s'est classĂ© dixiĂšme parmi les langages qui effraient les programmeurs. En revanche, Python s'est retrouvĂ© deuxiĂšme parmi les langages les plus apprĂ©ciĂ©s. Java est gĂ©rĂ© par Oracle, et tout ce que vous devez savoir Ă  son sujet peut ĂȘtre compris Ă  partir de cette capture d'Ă©cran de la page officielle datant de janvier 2020.

Les compétences les plus demandées dans la profession d'ingénieur de données

Comme si j'avais voyagé dans le temps
Apache Hadoop utilise un modÚle logiciel MapReduce avec des clusters de serveurs pour le big data. Cette approche est de plus en plus souvent abandonnée.

Ensuite, nous voyons Hive, Scala, Kafka et NoSQL – chacune de ces technologies est mentionnĂ©e dans un quart des offres d'emploi. Apache Hive est un programme de stockage de donnĂ©es qui « facilite la lecture, l'Ă©criture et la gestion de grands ensembles de donnĂ©es rĂ©partis dans des stockages distribuĂ©s Ă  l'aide de SQL ». Scala – un langage de programmation utilisĂ© activement pour le traitement du big data. En particulier, Spark a Ă©tĂ© dĂ©veloppĂ© en Scala. Dans le classement des langages souvent citĂ©s, Scala occupe la onziĂšme place. Apache Kafka – une plateforme distribuĂ©e pour le traitement des flux de messages. Elle est trĂšs populaire en tant que moyen de transmission de donnĂ©es.

Les bases de données NoSQL se distinguent des SQL. Elles sont non relationnelles, non structurées et offrent une évolutivité horizontale. NoSQL a gagné en popularité, mais l'engouement frénétique pour cette approche, jusqu'à des prophéties selon lesquelles elle remplacerait SQL en tant que paradigme dominant de stockage, semble maintenant derriÚre nous.

Comparaison des termes dans les offres d'emploi de data scientist

Voici trente termes technologiques les plus courants chez les employeurs dans le domaine de la science des donnĂ©es. Cette liste a Ă©tĂ© obtenue de la mĂȘme maniĂšre que dĂ©crite prĂ©cĂ©demment pour l'ingĂ©nierie des donnĂ©es.

Les compétences les plus demandées dans la profession d'ingénieur de données

Mentions des technologies dans les offres d'emploi pour le poste de data scientist en 2020

Si nous regardons le nombre total, par rapport à l'ensemble de données précédemment examiné, il y a eu 28 % d'offres d'emploi supplémentaires (12 013 contre 9 396). Voyons quelles technologies sont moins fréquemment rencontrées dans les offres d'emploi pour les data scientists par rapport à celles des data engineers.

Plus populaires dans l'ingénierie des données

Le graphique ci-dessous montre les mots-clés avec une différence moyenne des valeurs supérieure à 10 % ou inférieure à -10 %.

Les compétences les plus demandées dans la profession d'ingénieur de données

Les plus grandes différences de fréquence des mots-clés entre data engineer et data scientist

Le plus grand bond est observé pour AWS : en ingénierie des données, il apparaßt 25 % plus réguliÚrement qu'en science des données (environ 45 % et 20 % du nombre total d'offres d'emploi respectivement). La différence est significative !

Voici les mĂȘmes donnĂ©es sous une forme lĂ©gĂšrement diffĂ©rente – sur le graphique, les rĂ©sultats pour le mĂȘme mot-clĂ© dans les offres d'emploi pour le poste de data engineer et de data scientist sont cĂŽte Ă  cĂŽte.

Les compétences les plus demandées dans la profession d'ingénieur de données

Les plus grandes différences de fréquence des mots-clés entre data engineer et data scientist

La prochaine grande avancĂ©e que j'ai notĂ©e pour Spark – les data engineers doivent souvent travailler avec de grandes quantitĂ©s de donnĂ©es. Kafka a Ă©galement augmentĂ© de 20 %, soit presque quatre fois le rĂ©sultat des offres d'emploi de data scientist. Le transfert de donnĂ©es est l'une des responsabilitĂ©s clĂ©s d'un data engineer. Enfin, le nombre de mentions a Ă©tĂ© de 15 % supĂ©rieur dans le domaine de l'ingĂ©nierie des donnĂ©es pour Java, NoSQL, Redshift, SQL et Hadoop.

Moins populaires dans l'ingénierie des données

Voyons maintenant quelles technologies sont moins populaires dans les offres d'emploi pour data engineer.
La plus forte baisse par rapport au domaine de la science des donnĂ©es a eu lieu pour R: elle figurait dans environ 56 % des offres d'emploi, ici – seulement 17 %. Impressionnant. R est un langage de programmation prisĂ© par les chercheurs et les statisticiens, occupant la huitiĂšme place dans le classement des langages les plus redoutĂ©s.

SAS est aussi mentionnĂ© dans les offres d'emploi pour le poste de data engineer de maniĂšre significativement plus rare – la diffĂ©rence est de 14 %. SAS est un langage propriĂ©taire conçu pour travailler avec des statistiques et des donnĂ©es. Fait intĂ©ressant : selon les rĂ©sultats de ma recherche sur les offres d'emploi pour les data scientists, il a rĂ©cemment perdu beaucoup de terrain – plus que toute autre technologie.

Recherchés tant en ingénierie des données qu'en science des données

Il faut noter que huit des dix premiÚres positions dans les deux ensembles se chevauchent. SQL, Python, Spark, AWS, Java, Hadoop, Hive et Scala figurent dans le top dix aussi bien pour le secteur de l'ingénierie des données que pour celui de la science des données. Dans le graphique ci-dessous, vous pouvez voir les quinze technologies les plus populaires auprÚs des employeurs de data engineers, ainsi que leur score dans les offres d'emploi pour data scientists.

Les compétences les plus demandées dans la profession d'ingénieur de données

Recommandations

Si vous souhaitez vous engager dans l'ingĂ©nierie des donnĂ©es, je vous recommanderais d'apprendre les technologies suivantes – je les Ă©numĂšre par ordre de prioritĂ© approximative.

Apprenez SQL. Je vous recommande particuliĂšrement PostgreSQL, car il est open source, trĂšs populaire dans la communautĂ© et est en phase de croissance. Vous pouvez apprendre Ă  l'utiliser avec le livre My Memorable SQL – sa version pilote est disponible ici.

MaĂźtrisez Python, mĂȘme si ce n'est pas Ă  un niveau trĂšs avancĂ©. Le livre My Memorable Python est exactement conçu pour les dĂ©butants. Il peut ĂȘtre achetĂ© sur Amazon, version Ă©lectronique ou physique, selon votre choix, ou tĂ©lĂ©chargĂ© au format pdf ou epub sur ce site.

Une fois que vous ĂȘtes familiarisĂ© avec Python, passez Ă  pandas, la bibliothĂšque Python utilisĂ©e pour le nettoyage et le traitement des donnĂ©es. Si vous visez un emploi dans une entreprise oĂč la maĂźtrise de Python est requise (et c'est la majoritĂ©), sachez que la connaissance de pandas sera considĂ©rĂ©e comme acquise. Je suis actuellement en train de terminer un guide d'introduction pour travailler avec pandas – vous pouvez vous abonner, pour ne pas manquer le moment de sa publication.

Maßtrisez AWS. Si vous souhaitez devenir data engineer, vous ne pouvez pas vous passer d'une plateforme cloud, et AWS est la plus populaire. Les cours de Linux Academy, m'ont beaucoup aidé lorsque j'apprenais l'ingénierie des données sur Google Cloud, je pense qu'ils ont aussi de bons matériaux pour AWS.

Si vous avez dĂ©jĂ  maĂźtrisĂ© toute cette liste et que vous souhaitez encore progresser aux yeux des employeurs en tant que data engineer, je vous propose d'ajouter Apache Spark pour travailler avec de grandes donnĂ©es. Bien que ma recherche sur les offres d'emploi en data science ait montrĂ© une baisse d'intĂ©rĂȘt, on le voit nĂ©anmoins presque dans chaque deuxiĂšme offre pour les data engineers.

Enfin

J'espĂšre que cette revue des technologies les plus recherchĂ©es pour les data engineers vous a Ă©tĂ© utile. Si vous ĂȘtes intĂ©ressĂ© par la situation actuelle des offres pour les analystes, lisez un autre de mes articles. Bon ingĂ©nierie !

Source : habr.com

Acheter un hĂ©bergement fiable pour les sites avec protection DDoS, serveurs VPS VDS đŸ”„ Acheter un hĂ©bergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster