
HIROSHI WATANABE / GETTY IMAGES
Dans son livre « La richesse des nations », Adam Smith montre comment la division du travail devient la principale source d'augmentation de la productivité. Un exemple en est la chaîne de montage d'une usine de fabrication d'épingles : « Un ouvrier tire le fil, un autre le redresse, un troisième le coupe, un quatrième aiguise l'extrémité, un cinquième façonne l'autre extrémité pour y fixer la tête ». Grâce à une spécialisation orientée vers des fonctions spécifiques, chaque travailleur devient un spécialiste hautement qualifié dans sa tâche étroite, ce qui augmente l'efficacité du processus. La production par travailleur augmente de manière exponentielle, et l'usine devient plus efficace dans la fabrication d'épingles.
Cette division du travail par fonctionnalité est si profondément ancrée dans nos esprits aujourd'hui que nous organisons rapidement nos équipes en conséquence. La science des données ne fait pas exception. Des opportunités d'affaires algorithmiques complexes exigent de nombreuses fonctions de travail, c'est pourquoi les entreprises forment généralement des équipes de spécialistes : chercheurs, ingénieurs en analyse de données, ingénieurs en apprentissage automatique, scientifiques en causalité, etc. Le travail des spécialistes est coordonné par un chef de produit dans une répartition des tâches qui rappelle la fabrication d'épingles : « une personne reçoit les données, une autre les modélise, une troisième les exécute, une quatrième les mesure », etc.
Malheureusement, nous ne devrions pas optimiser nos équipes de science des données pour augmenter la productivité. Cependant, c'est exactement ce que vous faites lorsque vous comprenez ce que vous produisez : des épingles ou autre chose, et que vous visez simplement à accroître l'efficacité. L'objectif des chaînes de montage est d'accomplir une tâche. Nous savons exactement ce que nous voulons — ce sont des épingles (comme dans l'exemple de Smith), mais on pourrait mentionner n'importe quel produit ou service dont les exigences décrivent entièrement tous les aspects du produit et son comportement. Le rôle des employés est de satisfaire ces exigences aussi efficacement que possible.
Mais l'objectif du Data Science n'est pas de simplement exécuter des tâches. Au contraire, l'objectif est d'étudier et de développer de nouvelles opportunités commerciales solides. Des produits et services algorithmiques, tels que les systèmes de recommandations, les interactions avec les clients, la classification des préférences en matière de style, le choix des tailles, le design de vêtements, l'optimisation de la logistique, la détection des tendances saisonnières et bien d'autres, ne peuvent pas être conçus à l'avance. Ils doivent être explorés. Il n'y a pas de plans pour les reproduire, ce sont de nouvelles opportunités avec leur propre incertitude. Les coefficients, modèles, types de modèles, hyperparamètres, tous les éléments nécessaires doivent être étudiés par le biais d'expérimentations, d'essais et d'erreurs ainsi que de répétitions. Avec les épingles, l'apprentissage et le design sont réalisés à l'avance, avant leur production. Avec le Data Science, vous apprenez en cours de route, et non avant.
Dans l'usine d'épingles, lorsque l'apprentissage est la priorité, nous n'attendons pas et ne souhaitons pas que les ouvriers improvisent sur quoi que ce soit concernant le produit, sauf pour améliorer l'efficacité de la production. La spécialisation des tâches a du sens, car elle mène à l'efficacité des processus et à la cohérence de la production (sans modifications apportées au produit final).
Mais lorsque le produit est encore en développement et que l'objectif est l'apprentissage, la spécialisation entrave nos objectifs dans les cas suivants :
1. Cela augmente les coûts de coordination.
C'est-à-dire les coûts qui s'accumulent au fil du temps, consacrés à la communication, à la discussion, à la justification et à la détermination des priorités du travail à accomplir. Ces coûts se scalent de manière superlinéaire avec le nombre de personnes impliquées. (Comme nous l'a enseigné J. Richard Hackman, le nombre de relations r augmente selon une fonction du nombre de membres n, conformément à cette équation : r = (n ^ 2-n) / 2. Et chaque relation révèle un certain rapport de coûts). Lorsque les spécialistes en analyse de données sont organisés par fonctions, à chaque étape, avec chaque changement, chaque transfert de service, etc., un grand nombre de spécialistes sont nécessaires, ce qui augmente les coûts de coordination. Par exemple, les spécialistes en modélisation statistique qui souhaitent expérimenter de nouvelles fonctionnalités doivent coordonner leurs actions avec les ingénieurs en traitement de données, qui complètent les ensembles de données chaque fois qu'ils souhaitent essayer quelque chose de nouveau. De la même manière, chaque nouveau modèle entraîné signifie que le développeur du modèle aura besoin de quelqu'un avec qui coordonner ses actions pour le mettre en production. Les coûts de coordination agissent comme un coût d'itération, ce qui les rend plus difficiles et coûteux et augmente la probabilité d'abandonner la recherche. Cela peut entraver l'apprentissage.
2. Cela complique le temps d'attente.
Ce qui est encore plus alarmant que le coût de la coordination, c'est le temps perdu entre les équipes de travail. Alors que les coûts de coordination sont généralement mesurés en heures — le temps nécessaire pour organiser des réunions, des discussions, des revues de projets — le temps d'attente est souvent mesuré en jours, en semaines, voire en mois ! Il est difficile d'aligner les emplois du temps des spécialistes fonctionnels, car chacun doit être réparti sur plusieurs projets. Une réunion d'une heure pour discuter des changements peut nécessiter plusieurs semaines pour synchroniser le flux de travail. Et après avoir validé les modifications, il faut également planifier la réalisation effective du travail dans le contexte de nombreux autres projets, ce qui empiète sur le temps de travail des spécialistes. Le travail lié à la correction de code ou à des recherches, qui ne nécessite que quelques heures ou jours pour être finalisé, peut prendre beaucoup plus de temps avant que les ressources ne soient disponibles. D'ici là, l'itération et l'apprentissage sont suspendus.
3. Cela restreint le contexte.
La division du travail peut limiter artificiellement l'apprentissage, récompensant les individus pour rester dans leur spécialisation. Par exemple, un chercheur qui doit rester dans son domaine de compétence va concentrer son énergie sur des expériences avec différents types d'algorithmes : régression, réseaux de neurones, forêts aléatoires, etc. Sans aucun doute, un bon choix d'algorithme peut mener à des améliorations progressives, mais en général, on peut tirer bien plus de bénéfices d'autres types d'activités, comme l'intégration de nouvelles sources de données. De la même manière, cela contribuera à développer un modèle qui utilise chaque bit d'explicabilité inhérent aux données. Néanmoins, sa force peut résider dans la modification de la fonction objective ou l'assouplissement de certaines contraintes. C'est difficile à discerner ou à réaliser lorsque son travail est restreint. Comme le chercheur se spécialise dans l'optimisation des algorithmes, il a beaucoup moins de chances de s'engager dans d'autres domaines, même si cela peut apporter des bénéfices substantiels.
Identifions les signes qui se manifestent lorsque les équipes de data science fonctionnent comme des usines à épingles (par exemple, lors de simples mises à jour de statut) : « attente des changements dans le pipeline de données » et « attente des ressources en ML Eng », qui sont des blocages courants. Cependant, je crois que l'effet le plus dangereux est ce que vous ne remarquez pas, car vous ne pouvez pas regretter ce que vous ne connaissez pas encore. L'exécution impeccable des exigences et l'autosatisfaction, atteintes grâce à l'efficacité des processus, peuvent masquer la vérité selon laquelle les organisations ne sont pas conscientes des avantages de l'apprentissage qu'elles perdent.
La solution à ce problème réside bien sûr dans l'élimination de la méthode de l'usine à épingles. Pour favoriser l'apprentissage et l'itération, les rôles en data science doivent être interconnectés, mais avec des responsabilités larges, indépendantes de la fonction technique, c'est-à-dire organiser les spécialistes des données de manière à ce qu'ils soient optimisés pour l'apprentissage. Cela signifie qu'il est nécessaire d'embaucher des « spécialistes full stack » — des professionnels polyvalents capables d'assumer diverses fonctions : de la conception à la modélisation, de la mise en œuvre à la mesure. Il est important de noter que je ne suppose pas que lors de l'embauche de spécialistes full stack, le nombre d'employés doive diminuer. Je vais plutôt suggérer que lorsqu'ils sont organisés différemment, leurs récompenses sont mieux alignées sur les avantages de l'apprentissage et de l'efficacité. Par exemple, vous avez une équipe de trois personnes possédant trois compétences commerciales. Dans une usine à épingles, chaque spécialiste consacrera un tiers de son temps à chaque tâche professionnelle, car personne d'autre ne pourra faire son travail. Dans un cadre full stack, chaque employé polyvalent est entièrement engagé dans l'ensemble du processus commercial, l'augmentation des volumes de travail et l'apprentissage.
Avec moins de personnes soutenant le cycle de production, la coordination diminue. L'universel se déplace en douceur entre les fonctions, étendant le pipeline de données pour ajouter plus de volume de données, en essayant de nouvelles fonctionnalités dans les modèles, en déployant de nouvelles versions en production pour des mesures causales, et en répétant les étapes aussi rapidement que de nouvelles idées émergent. Bien sûr, l'universel effectue différentes fonctions de manière séquentielle, et non parallèlement. Après tout, ce n'est qu'une seule personne. Cependant, l'exécution d'une tâche ne prend généralement qu'une petite partie du temps nécessaire pour accéder à une autre ressource spécialisée. Ainsi, le temps d'itération est réduit.
Notre universel n'est peut-être pas aussi habile qu'un spécialiste dans une fonction de travail spécifique, mais nous ne visons pas la perfection fonctionnelle ou de petites améliorations progressives. Au contraire, nous nous efforçons d'explorer et de découvrir de nouvelles tâches professionnelles avec un impact progressif. Avec un contexte holistique pour une solution complète, il voit des opportunités que spécialistes étroits manqueront. Il a plus d'idées et plus de possibilités. Il échoue aussi. Pourtant, le coût de l'échec est faible, alors que les avantages de l'apprentissage sont élevés. Cette asymétrie favorise une itération rapide et récompense l'apprentissage.
Il est important de noter que l'échelle d'autonomie et la diversité des compétences fournies par le scientifique travaillant avec des stacks complets dépendent en grande partie de la fiabilité de la plateforme de données sur laquelle il peut travailler. Une plateforme de données bien conçue abstrait les scientifiques des données des complexités de la conteneurisation, du traitement distribué, de la transition automatique vers d'autres ressources et d'autres concepts informatiques avancés. En plus de l'abstraction, une plateforme de données fiable peut garantir une connexion fluide à l'infrastructure expérimentale, automatiser la surveillance et les systèmes d'alerte, assurer un dimensionnement automatique et visualiser les résultats algorithmiques ainsi que le débogage. Ces composants sont conçus et développés par les ingénieurs de la plateforme de données, c'est-à-dire qu'ils ne sont pas transmis à l'équipe de développement de la plateforme de données par le spécialiste des Data Science. C'est le spécialiste des Data Science qui est responsable de tout le code utilisé pour exécuter la plateforme.
Je me suis également intéressé à la division fonctionnelle du travail en utilisant l'efficacité des processus, mais par le biais de l'apprentissage par essais et erreurs (il n'y a pas de meilleur moyen d'apprendre), j'ai découvert que les rôles typiques favorisent mieux l'apprentissage et l'innovation et fournissent des indicateurs précis : la découverte et la construction d'un nombre beaucoup plus élevé d'opportunités commerciales qu'une approche spécialisée. (Un moyen plus efficace de comprendre cette approche organisationnelle que le processus d'essais et d'erreurs que j'ai suivi est de lire le livre d'Amy Edmondson « L'interaction en équipe : comment les organisations apprennent, innovent et rivalisent dans l'économie de la connaissance »).
Il existe certaines hypothèses importantes qui peuvent rendre cette approche organisationnelle plus ou moins fiable dans certaines entreprises. Le processus itératif réduit le coût des essais et erreurs. Si le coût d'une erreur est élevé, vous voudrez peut-être le diminuer (mais cela n'est pas recommandé pour les applications médicales ou la production). De plus, si vous traitez des pétaoctets ou des exaoctets de données, une spécialisation dans la conception des données peut être nécessaire. De même, si le maintien des opportunités commerciales en ligne et leur disponibilité sont plus importants que leur perfectionnement, l'excellence fonctionnelle peut surpasser l'apprentissage. Enfin, le modèle de la pile complète repose sur des personnes compétentes. Elles ne sont pas des licornes ; on peut les trouver ou les former soi-même. Cependant, elles sont très demandées, et pour les attirer et les retenir dans l'entreprise, une compensation matérielle compétitive, des valeurs d'entreprise solides et un travail intéressant seront nécessaires. Assurez-vous que votre culture d'entreprise peut offrir de telles conditions.
Même avec tout cela, je crois que le modèle de la pile complète offre les meilleures conditions pour un démarrage. Commencez par eux, puis avancez consciemment vers une division fonctionnelle du travail seulement quand cela est vraiment nécessaire.
Il existe aussi d'autres inconvénients à la spécialisation fonctionnelle. Cela peut entraîner une perte de responsabilité et une passivité de la part des employés. Smith lui-même critique la division du travail, suggérant qu'elle conduit à une atrophie des talents, c'est-à-dire que les travailleurs deviennent ignorants et introvertis, car leurs rôles se limitent à quelques tâches répétitives. Bien que la spécialisation puisse offrir une efficacité de processus, elle inspire moins souvent les employés.
Les rôles polyvalents garantissent tout ce qui stimule la satisfaction au travail : l'autonomie, l'expertise et la détermination. L'autonomie signifie qu'ils ne dépendent de rien pour réussir. L'expertise repose sur des avantages concurrentiels solides. Quant à la détermination, elle se traduit par la capacité d'influencer l'entreprise qu'ils créent. Si nous parvenons à inciter les gens à s'engager dans leur travail et à avoir un impact significatif sur l'entreprise, tout le reste suivra.
Source : habr.com
