Avant de s'inscrire à notre nouveau cours de Machine Learning Avancé, nous testons les futurs étudiants pour évaluer leur niveau de préparation et déterminer ce qu'il leur faut pour se préparer au cours. Mais il y a un dilemme : d'un côté, nous devons vérifier les connaissances en Data Science, de l'autre, nous ne pouvons pas organiser un examen complet de 4 heures.
Pour résoudre ce problème, nous avons mis en place un bureau de TestDev directement au sein de l'équipe de développement des cours de Data Science (et cela semble n'être que le début). Voici une liste des 10 « pièges » à éviter lors de la conception de tests pour évaluer les connaissances. Nous espérons que le monde de l'apprentissage en ligne s'améliorera grâce à cela.
Piège 1 : Ne pas définir clairement les objectifs du test
Pour définir correctement les objectifs et élaborer un test qui les prendra en compte, nous devons répondre à plusieurs questions lors de la phase de planification :
- Que vérifions-nous exactement ?
- Dans quel environnement se déroulera le test et quelles mécaniques seront utilisées ? Quelles sont les limitations de cet environnement ? Ce point permettra également de comprendre les exigences techniques pour le dispositif sur lequel le test sera effectué, ainsi que pour le contenu (si le test est passé sur des téléphones, les images doivent être lisibles même sur un petit écran et il doit être possible de les agrandir, etc.).
- Combien de temps durera le test ? Il faut réfléchir aux conditions dans lesquelles l'utilisateur passera le test. Y a-t-il un risque qu'il doive interrompre le processus de test, puis le reprendre à nouveau ?
- Y aura-t-il un retour d'information ? Comment le formons-nous et le délivrons-nous ? Que faut-il pour l'obtenir ? Y a-t-il un délai entre l'évaluation du test et le retour d'information ?
Dans notre cas, en répondant à ces questions, nous avons défini les objectifs suivants pour le test :
- Le test doit indiquer si les futurs étudiants sont prêts à suivre le cours, s'ils ont suffisamment de connaissances et de compétences.
- Le test doit nous fournir des éléments pour un retour d'information, signaler le sujet où les étudiants ont commis une erreur, afin qu'ils puissent améliorer leurs connaissances. Nous expliquons comment le composer ci-après.
Piège 2 : Ne pas établir un cahier des charges pour l'expert qui conçoit le test.
Pour élaborer des tâches de test, il est très important d'impliquer un expert dans le domaine dont les connaissances sont évaluées. Un expert a également besoin d'un cahier des charges (description) correctement formulé, incluant les sujets du test, les connaissances/compétences à vérifier et leur niveau.
Un expert ne va pas rédiger ce cahier des charges lui-même, car son travail consiste à créer des tâches, et non à structurer le test. D'autant plus que peu de gens développent des tests de manière professionnelle, même dans le cadre de l'enseignement. Cela s'apprend dans une spécialité distincte : la psychométrie.
Si vous souhaitez vous familiariser rapidement avec la psychométrie, il existe en Russie pour tous ceux qui s'y intéressent. Pour une étude plus approfondie, l'Institut de l'éducation propose un et un doctorat.
En préparant le cahier des charges, nous rassemblons une description détaillée du test pour l'expert (de préférence, avec lui) : les thèmes des tâches, le type de tâches, leur nombre.
Comment choisir le type de tâches : une fois les thèmes définis, nous déterminons quelles tâches permettent de vérifier cela de la meilleure manière ? Les options classiques : tâche à réponse ouverte, tâche à choix multiple ou unique, correspondances, etc. (n'oublions pas les contraintes techniques de l'environnement dans lequel se déroule le test !). Après avoir défini et décrit le type de tâches, nous avons un cahier des charges prêt pour l'expert. On peut l'appeler la spécification du test.
Erreur 3 : Ne pas impliquer l'expert dans l'élaboration du test.
Lors de l'implication de l'expert dans l'élaboration du test, il est très important de ne pas simplement lui indiquer « l'étendue du travail », mais de l'impliquer dans le processus même de développement.
Comment rendre le travail avec l'expert aussi efficace que possible :
- Le préparer à l'avance et consacrer du temps à expliquer la science du développement des tests, la psychométrie.
- Concentrer l'attention de l'expert sur la création d'un outil d'évaluation valide et fiable, et non sur une liste de questions.
- Expliquer que son travail inclut une phase préparatoire, pas seulement le développement des tâches elles-mêmes.
Certains experts (en raison de leur caractère) peuvent percevoir cela comme une évaluation de leur propre travail, et nous leur expliquons que même en créant d'excellentes tâches, celles-ci peuvent simplement ne pas répondre aux objectifs spécifiques du test.
Pour que le processus se déroule rapidement, nous préparons avec un expert une grille de couverture des thèmes (connaissances et compétences), qui fait partie des spécifications du test. C'est cette grille qui permet de travailler précisément les questions et de définir ce que nous allons mesurer. Dans chaque cas particulier, elle peut être élaborée de manière légèrement différente. Notre objectif est de vérifier dans quelle mesure une personne maîtrise les connaissances et compétences des cours précédents afin de déterminer dans quelle mesure elle est prête pour suivre un nouveau cours.
Erreur 4 : Penser que l'expert « sait mieux »
Connaît mieux le sujet. Mais il n'explique pas toujours clairement. Il est très important de vérifier la formulation des consignes. Rédiger des instructions claires, par exemple, « Choisissez 1 réponse correcte ». Dans 90 % des cas, les experts préparent les questions comme ils les comprennent eux-mêmes. Et c'est normal. Mais avant de transmettre le test à ceux qui vont le passer, il faut tout vérifier et affiner, pour que les personnes qui passent le test comprennent exactement ce qui est demandé, et ne fassent pas d'erreurs uniquement parce qu'elles ont pu mal interpréter le texte de la consigne.
Pour éviter toute ambiguïté dans les consignes, nous menons des « laboratoires cognitifs ». Nous demandons à des personnes de notre public cible de passer le test en exprimant à voix haute ce qu'elles pensent, et nous enregistrons tout cela en détail. Lors des « laboratoires cognitifs », il est possible de « déceler » des questions incompréhensibles, de mauvaises formulations, et d'obtenir un premier retour sur le test.
Erreur 5 : Ne pas tenir compte du temps pour réaliser le test
mode sarcasme : activé
Bien sûr, notre test est le meilleur, tout le monde rêve de le passer ! Oui, tout en 4 heures.
mode sarcasme : désactivé
Quand il y a une liste de tout ce qui peut être vérifié, l'essentiel est de ne pas tout faire (on dirait à première vue que c'est étrange, n'est-ce pas ?). Il faut réduire sans pitié en identifiant avec l'expert les connaissances et compétences clés (oui, un certain nombre de compétences peut aussi être testées). Nous examinons le type de tâches et estimons le temps cible d'exécution : si cela dépasse encore des limites raisonnables, nous réduisons !
Pour réduire le volume, il est également possible d'essayer (avec précaution) de vérifier deux compétences avec une seule tâche. Dans ce cas, il est difficile de comprendre pourquoi une personne a fait une erreur, mais en cas de réponse correcte, les deux compétences peuvent être prises en compte. Il est important de s'assurer que ces deux compétences appartiennent au même domaine de connaissance.
Erreur 6 : Ne pas réfléchir à un système d'attribution des points
Lors de l'élaboration de tests d'évaluation, il est courant d'utiliser un système de notation classique en points, par exemple, 1 point pour les tâches faciles et 2 points pour les tâches difficiles. Cependant, ce système n'est pas universel. La simple somme des points à la fin du test ne nous apprend pas grand-chose : nous ne savons pas quelles tâches ont été notées et ne pouvons que déterminer le nombre de réponses correctes. Nous avons besoin d'une compréhension précise des compétences démontrées par les participants au test. De plus, nous souhaitons leur fournir un retour sur les sujets qu'ils doivent retravailler.
En effet, nous élaborons un test qui partagera les personnes prêtes et non prêtes à suivre le programme, certains d'entre eux seront conseillés de se préparer au cours de formation gratuite. Il est important pour nous que seul ceux qui en ont vraiment besoin et qui sont prêts y soient inclus.
Ce que nous faisons dans notre situation : nous déterminons, au sein du groupe de travail des développeurs de tests, quels groupes de personnes doivent être distingués (par exemple, prêts pour la formation, partiellement prêts) et nous formons un tableau des caractéristiques de ces groupes, en indiquant les compétences et les connaissances qui seront pertinentes pour le groupe des prêts à la formation. Cela permet de définir la « difficulté » des tâches pour de tels tests.
Piège 7 : Évaluer les résultats uniquement automatiquement
Bien sûr, l'évaluation doit être la plus objective possible, c'est pourquoi une partie des travaux des étudiants est évaluée automatiquement, « selon les grilles » - en les comparant avec les réponses correctes. Même s'il n'y a pas de système de test spécial, il existe de nombreuses solutions gratuites. Et s'il y a une compréhension des principes de rédaction de scripts, alors avec Google Forms et les résultats dans les tableaux, on peut faire presque n'importe quoi. Si certaines tâches sont vérifiées par des experts, il est essentiel de réfléchir à la transmission des réponses aux experts, sans information sur les candidats. Et de penser à comment intégrer les résultats de l'évaluation des experts dans l'évaluation finale.
Nous avions initialement prévu de créer plusieurs tâches ouvertes avec du code, où les experts évaluent les solutions selon des critères prédéfinis, et avons même préparé un système qui exporte les réponses individuelles des participants au test dans un tableau spécial pour les experts, puis importe les résultats dans un tableau pour le calcul des notes. Cependant, après discussion avec des représentants de la cible, le chef de produit et le designer pédagogique, nous avons estimé qu'un entretien technique avec un retour immédiat de l'expert et une discussion sur le code, ainsi que sur des questions spécifiques, serait beaucoup plus efficace et bénéfique pour les participants eux-mêmes.
Maintenant, l'expert vérifie le passage du test en précisant certaines questions. Pour cela, nous avons préparé un guide de questions et des critères d'évaluation pour l'entretien technique. Avant l'entretien technique, l'expert reçoit une carte des réponses du participant au test afin de sélectionner les questions à poser.
Erreur 8 : Ne pas expliquer les résultats du test
La fourniture de rétroaction aux participants est une question à part. Nous devons non seulement informer du score du test, mais aussi expliquer les résultats du test.
Cela peut inclure :
- Les tâches pour lesquelles le participant a fait des erreurs, mais qu'il a effectuées correctement.
- Les sujets dans lesquels le participant a commis des erreurs.
- Son classement parmi ceux qui passent l'examen.
- Description du niveau du participant, selon par exemple la description du niveau des spécialistes (sur la base des descriptions d'offres d'emploi).
Lors du lancement pilote de notre test, pour ceux qui souhaitaient s'inscrire au programme, nous affichions les résultats avec une liste des sujets à améliorer. Mais ce n'est évidemment pas l'idéal, nous continuerons à nous améliorer et à rendre les retours meilleurs.
Erreur 9 : Ne pas discuter du test avec les développeurs
Peut-être les erreurs les plus délicates sur lesquelles il est particulièrement désagréable de trébucher — envoyer aux développeurs le test, la description et l'échelle de notation en l'état.
Qu'est-ce qui nécessite d'être discuté :
- L'apparence des questions, la structure, la position des graphiques, comment se présente le choix de la bonne réponse.
- Comment est calculé le score (si nécessaire), si des conditions supplémentaires existent.
- Comment se forme la rétroaction, où trouver les textes, s'il existe des blocs se formant automatiquement.
- Quelles informations supplémentaires devez-vous collecter et à quel moment (les mêmes contacts).
Pour éviter tout malentendu, nous demandons à nos développeurs de coder 2 ou 3 questions différentes pour que nous puissions voir à quoi elles ressemblent avant de programmer le test lui-même.
Erreurs 10 : Ne pas tester et mettre directement en production
Trois fois, les gars, le test doit être vérifié trois fois par des personnes différentes, et mieux encore, chacun trois fois. Cette vérité a été acquise par la sueur, le sang et les lignes de code.
Notre test vérifie un tel trio :
- Le Product Owner — vérifie la fonctionnalité, l'apparence et la mécanique du test.
- Le développeur du test — vérifie le texte des questions, leur ordre, la forme de l'interaction avec le test, les types de questions, les bonnes réponses, la lisibilité et l'affichage correct des graphiques.
- L'auteur des questions (expert) — vérifie le test pour sa validité d'un point de vue d'expert.
Exemple pratique : seulement lors du troisième passage, l'auteur des questions a remarqué qu'une question restait dans l'ancienne formulation. Tous les précédents avaient également été modifiés activement. Mais lorsque le test a été codé, il avait une apparence différente de celle qu'ils avaient initialement imaginée. Il y a de fortes chances que quelque chose doive être corrigé. Il faut en tenir compte.
Conclusion
En évitant soigneusement toutes ces « erreurs », nous avons créé un , pour tester les connaissances des candidats. Quiconque le souhaite peut le tester pendant que nous préparons le prochain matériel, dans lequel nous expliquerons ce qui s'est passé derrière le bot, et comment tout cela s'est transformé par la suite.
Obtenez une profession recherchée à partir de zéro ou faites évoluer vos compétences et votre salaire en suivant des cours en ligne SkillFactory :
- (12 semaines)
- (20 semaines)
- (20 semaines)
- (12 mois)
Autres cours
- (12 mois)
- (14 semaines)
- (5 semaines)
- (18 mois)
- (6 mois)
- (12 mois)
- (8 mois)
- (9 mois)
- (12 mois)
- (18 mois)
- (18 mois)
- (12 mois)
- (9 mois)
- (7 mois)
Source : habr.com
