Glossaire de l'évaluation

Le vocabulaire de l'évaluation, défini terme par terme : formats de questions, barèmes, psychométrie, surveillance des épreuves, standards d'interopérabilité, accessibilité et cadre réglementaire français. Chaque définition est autoportante — elle se lit et se cite seule.

89 termes définis. Les termes réglementaires et normatifs renvoient à l'organisme qui en possède la définition ; aucun n'est défini de mémoire.

Formats de questions et de réponses

Ce que l'on demande au candidat de produire — et ce que chaque format permet réellement de mesurer.

QCM (question à choix multiple)

Question fermée qui propose plusieurs choix, dont un ou plusieurs sont corrects. Le candidat coche ses choix ; leur ensemble constitue sa réponse à la question. Une épreuve composée de ces questions s'appelle un questionnaire à choix multiples, et le sigle QCM désigne dans l'usage aussi bien la question que le questionnaire. On distingue le QCM à réponse unique, où un seul choix est juste, du QCM à réponses multiples, où le candidat doit cocher toutes les bonnes propositions et aucune fausse. Exemple : « Parmi ces quatre affirmations sur la mitose, lesquelles sont exactes ? », avec deux propositions correctes sur quatre. Le format permet une correction automatique et instantanée, couvre beaucoup de contenu en peu de temps et produit des statistiques par question. Sa qualité dépend presque entièrement des distracteurs : des choix faux plausibles pour qui n'a pas compris, écartés sans hésitation par qui a compris. Un QCM mesure mal la capacité à produire, structurer ou justifier un raisonnement, et il laisse une part au hasard que le barème doit traiter : points partiels, pénalité pour réponse fausse ou barème par discordance, selon les modalités de contrôle des connaissances de l'établissement.

Créer un QCM avec EvalmeeBarème par discordance

QCU (question à choix unique)

Variante du QCM où un seul choix est correct parmi ceux proposés. Le candidat ne peut en cocher qu'un, ce qui simplifie le barème et supprime les règles de crédit partiel, mais augmente la part du hasard : quatre choix donnent vingt-cinq pour cent de réussite au hasard.

Question à réponse ouverte courte (QROC)

Question qui appelle une réponse rédigée de quelques mots à quelques lignes, sans propositions offertes. Elle supprime le hasard et oblige à restituer plutôt qu'à reconnaître, tout en restant assez brève pour être corrigée rapidement, à la main ou avec une assistance automatique.

Question à réponse ouverte longue (QROL)

Question ouverte, aussi appelée question rédactionnelle, qui demande un développement construit : dissertation, étude de cas ou démonstration. Elle mesure l'argumentation, la structuration et la mobilisation croisée de connaissances, au prix d'une correction longue et d'une variabilité entre correcteurs qu'une grille critériée aide à réduire.

Corriger les copies rédigées

Question vrai/faux

Question fermée à deux choix possibles. Rapide à rédiger et à corriger, elle laisse cinquante pour cent de réussite au hasard : elle n'est fiable qu'en série, sur de nombreuses questions, et se prête mal à l'évaluation d'un raisonnement nuancé ou d'une connaissance partielle.

Question d'appariement

Question qui demande de relier les éléments de deux listes : un terme et sa définition, une date et un événement, une molécule et sa fonction. Elle teste efficacement la maîtrise d'un vocabulaire ou d'une nomenclature, et se corrige automatiquement, paire par paire.

Texte à trous

Énoncé dont certains mots ont été retirés et que le candidat doit restituer, librement ou à partir d'une liste fournie. Le format se situe entre le choix multiple et la réponse ouverte : il exige un rappel actif tout en restant automatiquement corrigeable.

Item

Terme de psychométrie pour désigner une question, un problème ou une tâche d'un test. Chez Evalmee, on parle simplement de question. Un item n'est pas un choix de réponse : dans un QCM, chaque option cochable est un choix. La difficulté et la discrimination se calculent au niveau de la question.

Distracteur

Choix faux d'une question à choix multiple. Un bon distracteur est plausible pour qui n'a pas compris et clairement écarté par qui a compris : un distracteur que personne ne coche n'apporte aucune information et réduit la question à un choix plus étroit.

Banque de questions

Réservoir de questions indexées et réutilisables, classées par thème, niveau ou compétence. Elle permet de composer une épreuve par tirage, de faire varier les sujets d'une session à l'autre et d'accumuler, item par item, l'historique statistique qui rend une question fiable.

Barème, notation et correction

Comment des réponses deviennent une note — et ce qui garantit que deux correcteurs arrivent au même résultat.

Barème

Règle qui convertit les réponses d'un candidat en une note. Il fixe le nombre de points par question, les éventuelles pénalités et la façon dont les points partiels sont attribués. Publié avant l'épreuve, il constitue l'engagement de l'examinateur sur ce qui sera valorisé.

Barème par discordance

Barème critérié

Barème qui distribue les points sur des critères explicites — exactitude, méthode, rédaction, justification — plutôt que sur une appréciation globale de la copie. Chaque critère est noté séparément, ce qui rend la note décomposable, explicable au candidat et comparable d'un correcteur à l'autre.

Barème par discordance

Mode de notation des QCM, répandu en PASS, LAS et ex-PACES, où la note dépend du nombre de discordances avec la réponse attendue : un choix coché à tort, ou un choix correct laissé vide. Zéro discordance vaut le maximum, chaque discordance supplémentaire fait tomber la note d'un palier, et les paliers relèvent des modalités de contrôle des connaissances de l'établissement.

Le barème par discordance chez Evalmee

Grille critériée

Tableau qui croise les critères d'évaluation et des niveaux de performance décrits en toutes lettres, du plus faible au plus élevé. Le correcteur situe la copie dans une case plutôt que d'attribuer un chiffre : la note devient la conséquence d'une description partagée à l'avance.

La grille verrouillée avant la correction par IA chez Evalmee

Grille d'évaluation

Document qui fixe, avant la correction, sur quoi une production sera jugée et combien vaut chaque élément. Sous sa forme la plus simple, c'est une liste de critères assortie de points : structure du raisonnement, exactitude des calculs, qualité de la rédaction, respect de la consigne. Quand chaque critère est en plus décrit par niveaux de performance, en toutes lettres, du plus faible au plus élevé, la grille devient une grille critériée, définie à part dans ce glossaire ; le terme anglais rubric couvre les deux. Une grille d'évaluation sert trois usages : elle guide le correcteur et réduit l'écart entre correcteurs, elle explique la note au candidat critère par critère, et, communiquée avant l'épreuve, elle dit aux participants ce qui est attendu. Exemple : pour une étude de cas en gestion, quatre critères sur vingt points, analyse du problème 6, pertinence des solutions 6, argumentation 5, forme 3 ; chaque copie reçoit quatre sous-notes et un commentaire par critère. Une grille trop fine, à quinze critères, se remplit mécaniquement et perd en fiabilité ; quatre à six critères indépendants suffisent en général. Sur une plateforme d'évaluation, la grille se saisit une fois et s'applique à chaque copie, ce qui permet à une correction assistée par IA de proposer une note par critère que le correcteur valide ou corrige.

La grille de correction chez EvalmeeGrille critériée

Correction automatique

Attribution des points par la plateforme, sans intervention humaine, pour les questions dont la réponse attendue est décidable : choix multiple, appariement, texte à trous, valeur numérique avec tolérance. Elle rend le résultat immédiat et supprime la variabilité entre correcteurs sur ces items.

Correction assistée par IA

Pré-correction des réponses rédigées par un modèle de langue, qui propose une note et une justification que le correcteur valide, modifie ou rejette. La décision reste humaine : ce que l'IA fait gagner, c'est le premier passage sur la copie, jamais la responsabilité de la note.

La correction assistée chez Evalmee

Anonymisation des copies

Retrait de l'identité du candidat au moment de la correction, la copie ne portant plus qu'un numéro. Le dispositif vise les biais liés au nom, au genre, à l'origine supposée ou à la réputation de l'étudiant, dont l'effet sur la note est documenté par la recherche.

La correction anonyme des copies chez Evalmee

Double correction

Correction d'une même copie par deux examinateurs indépendants, dont les notes sont ensuite confrontées. L'écart entre les deux mesure la part de subjectivité de l'épreuve ; au-delà d'un seuil convenu à l'avance, une troisième lecture ou une discussion entre correcteurs tranche.

Harmonisation

Réunion des correcteurs, avant ou après la correction, pour aligner leur lecture du barème sur des copies témoins. Elle réduit l'écart systématique entre correcteurs — le fait qu'un même travail vaille deux points de plus dans une pile de copies que dans une autre.

Note plancher

Note minimale garantie, en deçà de laquelle une copie n'est pas descendue quelle que soit sa qualité. Elle limite l'effet destructeur d'un zéro sur une moyenne annuelle et neutralise les pénalités cumulées, au prix d'une compression de l'échelle de notation vers le haut.

Pénalité pour réponse fausse

Retrait de points sur les mauvaises réponses d'une question fermée, destiné à décourager la réponse au hasard. Le procédé pénalise aussi la prise de risque raisonnée et désavantage, selon les travaux disponibles, davantage les candidats prudents que les candidats mal préparés.

Barème par discordance

Compensation

Mécanisme par lequel une note supérieure à la moyenne dans une matière compense une note inférieure dans une autre, à l'intérieur d'une unité d'enseignement ou d'un semestre. Son périmètre, son seuil et les matières qui en sont exclues relèvent des modalités de contrôle des connaissances.

Session de rattrapage

Seconde session d'examen ouverte aux candidats n'ayant pas satisfait aux conditions de validation à l'issue de la première. Son calendrier et la règle de conservation ou de remplacement de la note initiale sont fixés par les modalités de contrôle des connaissances de l'établissement.

Psychométrie et analyse d'items

Les indicateurs qui disent si une épreuve mesure vraiment quelque chose, et lesquelles de ses questions sont défectueuses.

Docimologie

Science de l'évaluation et des examens, du grec dokimê, épreuve. Le mot est proposé en 1922 par le psychologue Henri Piéron, qui étudie avec Henri Laugier la notation d'une même copie par plusieurs correcteurs. Leurs enquêtes des années 1930 sur le baccalauréat montrent des écarts de plusieurs points entre correcteurs sur une même copie, jusqu'à une dizaine de points sur vingt en philosophie, et des variations chez un même correcteur selon le moment et la place de la copie dans la pile. La docimologie décrit ces sources de variabilité : l'effet de halo, où la qualité de l'écriture ou la réputation du candidat colore la note ; l'effet de contraste, où une copie moyenne paraît faible après une excellente ; l'effet d'ordre et la fatigue du correcteur ; la sévérité propre à chacun. Elle propose aussi les parades : barème critérié, grille d'évaluation, double correction, anonymisation des copies, harmonisation entre correcteurs. Exemple : une même dissertation confiée à cinq correcteurs sans consigne commune reçoit des notes très dispersées ; avec une grille de quatre critères décrits en toutes lettres, l'écart se resserre à quelques points. La psychométrie, née de la mesure des aptitudes, étudie plutôt la qualité des tests eux-mêmes ; la docimologie garde pour objet le jugement de l'évaluateur.

Double correction

Analyse d'items

Examen statistique des questions d'un test après passation : combien de candidats ont réussi chaque item, lesquels, et comment cela se compare à leur score global. Elle révèle les questions ambiguës, les questions inutiles et les erreurs de corrigé avant qu'elles ne se répètent.

Les statistiques par question

Indice de difficulté

Proportion de candidats ayant répondu correctement à un item, comprise entre zéro et un. Un indice de 0,90 signale une question que presque tous réussissent, donc peu informative ; les valeurs proches de 0,5 maximisent la capacité de la question à séparer les niveaux.

Indice de discrimination

Mesure de la capacité d'une question à distinguer les candidats forts des candidats faibles, calculée comme l'écart de réussite entre les meilleurs et les moins bons résultats globaux. Un indice nul ou négatif signale un item défectueux, mal formulé, ou dont le corrigé est faux.

Corrélation item-total

Corrélation entre la réussite à une question et le score obtenu au reste du test, souvent exprimée par un coefficient point-bisérial. Elle indique si l'item mesure la même chose que l'épreuve dans son ensemble ; une valeur faible signale un item hors sujet.

Fidélité

Constance d'une mesure : dans quelle mesure un même candidat obtiendrait un score comparable en repassant le test, avec d'autres questions du même type ou devant un autre correcteur. Une épreuve peu fidèle produit des notes dont une partie n'est que du bruit.

Alpha de Cronbach

Coefficient qui résume la cohérence interne d'un test, c'est-à-dire à quel point ses items mesurent une même dimension. Il varie généralement entre zéro et un et augmente mécaniquement avec le nombre de questions : un alpha élevé n'atteste donc pas à lui seul de la validité.

Validité

Degré auquel un test mesure réellement ce qu'il prétend mesurer et autorise les décisions que l'on en tire. Une épreuve peut être parfaitement fidèle et sans validité : elle mesure alors quelque chose de très stable, mais pas la compétence qu'elle prétend évaluer.

Validité de contenu

Adéquation entre les questions posées et le domaine que l'épreuve est censée couvrir. Elle s'établit avant la passation, en confrontant la répartition des items au référentiel ou au programme : un examen qui interroge trois chapitres sur douze n'a pas de validité de contenu.

Erreur type de mesure

Marge d'incertitude attachée au score d'un candidat, exprimée dans l'unité de la note. Elle rappelle qu'un onze et un douze peuvent ne pas être distinguables, et invite à ne pas fonder une décision de réussite sur un écart inférieur à cette marge.

Score standardisé

Note ramenée à une échelle commune, généralement en soustrayant la moyenne du groupe puis en divisant par l'écart type. Elle permet de comparer des candidats évalués sur des sujets ou des sessions différents, en situant chacun par rapport à la distribution de son propre groupe.

Fonctionnement différentiel d'item

Situation où, à niveau égal de compétence, des candidats de groupes différents n'ont pas la même probabilité de réussir un item. Ce fonctionnement différentiel signale un biais potentiel — culturel, linguistique, de genre — logé dans la formulation de la question plutôt que dans la compétence évaluée.

Fonctions et moments de l'évaluation

Une même question ne dit pas la même chose selon le moment où elle est posée et l'usage que l'on fait du résultat.

Évaluation diagnostique

Évaluation placée avant un enseignement ou une formation pour établir ce que les apprenants savent déjà, et ce qui leur manque. Elle ne compte pas dans la validation : son résultat sert à constituer des groupes, à ajuster le rythme, à orienter vers un parcours ou à identifier des prérequis absents avant qu'ils ne bloquent la suite du programme. Elle se distingue de l'évaluation formative par son moment, avant l'apprentissage plutôt que pendant, et de l'évaluation sommative par sa fonction, informer plutôt que sanctionner. Exemple : avant un module de statistiques, un questionnaire de vingt questions sur les fractions, les pourcentages et la lecture d'un graphique ; les participants qui échouent sur les pourcentages suivent une séance de remise à niveau avant le premier cours. Pour être utile, une évaluation diagnostique doit couvrir les prérequis réels du programme, pas son contenu, et rendre un résultat lisible par compétence plutôt qu'une note globale : dix sur vingt ne dit pas quoi réviser. En formation professionnelle, le test de positionnement à l'entrée en est la forme la plus courante ; comparé à une évaluation de fin de parcours, il sert aussi à mesurer la progression.

Tests de positionnementTest de positionnement

Test de positionnement

Épreuve passée à l'entrée d'une formation pour situer chaque participant par rapport aux objectifs du parcours : ce qu'il maîtrise déjà, ce qui lui manque, et donc par où commencer. C'est la forme que prend l'évaluation diagnostique en formation professionnelle. Le test de positionnement se distingue du test de niveau, qui classe une personne sur une échelle générale, A2 ou B1 en langue par exemple, sans référence à une formation précise ; le positionnement, lui, mesure l'écart entre les acquis d'entrée et le contenu d'un programme donné. Son résultat n'est pas une note qui compte : il sert à adapter la durée, le rythme ou les modules, à dispenser de ce qui est déjà acquis, et de point de départ pour mesurer la progression en fin de parcours. Exemple : avant une formation de trente heures en tableur, un test de quinze questions réparties sur formules, références, tri et graphiques ; un participant qui réussit les deux premiers blocs est dispensé de la première journée. En France, le Référentiel national qualité qui fonde la certification Qualiopi demande, à son indicateur 8, que le prestataire détermine les procédures de positionnement et d'évaluation des acquis à l'entrée de la prestation ; le test, sa grille et le compte rendu remis au participant en sont des preuves usuelles.

Source : Ministère du Travail — Qualiopi et Référentiel national qualitéLe test de positionnement avec Evalmee

Évaluation formative

Évaluation conduite pendant l'apprentissage, dont la fonction est de renseigner l'apprenant et l'enseignant sur les acquis en cours de construction. Son produit utile est le retour, pas la note : elle est fréquente, à faible enjeu, et sert à corriger la trajectoire pendant qu'il en est encore temps. Le terme vient des travaux de Michael Scriven en 1967, repris par Benjamin Bloom, qui opposent l'évaluation qui forme à l'évaluation qui dresse un bilan. Concrètement, une évaluation formative se reconnaît à trois traits : un retour rapide et précis sur chaque réponse, un résultat qui ne pèse pas ou peu dans la note finale, et une suite pédagogique décidée à partir des erreurs observées. Exemple : un quiz de dix questions à la fin de chaque séance, corrigé automatiquement, avec la justification de la bonne réponse affichée aussitôt ; l'enseignant relit les statistiques par question et reprend au cours suivant la notion que la moitié du groupe a manquée. L'effet de testing renforce l'intérêt du dispositif : se tester consolide la mémoire plus que relire. La même question peut servir en formatif ou en sommatif ; c'est l'usage du résultat qui décide, non le format.

Évaluation formative et contrôle continu

Évaluation sommative

Évaluation qui intervient au terme d'une séquence, d'un module ou d'une année pour établir un bilan des acquis et produire une note qui compte. Elle arrête un résultat plutôt qu'elle n'accompagne un progrès, et se distingue de l'évaluation formative par sa fonction, non par le format des questions posées. Le mot vient de somme : la note résume ce qui a été appris, et elle sert à décider, valider un module, classer, admettre, délivrer un titre. Lorsque cette décision conditionne un diplôme ou une certification, on parle plus précisément d'évaluation certificative. Exemple : l'examen terminal d'un cours de droit des contrats, deux heures, un cas pratique et dix questions courtes, noté sur vingt et pesant soixante pour cent de la note du module, le reste venant du contrôle continu. Parce que sa note a des conséquences, une évaluation sommative exige plus qu'une formative : un barème publié à l'avance, des conditions de passation identiques pour tous, une identification du candidat, une correction traçable et une possibilité de réclamation. Une analyse d'items après l'épreuve reste utile : une question que les meilleurs candidats ratent plus souvent que les autres signale un énoncé ambigu ou un corrigé faux.

Évaluation certificative

Évaluation certificative

Évaluation dont le résultat conditionne la délivrance d'un titre, d'un diplôme ou d'une certification. L'enjeu impose des exigences renforcées d'identification du candidat, d'équité des conditions de passation, de traçabilité de la correction et de conservation des copies.

Examens certificatifs et diplômants

Contrôle continu

Mode d'évaluation qui répartit la notation sur plusieurs épreuves étalées dans le temps plutôt que sur un examen terminal unique. Il lisse l'effet d'une contre-performance ponctuelle et donne des points de mesure réguliers, au prix d'une charge d'organisation et de correction plus élevée.

Évaluation ipsative

Évaluation qui compare un apprenant à ses propres résultats antérieurs plutôt qu'à une norme ou à ses pairs. Elle rend visible la progression individuelle, ce qui la rend utile en formation professionnelle et en remédiation, mais elle ne permet aucun classement entre candidats.

Évaluation par les pairs

Dispositif où les apprenants évaluent le travail les uns des autres à partir d'une grille fournie. L'exercice fait travailler les critères autant que le contenu ; sa fiabilité dépend étroitement de la précision de la grille et d'un nombre suffisant d'évaluateurs par copie.

Auto-évaluation

Appréciation par l'apprenant de son propre travail au regard de critères explicites. Elle développe la capacité à se situer, condition d'une autonomie réelle, mais ses résultats corrèlent faiblement avec l'évaluation externe tant que les critères n'ont pas été travaillés en amont.

Effet de testing

Phénomène par lequel le fait de se tester sur un contenu améliore sa rétention plus durablement que de le relire. Le rappel actif consolide la trace en mémoire, ce qui fait de l'évaluation fréquente un instrument d'apprentissage et pas seulement un instrument de mesure.

Taxonomie de Bloom

Classification des objectifs d'apprentissage par niveau d'opération mentale, de la restitution de connaissances jusqu'à la création, en passant par la compréhension, l'application, l'analyse et l'évaluation. Elle sert à vérifier qu'une épreuve n'interroge pas uniquement le premier de ces niveaux.

Alignement pédagogique

Cohérence entre les objectifs d'apprentissage annoncés, les activités proposées et les épreuves qui sanctionnent le cours. Un désalignement se repère facilement : le cours travaille l'analyse de cas, l'examen interroge des définitions, et les étudiants révisent donc les définitions.

Acquis d'apprentissage

Énoncé de ce qu'un apprenant doit être capable de faire à l'issue d'une formation, formulé avec un verbe d'action observable. Rédigés ainsi, les acquis d'apprentissage se traduisent directement en critères d'évaluation, ce qu'un objectif formulé en termes de « connaître » ne permet pas.

Approche par compétences

Organisation d'une formation et de son évaluation autour de compétences — des capacités à agir en situation — plutôt qu'autour de contenus disciplinaires. L'évaluation y prend la forme de tâches complexes et contextualisées, jugées sur une grille critériée plutôt que sur un total de bonnes réponses.

Intégrité, surveillance et sécurité des épreuves

Ce qui garantit que la note appartient bien au candidat — et ce que chaque dispositif coûte, en argent comme en données personnelles.

Télésurveillance

Ensemble des dispositifs permettant de surveiller à distance un candidat : captation vidéo et audio, contrôle de l'écran ou suivi humain. Le terme anglais couramment utilisé est proctoring. Le niveau retenu doit rester proportionné à l'enjeu de l'épreuve et aux données personnelles collectées.

La surveillance chez Evalmee

Proctoring

Terme anglais désignant la surveillance d'un examen passé à distance, sur l'ordinateur du candidat, pour garantir que la note appartient bien à la personne inscrite. En français, le mot administratif est télésurveillance des examens. Le proctoring combine, selon le dispositif, une vérification de l'identité en début d'épreuve, une captation vidéo et audio par la webcam, un contrôle de l'écran ou des onglets ouverts, et une analyse des événements de la session. On distingue trois niveaux. Le proctoring en direct : un surveillant humain suit les candidats en temps réel et peut intervenir. Le proctoring différé : la session est enregistrée et relue après coup par un examinateur. Le proctoring automatisé : des algorithmes signalent des événements atypiques, visage absent, seconde personne, changement de fenêtre, qu'une personne doit ensuite examiner. Exemple : pour un examen de fin de module à distance, l'établissement retient une vérification de la pièce d'identité par le surveillant, un verrouillage des onglets et des signalements automatiques relus par l'enseignant, sans analyse du regard ni des émotions. En France, la CNIL a fixé le cadre par sa délibération n° 2023-058 du 8 juin 2023 : l'établissement est responsable du traitement, le dispositif doit rester proportionné à l'enjeu de l'épreuve, une alternative en présentiel doit être proposée, l'analyse automatique du comportement est à écarter et aucune décision ne peut être prise sans vérification humaine.

Source : CNIL — télésurveillance des examens en ligne, recommandation du 8 juin 2023Le proctoring chez EvalmeeTélésurveillance

Proctoring automatisé

Surveillance assurée par des algorithmes qui analysent le flux vidéo, le son et l'activité du poste pour signaler des événements atypiques : visage absent, seconde personne, changement de fenêtre. Les signalements produits sont des indices à instruire, jamais une preuve de fraude en eux-mêmes. L'automatisme porte sur l'analyse, jamais sur la décision : tirer une conséquence d'un signalement sans qu'une personne l'ait examiné serait une décision entièrement automatisée, encadrée par l'article 22 du RGPD.

Proctoring en direct

Surveillance par un surveillant humain qui suit les candidats en temps réel pendant la session et peut intervenir, demander un balayage de la pièce ou interrompre l'épreuve. C'est le mode le plus coûteux, et le seul qui permette de traiter un incident pendant qu'il se produit.

Proctoring différé

Enregistrement de la session, revu après coup par un examinateur, en général guidé par les moments que l'analyse automatique a signalés. Il coûte moins cher que la surveillance en direct et laisse une trace vérifiable, mais ne permet aucune intervention pendant l'épreuve elle-même.

Verrouillage du navigateur

Restriction de l'environnement logiciel du candidat pendant l'épreuve : plein écran imposé, changement d'onglet bloqué ou signalé, copier-coller et impression désactivés. La mesure élève le coût de la triche opportuniste, sans rien pouvoir contre un second appareil posé à côté du poste.

Randomisation

Tirage aléatoire des questions dans une banque et de l'ordre des propositions, de sorte que deux candidats voisins ne voient pas le même sujet. C'est la parade la plus économique à la copie entre candidats ; elle suppose des questions de difficulté comparable pour rester équitable.

Piste d'audit

Journal horodaté de tous les événements d'une session : connexion, affichage de chaque question, réponses successives, incidents réseau, actions du surveillant. C'est ce qui permet de reconstituer une épreuve contestée et de répondre à une réclamation autrement que de mémoire.

Authentification du candidat

Vérification que la personne qui compose est bien celle qui est inscrite : identifiants nominatifs, connexion via l'annuaire de l'établissement, contrôle d'une pièce d'identité, parfois comparaison biométrique. Le niveau de vérification se règle sur l'enjeu de l'épreuve et sur les données qu'il légitime de traiter.

Fraude aux examens

Toute conduite visant à obtenir une note qui ne reflète pas le travail du candidat : documents non autorisés, communication avec un tiers, substitution de personne, recours non déclaré à un outil génératif. Sa qualification et ses suites relèvent du règlement de l'établissement.

Plagiat

Reprise du travail d'autrui sans en indiquer la source, présentée comme sa propre production. Les outils de similarité mesurent des recouvrements de texte, ce qui constitue un indice et non un verdict : la qualification du plagiat suppose l'examen de l'intention et du contexte.

Interopérabilité et standards techniques

Les normes qui permettent à une plateforme d'évaluation de se brancher sur le système d'information d'un établissement plutôt que de vivre à côté.

LMS (learning management system)

Plateforme qui héberge les cours, les inscriptions et le suivi des apprenants d'un établissement. Elle est le point d'entrée quotidien des étudiants, ce qui fait de l'intégration au LMS — et non de la qualité isolée d'un outil d'examen — la condition pratique de son adoption réelle.

Moodle

Plateforme d'apprentissage libre, diffusée sous licence GPL et très largement déployée dans l'enseignement supérieur francophone. Son ouverture explique qu'elle serve de référence d'intégration : un outil d'évaluation qui ne s'y branche pas oblige les enseignants à tenir deux listes d'étudiants.

Source : moodle.org

LTI Advantage

Ensemble de trois services ajoutés à LTI 1.3 par 1EdTech : Assignment and Grade Services, qui crée les colonnes du carnet de notes et y remonte les résultats ; Names and Role Provisioning Services 2.0, qui expose les utilisateurs et leurs rôles ; Deep Linking 2.0, qui sélectionne un contenu précis dans l'outil externe.

Source : 1EdTech — LTI Advantage

SCORM

Ensemble de spécifications techniques publié par l'ADL Initiative pour rendre les contenus e-learning interopérables et réutilisables d'une plateforme à l'autre. Il décrit l'empaquetage des contenus et l'interface d'exécution par laquelle un module rend compte de la progression de l'apprenant au LMS qui l'héberge.

xAPI (Experience API)

Norme IEEE 9274.1.1-2023, issue de la spécification xAPI de l'ADL Initiative, qui définit un modèle de données JSON et une interface web permettant de tracer des expériences d'apprentissage vers un Learning Record Store. Contrairement à SCORM, elle enregistre aussi des activités survenues hors de tout LMS.

Source : IEEE 9274.1.1-2023

QTI (Question and Test Interoperability)

Standard de 1EdTech décrivant un format d'échange pour les questions, les tests et les résultats. Il permet de transporter une banque de questions d'un système à un autre sans la ressaisir, ce qui rend une bibliothèque d'items indépendante de la plateforme qui l'a produite.

Source : 1EdTech — QTI

Authentification unique (SSO)

Mécanisme permettant à un utilisateur de se connecter à plusieurs services avec le compte de son établissement, via des protocoles comme SAML, CAS, Shibboleth ou OpenID Connect. Elle supprime la création de mots de passe dédiés et rend la révocation d'un accès immédiate quand un compte est fermé.

SSO et connecteurs

API REST

Interface de programmation par laquelle un système tiers lit et écrit les données d'une plateforme via des requêtes HTTP. Elle permet d'automatiser ce que l'interface graphique fait à la main : créer des sessions, inscrire des candidats, verser les résultats dans un logiciel de scolarité.

Accessibilité et inclusion

Ce que la loi française impose aux services numériques d'un établissement, et les aménagements auxquels un candidat a droit.

Accessibilité numérique

Conception d'un service numérique de sorte qu'il soit utilisable par des personnes en situation de handicap : compatibilité avec les lecteurs d'écran, navigation entièrement au clavier, contrastes suffisants, contenus jamais exclusivement visuels ou sonores. Elle se vérifie par audit, pas par déclaration d'intention.

RGAA

Référentiel général d'amélioration de l'accessibilité, pris en application de l'article 47 de la loi du 11 février 2005. Il traduit les obligations légales d'accessibilité numérique en critères de contrôle assortis de tests techniques ; sa version 4 a été arrêtée le 20 septembre 2019.

Source : accessibilite.numerique.gouv.fr

Déclaration d'accessibilité

Document public qu'un service numérique soumis au RGAA doit publier pour annoncer son état de conformité. Trois états existent : conformité totale lorsque tous les critères sont respectés, conformité partielle à partir de la moitié des critères, non-conformité en deçà ou en l'absence d'audit valide.

Source : accessibilite.numerique.gouv.fr — déclaration d'accessibilité

Tiers-temps

Majoration du temps d'épreuve accordée à un candidat en situation de handicap. Le code de l'éducation prévoit qu'elle ne peut excéder le tiers du temps normalement prévu, un allongement supérieur restant possible à titre exceptionnel sur demande motivée du médecin qui examine la situation.

Source : Code de l'éducation, articles D351-27 à D351-31

Aménagements d'épreuves

Ensemble des adaptations dont peut bénéficier un candidat en situation de handicap : conditions matérielles adaptées, aides techniques et humaines, étalement des épreuves sur plusieurs sessions, conservation des notes pendant cinq ans, adaptations ou dispenses d'épreuves. L'autorité qui organise l'examen décide et notifie sa décision.

Source : Code de l'éducation, articles D351-27 à D351-31

Conception universelle de l'apprentissage

Approche qui prévoit dès la conception plusieurs manières de présenter un contenu, de s'engager dans une tâche et de démontrer ce que l'on a appris, plutôt que d'ajouter des aménagements après coup. Appliquée à l'évaluation, elle réduit le nombre de situations exigeant un traitement particulier.

Cadre réglementaire et qualité en France

Les organismes et les répertoires qui font la valeur d'une certification française, et les obligations de protection des données qui pèsent sur toute épreuve en ligne.

Qualiopi

Marque de certification qualité délivrée par un organisme certificateur accrédité, qui porte sur les processus des prestataires d'actions concourant au développement des compétences. Depuis le 1er janvier 2022, elle conditionne l'accès aux fonds publics ou mutualisés et repose sur le Référentiel national qualité.

Source : Ministère du Travail — Qualiopi

RNCP

Répertoire national des certifications professionnelles, établi et actualisé par France compétences. Les certifications qui y sont enregistrées sont classées par niveau de qualification et par domaine d'activité, et elles sont constituées de blocs de compétences évaluables et validables séparément.

Source : France compétences — certification professionnelle

Répertoire spécifique

Second répertoire national établi par France compétences, qui recense les certifications et habilitations correspondant à des compétences professionnelles complémentaires aux certifications professionnelles. L'enregistrement intervient sur demande, après avis de la commission compétente, pour une durée maximale de cinq ans.

Source : Code du travail, article L6113-6

France compétences

Établissement public à caractère administratif créé le 1er janvier 2019 par la loi du 5 septembre 2018, seule instance de gouvernance nationale de la formation professionnelle et de l'apprentissage. Sa gouvernance est quadripartite et ses missions sont de financer, de réguler et d'améliorer l'offre de formation.

Source : France compétences — son rôle

Bloc de compétences

Selon le code du travail, ensemble homogène et cohérent de compétences contribuant à l'exercice autonome d'une activité professionnelle, et pouvant être évalué et validé séparément. Chaque certification est définie par un référentiel d'activités, un référentiel de compétences et un référentiel d'évaluation.

Source : Code du travail, article L6113-1

Modalités de contrôle des connaissances

Règles d'évaluation arrêtées par un établissement d'enseignement supérieur. Le code de l'éducation prévoit qu'elles soient fixées au plus tard à la fin du premier mois de l'année d'enseignement et ne puissent plus être modifiées en cours d'année, l'appréciation se faisant par contrôle continu, par examen terminal ou par les deux.

Source : Code de l'éducation, article L613-1

Hcéres

Haut Conseil de l'évaluation de la recherche et de l'enseignement supérieur, autorité publique indépendante. Il évalue les établissements d'enseignement supérieur, les organismes et unités de recherche ainsi que les formations et les diplômes, selon une méthodologie d'évaluation par les pairs.

Source : hceres.fr

CTI

Commission des titres d'ingénieur, organisme indépendant chargé par la loi française depuis 1934 d'évaluer les écoles d'ingénieurs en vue de leur accréditation, de développer la qualité des formations et de promouvoir le titre d'ingénieur. Elle rend un avis pour les écoles publiques et une décision pour les écoles privées.

Source : cti-commission.fr

CEFDG

Commission d'évaluation des formations et diplômes de gestion, unique instance nationale compétente pour évaluer la qualité des formations des écoles de management privées et consulaires. Placée sous double tutelle, elle examine les diplômes visés par l'État et ceux qui confèrent le grade de licence ou de master.

Source : cefdg.fr

Minimisation des données

Principe du RGPD selon lequel, dans la formulation de la CNIL, les données à caractère personnel doivent être adéquates, pertinentes et limitées à ce qui est nécessaire au regard des finalités pour lesquelles elles sont traitées. Appliqué à la télésurveillance, il commande de ne collecter que ce que l'enjeu de l'épreuve justifie.

Source : CNIL — minimisation

Analyse d'impact (AIPD)

Analyse d'impact relative à la protection des données : selon la CNIL, un outil permettant de construire un traitement conforme au RGPD et respectueux de la vie privée. Elle est requise pour les traitements susceptibles d'engendrer un risque élevé pour les droits et libertés des personnes concernées.

Source : CNIL — AIPD

Durée de conservation

Temps pendant lequel des données personnelles peuvent rester en base active. La CNIL rappelle qu'il est déterminé par la finalité du traitement : au terme de cette durée les données doivent être supprimées, anonymisées ou archivées, ce qui concerne directement les enregistrements de télésurveillance.

Source : CNIL — durées de conservation

Questions fréquentes sur le vocabulaire de l'évaluation

Quelle est la différence entre évaluation formative et évaluation sommative ?

La différence tient à la fonction, pas au format. Une évaluation formative intervient pendant l'apprentissage et sert à renseigner l'apprenant et l'enseignant sur les acquis en cours de construction : son produit utile est le retour. Une évaluation sommative intervient au terme d'une séquence pour établir un bilan et produire une note qui compte. Un même QCM peut servir aux deux.

Que mesure l'indice de discrimination d'une question ?

Il mesure la capacité d'une question à distinguer les candidats forts des candidats faibles, en comparant le taux de réussite à cet item chez ceux qui obtiennent les meilleurs scores globaux et chez ceux qui obtiennent les moins bons. Un indice nul signale une question qui n'apporte aucune information ; un indice négatif signale presque toujours un corrigé faux ou un énoncé ambigu.

Une plateforme d'examen doit-elle être conforme au RGAA ?

Le RGAA s'impose aux services numériques des organismes publics et de certaines entreprises, en application de l'article 47 de la loi du 11 février 2005. Un établissement qui fait passer ses épreuves sur une plateforme reste responsable de l'accessibilité du service qu'il propose à ses étudiants : la conformité de l'outil est donc un critère d'achat, et elle se vérifie sur la déclaration d'accessibilité publiée par l'éditeur.

Qu'apporte LTI 1.3 par rapport à une simple connexion à un LMS ?

LTI 1.3 est un standard de 1EdTech : l'outil externe est lancé depuis le LMS sans compte séparé, et la sécurité de l'échange repose sur OAuth 2.0 et des jetons JSON Web Token. Avec les services LTI Advantage, le LMS transmet en plus la liste des inscrits et leurs rôles, et récupère automatiquement les notes dans son carnet — ce qu'un simple lien hypertexte ne fait pas.

Le tiers-temps est-il limité à un tiers du temps de l'épreuve ?

Le code de l'éducation prévoit que la majoration du temps d'épreuve ne peut excéder le tiers du temps normalement prévu. Un allongement supérieur reste possible à titre exceptionnel, sur demande motivée du médecin qui examine la situation du candidat. C'est l'autorité administrative qui organise l'examen qui décide des aménagements accordés et notifie sa décision au candidat.

Mettez ce vocabulaire en pratique

Barèmes critériés, analyse d'items, aménagements de temps : Evalmee outille ce que ce glossaire décrit.