Glosario de la evaluación

El vocabulario de la evaluación, definido término por término: formatos de preguntas, baremos, psicometría, supervisión de las pruebas, estándares de interoperabilidad, accesibilidad y marco normativo francés. Cada definición se sostiene sola — se lee y se cita por separado.

89 términos definidos. Los términos normativos y reglamentarios remiten al organismo que posee su definición; ninguno se define de memoria.

Formatos de preguntas y de respuestas

Lo que se le pide producir al candidato — y lo que cada formato permite medir realmente.

Pregunta de opción múltiple

Pregunta cerrada que ofrece varias respuestas posibles, de las cuales una o varias son correctas; el candidato marca las que considera válidas, y el conjunto de sus marcas es su respuesta. Una prueba compuesta por estas preguntas es un cuestionario de opción múltiple, y en el uso corriente la expresión preguntas de opción múltiple designa tanto la pregunta como la prueba entera. Se distingue la pregunta de respuesta única, con una sola opción correcta, de la pregunta de respuestas múltiples, en la que el candidato debe marcar todas las opciones correctas y ninguna incorrecta. Ejemplo: «¿Cuáles de estas cuatro afirmaciones sobre la mitosis son exactas?», con dos opciones correctas de cuatro. El formato permite una corrección automática e instantánea, cubre mucho contenido en poco tiempo y produce estadísticas por pregunta. Su calidad depende casi por completo de los distractores: opciones falsas plausibles para quien no entendió y descartadas sin dudar por quien sí entendió. Una pregunta de opción múltiple mide mal la capacidad de producir, estructurar o justificar un razonamiento, y deja una parte al azar que el baremo debe tratar: puntos parciales, penalización por respuesta incorrecta o baremo por discordancia, según el reglamento de evaluación de la institución.

Crear un cuestionario de opción múltiple con EvalmeeBarème par discordance (baremo por discordancia)

Pregunta de respuesta única

Variante de la pregunta de opción múltiple en la que una sola respuesta es correcta entre las propuestas ofrecidas. El candidato solo puede marcar un elemento, lo que simplifica el baremo y elimina las reglas de crédito parcial, pero aumenta el peso del azar: cuatro propuestas dan un veinticinco por ciento de acierto al azar.

Pregunta de respuesta abierta corta

Pregunta que exige una respuesta redactada de unas pocas palabras o líneas, sin propuestas ofrecidas. Elimina el azar y obliga a restituir en vez de reconocer, y a la vez sigue siendo lo bastante breve para corregirse con rapidez, a mano o con una asistencia automática.

Pregunta de desarrollo

Pregunta que exige una exposición construida: disertación, estudio de caso, demostración. Es la única que mide la argumentación, la estructuración y la movilización cruzada de conocimientos, a costa de una corrección lenta y de una variabilidad entre correctores que una rúbrica de evaluación sirve precisamente para reducir.

Corregir las respuestas redactadas

Pregunta de verdadero/falso

Pregunta cerrada con dos respuestas posibles. Rápida de redactar y de corregir, deja un cincuenta por ciento de acierto al azar: solo resulta fiable en serie, sobre un número elevado de ítems, y se presta mal a evaluar un razonamiento matizado o un conocimiento parcial.

Pregunta de emparejamiento

Pregunta que exige relacionar los elementos de dos listas: un término y su definición, una fecha y un acontecimiento, una molécula y su función. Pone a prueba con eficacia el dominio de un vocabulario o de una nomenclatura, y se corrige automáticamente, pareja por pareja.

Texto con huecos

Enunciado del que se han retirado algunas palabras y que el candidato debe restituir, libremente o a partir de una lista facilitada. El formato se sitúa entre la opción múltiple y la respuesta abierta: exige un recuerdo activo sin dejar de ser corregible de forma automática.

Ítem

Unidad elemental de un test: una pregunta y el baremo asociado a ella. Es el nivel en el que se calculan las estadísticas de una prueba — dificultad, discriminación, correlación con la puntuación total — y por tanto el nivel en el que un examen se repara, pregunta a pregunta.

Distractor

Propuesta falsa de una pregunta de opción múltiple. Un buen distractor resulta plausible para quien no ha comprendido y queda claramente descartado por quien sí ha comprendido: un distractor que nadie elige no aporta ninguna información y reduce la pregunta a una elección más estrecha.

Banco de preguntas

Depósito de preguntas indexadas y reutilizables, clasificadas por tema, nivel o competencia. Permite componer una prueba por sorteo, variar los exámenes de una convocatoria a otra y acumular, ítem a ítem, el historial estadístico que hace fiable a una pregunta.

Baremo, calificación y corrección

Cómo unas respuestas se convierten en una nota — y qué garantiza que dos correctores lleguen al mismo resultado.

Baremo de calificación

Regla que convierte las respuestas de un candidato en una nota. Fija el número de puntos por pregunta, las posibles penalizaciones y la forma en que se atribuyen los puntos parciales. Publicado antes de la prueba, constituye el compromiso del examinador sobre aquello que se valorará.

Barème par discordance (baremo por discordancia)

Baremo por criterios

Baremo que reparte los puntos sobre criterios explícitos — exactitud, método, redacción, justificación — en vez de sobre una apreciación global del examen. Cada criterio se califica por separado, lo que hace que la nota sea descomponible, explicable al candidato y comparable de un corrector a otro.

Barème par discordance (baremo por discordancia)

Forma de calificar las preguntas de opción múltiple, habitual en los cursos franceses de salud PASS, LAS y el antiguo PACES, donde la nota depende del número de discordancias con la respuesta esperada: una opción marcada por error o una opción correcta dejada en blanco. Cero discordancias da la nota máxima y cada discordancia adicional baja la nota un escalón. Cada facultad fija los escalones.

El baremo por discordancia en Evalmee

Rúbrica de evaluación

Tabla que cruza los criterios de evaluación con niveles de desempeño descritos con todas sus palabras, del más bajo al más alto. El corrector sitúa el examen en una casilla en vez de atribuir una cifra: la nota pasa a ser consecuencia de una descripción compartida de antemano.

La rúbrica bloqueada antes de la corrección con IA en Evalmee

Pauta de evaluación

Documento que fija, antes de la corrección, sobre qué se juzgará un trabajo y cuánto vale cada elemento. En su forma más simple es una lista de criterios con puntos asignados: estructura del razonamiento, exactitud de los cálculos, calidad de la redacción, respeto de la consigna. Cuando cada criterio se describe además por niveles de desempeño, con todas sus palabras, del más bajo al más alto, la pauta se convierte en una rúbrica de evaluación, definida aparte en este glosario; en varios países se habla también de grilla o de guía de evaluación. Una pauta de evaluación cumple tres funciones: guía al corrector y reduce la diferencia entre correctores, explica la nota al candidato criterio por criterio y, comunicada antes de la prueba, dice a los participantes qué se espera. Ejemplo: para un estudio de caso en administración, cuatro criterios sobre cien puntos, análisis del problema 30, pertinencia de las soluciones 30, argumentación 25, forma 15; cada examen recibe cuatro notas parciales y un comentario por criterio. Una pauta demasiado fina, con quince criterios, se llena mecánicamente y pierde fiabilidad; de cuatro a seis criterios independientes suelen bastar. En una plataforma de evaluación, la pauta se carga una vez y se aplica a cada examen, lo que permite a una corrección asistida por IA proponer una nota por criterio que el corrector valida o corrige.

La pauta de corrección en EvalmeeRúbrica de evaluación

Corrección automática

Atribución de los puntos por la plataforma, sin intervención humana, en las preguntas cuya respuesta esperada es decidible: opción múltiple, emparejamiento, texto con huecos, valor numérico con tolerancia. Hace inmediato el resultado y elimina la variabilidad entre correctores en esos ítems.

Corrección asistida por IA

Precorrección de las respuestas redactadas por un modelo de lenguaje, que propone una nota y una justificación que el corrector valida, modifica o rechaza. La decisión sigue siendo humana: lo que la IA hace ganar es la primera pasada sobre el examen, nunca la responsabilidad de la nota.

La corrección asistida en Evalmee

Anonimización de los exámenes

Retirada de la identidad del candidato en el momento de la corrección, de modo que el examen solo lleve un número. El dispositivo apunta a los sesgos ligados al nombre, al género, al origen supuesto o a la reputación del estudiante, cuyo efecto sobre la nota está documentado por la investigación.

La corrección anónima de los exámenes en Evalmee

Doble corrección

Corrección de un mismo examen por dos examinadores independientes, cuyas notas se contrastan después. La diferencia entre ambas mide la parte de subjetividad de la prueba; más allá de un umbral acordado de antemano, una tercera lectura o una discusión entre correctores resuelve el desacuerdo.

Armonización de la corrección

Reunión de los correctores, antes o después de corregir, para alinear su lectura del baremo sobre exámenes de referencia. Reduce la diferencia sistemática entre correctores — el hecho de que un mismo trabajo valga dos puntos más en un montón de exámenes que en otro.

Nota mínima garantizada

Nota por debajo de la cual no se hace bajar un examen, sea cual sea su calidad. Limita el efecto destructor de un cero sobre una media anual y neutraliza las penalizaciones acumuladas, a costa de comprimir hacia arriba la escala de calificación.

Penalización por respuesta incorrecta

Descuento de puntos por las respuestas erróneas de una pregunta cerrada, destinado a desalentar la respuesta al azar. El procedimiento penaliza también la toma de riesgo razonada y perjudica, según los trabajos disponibles, más a los candidatos prudentes que a los candidatos mal preparados.

Barème par discordance (baremo por discordancia)

Compensación de notas

Mecanismo por el cual una nota superior a la media en una asignatura compensa una nota inferior en otra, dentro de una unidad de enseñanza o de un semestre. Su alcance, su umbral y las asignaturas excluidas dependen de las normas de evaluación de cada institución.

Convocatoria de recuperación

Segunda convocatoria de examen abierta a los candidatos que no han cumplido las condiciones de aprobación tras la primera. Su calendario y la regla de conservación o de sustitución de la nota inicial los fijan las normas de evaluación de la institución que organiza la prueba.

Psicometría y análisis de ítems

Los indicadores que dicen si una prueba mide realmente algo, y cuáles de sus preguntas son defectuosas.

Docimología

Ciencia de la evaluación y de los exámenes, del griego dokimé, prueba. El término lo propone en 1922 el psicólogo Henri Piéron, que estudia con Henri Laugier la calificación de un mismo examen por varios correctores. Sus encuestas de los años treinta sobre los exámenes de fin de secundaria muestran diferencias de varios puntos entre correctores sobre un mismo examen, hasta la mitad de la escala en filosofía, y variaciones en un mismo corrector según el momento y el lugar del examen en la pila. La docimología describe estas fuentes de variabilidad: el efecto halo, en el que la caligrafía o la reputación del candidato tiñe la nota; el efecto de contraste, en el que un examen mediano parece flojo después de uno excelente; el efecto de orden y la fatiga del corrector; la severidad propia de cada uno. También propone los remedios: baremo por criterios, pauta de evaluación, doble corrección, anonimización de los exámenes, armonización entre correctores. Ejemplo: un mismo ensayo entregado a cinco correctores sin consigna común recibe notas muy dispersas; con una pauta de cuatro criterios descritos con todas sus palabras, la diferencia se reduce a unos pocos puntos. La psicometría, nacida de la medición de aptitudes, estudia más bien la calidad de los tests mismos; la docimología conserva como objeto el juicio del evaluador.

Doble corrección

Análisis de ítems

Examen estadístico de las preguntas de un test después de su aplicación: cuántos candidatos acertaron cada ítem, quiénes, y cómo se compara eso con su puntuación global. Revela las preguntas ambiguas, las preguntas inútiles y los errores de la plantilla de corrección antes de que se repitan.

Las estadísticas por pregunta

Índice de dificultad

Proporción de candidatos que respondieron correctamente a un ítem, comprendida entre cero y uno. Un índice de 0,90 señala una pregunta que casi todos aciertan, y por tanto poco informativa; los valores cercanos a 0,5 maximizan la capacidad de la pregunta para separar los niveles.

Índice de discriminación

Medida de la capacidad de una pregunta para distinguir a los candidatos fuertes de los débiles, calculada como la diferencia de acierto entre los mejores y los peores resultados globales. Un índice nulo o negativo señala un ítem defectuoso, mal formulado, o cuya plantilla de corrección es falsa.

Correlación ítem-total

Correlación entre el acierto en una pregunta y la puntuación obtenida en el resto del test, expresada a menudo mediante un coeficiente biserial-puntual. Indica si el ítem mide lo mismo que la prueba en su conjunto; un valor bajo señala un ítem ajeno al tema evaluado.

Fiabilidad

Constancia de una medida: en qué grado un mismo candidato obtendría una puntuación comparable al repetir el test, con otras preguntas del mismo tipo o ante otro corrector. Una prueba poco fiable produce notas de las que una parte no es más que ruido.

Alfa de Cronbach

Coeficiente que resume la consistencia interna de un test, es decir, hasta qué punto sus ítems miden una misma dimensión. Suele variar entre cero y uno y aumenta mecánicamente con el número de preguntas: un alfa elevado no acredita, por tanto, la validez por sí solo.

Validez

Grado en que un test mide realmente lo que pretende medir y autoriza las decisiones que de él se extraen. Una prueba puede ser perfectamente fiable y carecer de validez: mide entonces algo muy estable, pero no la competencia que pretende evaluar.

Validez de contenido

Adecuación entre las preguntas planteadas y el ámbito que la prueba se supone que cubre. Se establece antes de la aplicación, contrastando el reparto de los ítems con el referencial o el programa: un examen que interroga tres capítulos de doce carece de validez de contenido.

Error típico de medida

Margen de incertidumbre asociado a la puntuación de un candidato, expresado en la unidad de la nota. Recuerda que un once y un doce pueden no ser distinguibles, e invita a no fundar una decisión de aprobado sobre una diferencia inferior a ese margen.

Puntuación estandarizada

Nota llevada a una escala común, en general restando la media del grupo y dividiendo después por la desviación típica. Permite comparar candidatos evaluados en pruebas o convocatorias distintas, situando a cada uno respecto a la distribución de su propio grupo.

Funcionamiento diferencial del ítem

Situación en la que, a igual nivel de competencia, candidatos de grupos distintos no tienen la misma probabilidad de acertar un ítem. Ese funcionamiento diferencial señala un sesgo potencial — cultural, lingüístico, de género — alojado en la formulación de la pregunta más que en la competencia evaluada.

Funciones y momentos de la evaluación

Una misma pregunta no dice lo mismo según el momento en que se plantea y el uso que se hace del resultado.

Evaluación diagnóstica

Evaluación situada antes de una enseñanza o de una capacitación para establecer lo que los participantes ya saben, y lo que les falta. No cuenta para la aprobación: su resultado sirve para formar grupos, ajustar el ritmo, orientar hacia un itinerario o identificar requisitos previos ausentes antes de que bloqueen el resto del programa. Se distingue de la evaluación formativa por su momento, antes del aprendizaje y no durante, y de la evaluación sumativa por su función, informar y no sancionar. Ejemplo: antes de un módulo de estadística, un cuestionario de veinte preguntas sobre fracciones, porcentajes y lectura de un gráfico; los participantes que fallan en porcentajes siguen una sesión de nivelación antes de la primera clase. Para ser útil, una evaluación diagnóstica debe cubrir los requisitos previos reales del programa, no su contenido, y devolver un resultado legible por competencia y no una nota global: un cincuenta por ciento no dice qué repasar. En la capacitación profesional, la prueba de ubicación al inicio es su forma más común; comparada con una evaluación de fin de curso, sirve también para medir el progreso.

Pruebas de posicionamientoPrueba de ubicación

Prueba de ubicación

Prueba que se realiza al inicio de un curso o de una capacitación para situar a cada participante respecto de los objetivos del itinerario: lo que ya domina, lo que le falta y, por lo tanto, por dónde empezar. Es la forma que toma la evaluación diagnóstica en la capacitación profesional; en varios países se habla también de examen de ubicación o de prueba de entrada. Se distingue de la prueba de nivel, que clasifica a una persona en una escala general, A2 o B1 en un idioma por ejemplo, sin referencia a un curso preciso; la ubicación mide la distancia entre lo que el participante trae al entrar y el contenido de un programa dado. Su resultado no es una nota que cuenta: sirve para adaptar la duración, el ritmo o los módulos, para eximir de lo que ya está adquirido y como punto de partida para medir el progreso al final del curso. Ejemplo: antes de una capacitación de treinta horas en hoja de cálculo, una prueba de quince preguntas repartidas entre fórmulas, referencias, ordenamiento y gráficos; un participante que aprueba los dos primeros bloques queda eximido de la primera jornada. Los sistemas de calidad de la capacitación piden por lo general evaluar las necesidades y los conocimientos previos al inicio del servicio, sin imponer un formato: la prueba, su pauta y el informe entregado al participante son las evidencias habituales. En América Latina, universidades e institutos la usan sobre todo para asignar el nivel de idioma o de matemáticas al ingresar.

La prueba de ubicación con Evalmee

Evaluación formativa

Evaluación realizada durante el aprendizaje, cuya función es informar al alumno y al docente sobre los logros en curso de construcción. Su producto útil es la retroalimentación, no la nota: es frecuente, de bajo riesgo, y sirve para corregir la trayectoria mientras todavía hay tiempo. El término proviene de los trabajos de Michael Scriven en 1967, retomados por Benjamin Bloom, que oponen la evaluación que forma a la evaluación que hace balance. En concreto, una evaluación formativa se reconoce por tres rasgos: una retroalimentación rápida y precisa sobre cada respuesta, un resultado que pesa poco o nada en la nota final, y una decisión pedagógica tomada a partir de los errores observados. Ejemplo: un cuestionario de diez preguntas al final de cada sesión, corregido automáticamente, con la justificación de la respuesta correcta mostrada de inmediato; el docente relee las estadísticas por pregunta y retoma en la clase siguiente la noción que la mitad del grupo falló. El efecto de testing refuerza el interés del dispositivo: ponerse a prueba consolida la memoria más que releer. La misma pregunta puede servir en formativo o en sumativo; lo que decide es el uso del resultado, no el formato.

Evaluación formativa y evaluación continua

Evaluación sumativa

Evaluación que interviene al término de una secuencia, de un módulo o de un año para establecer un balance de los logros y producir una nota que cuenta. Fija un resultado más que acompaña un progreso, y se distingue de la evaluación formativa por su función, no por el formato de las preguntas planteadas. La palabra viene de suma: la nota resume lo aprendido y sirve para decidir, aprobar un módulo, clasificar, admitir, otorgar un título. Cuando esa decisión condiciona un diploma o una certificación, se habla más precisamente de evaluación certificativa. Ejemplo: el examen final de un curso de derecho de contratos, dos horas, un caso práctico y diez preguntas cortas, calificado sobre cien y con un peso del sesenta por ciento en la nota del módulo, el resto proveniente de la evaluación continua. Como su nota tiene consecuencias, una evaluación sumativa exige más que una formativa: un baremo publicado de antemano, condiciones de aplicación idénticas para todos, una identificación del candidato, una corrección trazable y una vía de reclamación. Un análisis de ítems después de la prueba sigue siendo útil: una pregunta que los mejores candidatos fallan más que los demás señala un enunciado ambiguo o una clave de corrección errónea.

Evaluación certificativa

Evaluación certificativa

Evaluación cuyo resultado condiciona la expedición de un título, de un diploma o de una certificación. Lo que está en juego impone exigencias reforzadas de identificación del candidato, de equidad de las condiciones de aplicación, de trazabilidad de la corrección y de conservación de los exámenes.

Exámenes certificativos y de titulación

Evaluación continua

Modo de evaluación que reparte la calificación entre varias pruebas escalonadas en el tiempo, en vez de concentrarla en un examen final único. Suaviza el efecto de un mal resultado puntual y ofrece puntos de medida regulares, a costa de una carga de organización y de corrección más alta.

Evaluación ipsativa

Evaluación que compara a un alumno con sus propios resultados anteriores en vez de con una norma o con sus pares. Hace visible el progreso individual, lo que la vuelve útil en formación profesional y en refuerzo, pero no permite ninguna clasificación entre candidatos.

Evaluación entre pares

Dispositivo en el que los alumnos evalúan el trabajo de sus compañeros a partir de una rúbrica facilitada. El ejercicio hace trabajar los criterios tanto como el contenido; su fiabilidad depende estrechamente de la precisión de la rúbrica y de un número suficiente de evaluadores por trabajo.

Autoevaluación

Apreciación por el propio alumno de su trabajo a la luz de criterios explícitos. Desarrolla la capacidad de situarse, condición de una autonomía real, pero sus resultados correlacionan débilmente con la evaluación externa mientras los criterios no se hayan trabajado previamente.

Efecto de evaluación (testing effect)

Fenómeno por el cual ponerse a prueba sobre un contenido mejora su retención de forma más duradera que releerlo. El recuerdo activo consolida la huella en la memoria, lo que convierte la evaluación frecuente en un instrumento de aprendizaje y no solo en un instrumento de medida.

Taxonomía de Bloom

Clasificación de los objetivos de aprendizaje por nivel de operación mental, desde la restitución de conocimientos hasta la creación, pasando por la comprensión, la aplicación, el análisis y la evaluación. Sirve para comprobar que una prueba no interroga únicamente el primero de esos niveles.

Alineación pedagógica

Coherencia entre los objetivos de aprendizaje anunciados, las actividades propuestas y las pruebas que sancionan el curso. Un desajuste se detecta con facilidad: el curso trabaja el análisis de casos, el examen pregunta definiciones, y los estudiantes repasan en consecuencia las definiciones.

Resultados de aprendizaje

Enunciado de lo que un alumno debe ser capaz de hacer al terminar una formación, formulado con un verbo de acción observable. Redactados así, los resultados de aprendizaje se traducen directamente en criterios de evaluación, cosa que un objetivo formulado en términos de «conocer» no permite.

Enfoque por competencias

Organización de una formación y de su evaluación en torno a competencias — capacidades de actuar en situación — más que en torno a contenidos disciplinares. La evaluación adopta aquí la forma de tareas complejas y contextualizadas, juzgadas con una rúbrica y no con un total de respuestas correctas.

Integridad, supervisión y seguridad de las pruebas

Lo que garantiza que la nota pertenece de verdad al candidato — y lo que cuesta cada dispositivo, en dinero igual que en datos personales.

Supervisión remota (proctoring)

Conjunto de dispositivos que permiten vigilar a un candidato que se examina fuera de un centro de examen: captación de video y audio, control de la pantalla, detección de comportamientos atípicos. El nivel elegido debe seguir siendo proporcionado a lo que está en juego y a los datos que lleva a recoger.

La vigilancia en Evalmee

Proctoring

Término inglés que designa la supervisión de un examen realizado a distancia, en la computadora del candidato, para garantizar que la nota pertenece de verdad a la persona inscrita. En español se habla también de supervisión remota o de vigilancia en línea. El proctoring combina, según el dispositivo, una verificación de identidad al inicio de la prueba, una captación de video y audio por la cámara web, un control de la pantalla o de las pestañas abiertas y un análisis de los eventos de la sesión. Se distinguen tres niveles. El proctoring en directo: un supervisor humano sigue a los candidatos en tiempo real y puede intervenir. El proctoring diferido: la sesión se graba y un examinador la revisa después. El proctoring automatizado: algoritmos señalan eventos atípicos, rostro ausente, segunda persona, cambio de ventana, que una persona debe examinar después. Ejemplo: para un examen de fin de módulo a distancia, la institución elige una verificación del documento de identidad por el supervisor, un bloqueo de pestañas y alertas automáticas revisadas por el docente, sin análisis de la mirada ni de las emociones. El marco jurídico lo dan el RGPD europeo, que se aplica a los datos alojados en Europa, y la ley de protección de datos de tu país. Sus exigencias coinciden: la institución es responsable del tratamiento, el dispositivo debe seguir siendo proporcionado a lo que está en juego en la prueba y limitarse a los datos necesarios, los candidatos deben ser informados de antemano, conviene ofrecer una alternativa, el análisis automático del comportamiento es la práctica que más se cuestiona y ninguna decisión puede tomarse sin verificación humana. Un tratamiento de este tipo suele requerir además una evaluación de impacto antes de la puesta en marcha.

El proctoring en EvalmeeSupervisión remota (proctoring)

Proctoring automatizado

Vigilancia realizada por algoritmos que analizan el flujo de video, el sonido y la actividad del equipo para señalar sucesos atípicos: rostro ausente, segunda persona, cambio de ventana. Las alertas producidas son indicios que hay que instruir, nunca una prueba de fraude por sí mismas. La automatización recae en el análisis, nunca en la decisión: sacar una consecuencia de una alerta sin que una persona la haya examinado sería una decisión enteramente automatizada, regulada por el artículo 22 del RGPD.

Proctoring en directo

Vigilancia ejercida por un supervisor humano que sigue a los candidatos en tiempo real durante la sesión y puede intervenir, pedir un barrido de la sala o interrumpir la prueba. Es la modalidad más costosa, y la única que permite tratar un incidente mientras se está produciendo.

Proctoring diferido

Grabación de la sesión, revisada después por un examinador, por lo general guiado por los momentos que el análisis automático ha señalado. Cuesta menos que la vigilancia en directo y deja una traza verificable, pero no permite ninguna intervención durante la prueba misma.

Bloqueo del navegador

Restricción del entorno de software del candidato durante la prueba: pantalla completa impuesta, cambio de pestaña bloqueado o señalado, copiar y pegar e impresión desactivados. La medida eleva el coste del fraude oportunista, sin poder nada frente a un segundo aparato colocado al lado del equipo.

Aleatorización

Sorteo aleatorio de las preguntas dentro de un banco y del orden de las propuestas, de modo que dos candidatos contiguos no vean el mismo examen. Es la defensa más económica frente a la copia entre candidatos; supone preguntas de dificultad comparable para seguir siendo equitativa.

Pista de auditoría

Registro con marca de tiempo de todos los sucesos de una sesión: conexión, visualización de cada pregunta, respuestas sucesivas, incidencias de red, acciones del supervisor. Es lo que permite reconstruir una prueba impugnada y responder a una reclamación de otro modo que de memoria.

Autenticación del candidato

Verificación de que quien se examina es realmente la persona inscrita: identificadores nominativos, conexión mediante el directorio de la institución, control de un documento de identidad, a veces comparación biométrica. El nivel de verificación se ajusta a lo que está en juego y a los datos que legitima tratar.

Fraude en los exámenes

Toda conducta dirigida a obtener una nota que no refleja el trabajo del candidato: documentos no autorizados, comunicación con un tercero, suplantación de persona, uso no declarado de una herramienta generativa. Su calificación y sus consecuencias dependen del reglamento de la institución.

Plagio

Apropiación del trabajo ajeno sin indicar su fuente, presentándolo como producción propia. Las herramientas de similitud miden solapamientos de texto, lo que constituye un indicio y no un veredicto: calificar algo de plagio supone examinar la intención y el contexto en que se produjo.

Interoperabilidad y estándares técnicos

Las normas que permiten a una plataforma de evaluación conectarse al sistema de información de una institución en vez de vivir al margen.

LMS (sistema de gestión del aprendizaje)

Plataforma que aloja los cursos, las matrículas y el seguimiento de los alumnos de una institución. Es el punto de entrada cotidiano de los estudiantes, lo que convierte la integración con el LMS — y no la calidad aislada de una herramienta de examen — en la condición práctica de su adopción real.

Moodle

Plataforma de aprendizaje libre, distribuida bajo licencia GPL y desplegada muy ampliamente en la enseñanza superior francófona. Su apertura explica que sirva de referencia de integración: una herramienta de evaluación que no se conecta a ella obliga a los docentes a mantener dos listas de estudiantes.

Fuente: moodle.org

LTI Advantage

Conjunto de tres servicios añadidos a LTI 1.3 por 1EdTech: Assignment and Grade Services, que crea las columnas del cuaderno de notas y hace subir a él los resultados; Names and Role Provisioning Services 2.0, que expone los usuarios y sus roles; Deep Linking 2.0, que selecciona un contenido concreto dentro de la herramienta externa.

Fuente: 1EdTech — LTI Advantage

SCORM

Conjunto de especificaciones técnicas publicado por la ADL Initiative para hacer los contenidos de e-learning interoperables y reutilizables de una plataforma a otra. Describe el empaquetado de los contenidos y la interfaz de ejecución por la que un módulo da cuenta del avance del alumno al LMS que lo aloja.

xAPI (Experience API)

Norma IEEE 9274.1.1-2023, surgida de la especificación xAPI de la ADL Initiative, que define un modelo de datos JSON y una interfaz web para registrar experiencias de aprendizaje en un Learning Record Store. A diferencia de SCORM, recoge también actividades ocurridas fuera de cualquier LMS.

Fuente: IEEE 9274.1.1-2023

QTI (Question and Test Interoperability)

Estándar de 1EdTech que describe un formato de intercambio para las preguntas, los tests y los resultados. Permite transportar un banco de preguntas de un sistema a otro sin volver a teclearlo, lo que hace que una biblioteca de ítems sea independiente de la plataforma que la produjo.

Fuente: 1EdTech — QTI

Inicio de sesión único (SSO)

Mecanismo que permite a un usuario conectarse a varios servicios con la cuenta de su institución, mediante protocolos como SAML, CAS, Shibboleth u OpenID Connect. Suprime la creación de contraseñas dedicadas y hace inmediata la revocación de un acceso cuando se cierra una cuenta.

SSO y conectores

API REST

Interfaz de programación mediante la cual un sistema externo lee y escribe los datos de una plataforma a través de peticiones HTTP. Permite automatizar lo que la interfaz gráfica hace a mano: crear sesiones, inscribir candidatos, volcar los resultados en un programa de gestión académica.

Accesibilidad e inclusión

Lo que la ley francesa impone a los servicios digitales de una institución, y las adaptaciones a las que un candidato tiene derecho.

Accesibilidad digital

Diseño de un servicio digital de modo que resulte utilizable por personas con discapacidad: compatibilidad con los lectores de pantalla, navegación íntegra con el teclado, contrastes suficientes, contenidos nunca exclusivamente visuales o sonoros. Se comprueba mediante auditoría, no mediante declaración de intenciones.

RGAA (referencial francés de accesibilidad digital)

Référentiel général d'amélioration de l'accessibilité, adoptado en aplicación del artículo 47 de la ley francesa del 11 de febrero de 2005. Traduce las obligaciones legales de accesibilidad digital en criterios de control acompañados de pruebas técnicas; su versión 4 se aprobó el 20 de septiembre de 2019.

Fuente: accessibilite.numerique.gouv.fr

Declaración de accesibilidad

Documento público que todo servicio digital sujeto al RGAA francés debe publicar para anunciar su estado de conformidad. Existen tres estados: conformidad total cuando se respetan todos los criterios, conformidad parcial a partir de la mitad de los criterios, y no conformidad por debajo o a falta de auditoría válida.

Fuente: accessibilite.numerique.gouv.fr — declaración de accesibilidad

Tiers-temps (tiempo adicional de examen en Francia)

Aumento del tiempo de prueba concedido a un candidato con discapacidad. El Code de l'éducation francés prevé que no pueda exceder el tercio del tiempo normalmente previsto, y que una prolongación mayor siga siendo posible con carácter excepcional, a petición motivada del médico que examina la situación.

Fuente: Code de l'éducation francés, artículos D351-27 a D351-31

Aménagements d'épreuves (adaptaciones de examen)

Conjunto de adaptaciones de las que puede beneficiarse un candidato con discapacidad en Francia: condiciones materiales adaptadas, ayudas técnicas y humanas, reparto de las pruebas entre varias convocatorias, conservación de las notas durante cinco años, adaptaciones o dispensas de pruebas. La autoridad que organiza el examen decide y notifica su decisión.

Fuente: Code de l'éducation francés, artículos D351-27 a D351-31

Diseño universal para el aprendizaje

Enfoque que prevé desde el diseño varias maneras de presentar un contenido, de implicarse en una tarea y de demostrar lo que se ha aprendido, en vez de añadir adaptaciones a posteriori. Aplicado a la evaluación, reduce el número de situaciones que exigen un tratamiento particular.

Marco normativo y calidad en Francia

Los organismos y los registros que dan su valor a una certificación francesa, y las obligaciones de protección de datos que pesan sobre toda prueba en línea.

Qualiopi (certificación francesa de calidad de la formación)

Marca de certificación de calidad expedida por un organismo certificador acreditado, que recae sobre los procesos de los prestadores de acciones que contribuyen al desarrollo de competencias. Desde el 1 de enero de 2022 condiciona en Francia el acceso a los fondos públicos o mancomunados y se apoya en el Référentiel national qualité.

Fuente: Ministerio de Trabajo francés — Qualiopi

RNCP (registro nacional francés de certificaciones profesionales)

Répertoire national des certifications professionnelles, el registro francés establecido y actualizado por France compétences. Las certificaciones inscritas en él se clasifican por nivel de cualificación y por ámbito de actividad, y están constituidas por bloques de competencias que pueden evaluarse y validarse por separado.

Fuente: France compétences — certificación profesional

Répertoire spécifique (registro francés de certificaciones complementarias)

Segundo registro nacional establecido por France compétences, que recoge las certificaciones y habilitaciones correspondientes a competencias profesionales complementarias de las certificaciones profesionales. La inscripción se produce a solicitud del interesado, previo dictamen de la comisión competente, por una duración máxima de cinco años.

Fuente: Code du travail francés, artículo L6113-6

France compétences (organismo francés de la formación profesional)

Organismo público de carácter administrativo creado el 1 de enero de 2019 por la ley francesa del 5 de septiembre de 2018, única instancia de gobernanza nacional de la formación profesional y del aprendizaje. Su gobernanza es cuatripartita y sus misiones son financiar, regular y mejorar la oferta de formación.

Fuente: France compétences — su función

Bloc de compétences (bloque de competencias)

Según el Code du travail francés, conjunto homogéneo y coherente de competencias que contribuyen al ejercicio autónomo de una actividad profesional, y que puede ser evaluado y validado por separado. Cada certificación se define por un referencial de actividades, uno de competencias y uno de evaluación.

Fuente: Code du travail francés, artículo L6113-1

Modalités de contrôle des connaissances (normas francesas de evaluación universitaria)

Reglas de evaluación aprobadas por una institución de enseñanza superior. El Code de l'éducation francés prevé que se fijen como muy tarde al final del primer mes del curso y que no puedan modificarse después, y que la apreciación se haga por evaluación continua, por examen final o por ambos.

Fuente: Code de l'éducation francés, artículo L613-1

Hcéres (autoridad francesa de evaluación de la educación superior)

Haut Conseil de l'évaluation de la recherche et de l'enseignement supérieur, autoridad pública independiente francesa. Evalúa las instituciones de enseñanza superior, los organismos y unidades de investigación así como las formaciones y los títulos, con arreglo a una metodología de evaluación por pares.

Fuente: hceres.fr

CTI (comisión francesa de títulos de ingeniería)

Commission des titres d'ingénieur, organismo independiente encargado por la ley francesa desde 1934 de evaluar las escuelas de ingeniería con vistas a su acreditación, de desarrollar la calidad de las formaciones y de promover el título de ingeniero. Emite un dictamen para las escuelas públicas y una decisión para las privadas.

Fuente: cti-commission.fr

CEFDG (comisión francesa de evaluación de las formaciones de gestión)

Commission d'évaluation des formations et diplômes de gestion, única instancia nacional competente para evaluar la calidad de las formaciones de las escuelas de management privadas y consulares en Francia. Bajo doble tutela, examina los títulos homologados por el Estado y los que confieren el grado de licenciatura o de maestría.

Fuente: cefdg.fr

Minimización de los datos

Principio del RGPD según el cual, en la formulación de la CNIL, los datos de carácter personal deben ser adecuados, pertinentes y limitados a lo necesario en relación con los fines para los que se tratan. Aplicado a la supervisión remota, ordena recoger solo lo que justifica la prueba.

Fuente: CNIL — minimización

Evaluación de impacto (AIPD)

Análisis de impacto relativo a la protección de los datos: según la CNIL, una herramienta que permite construir un tratamiento conforme al RGPD y respetuoso con la vida privada. Se exige para los tratamientos que puedan generar un riesgo elevado para los derechos y libertades de las personas afectadas.

Fuente: CNIL — AIPD

Plazo de conservación

Tiempo durante el cual unos datos personales pueden permanecer en base activa. La CNIL recuerda que lo determina la finalidad del tratamiento: al término de ese plazo los datos deben suprimirse, anonimizarse o archivarse, lo que afecta directamente a las grabaciones de supervisión remota.

Fuente: CNIL — plazos de conservación

Preguntas frecuentes sobre el vocabulario de la evaluación

¿Cuál es la diferencia entre evaluación formativa y evaluación sumativa?

La diferencia está en la función, no en el formato. Una evaluación formativa interviene durante el aprendizaje y sirve para informar al alumno y al docente sobre los logros en curso de construcción: su producto útil es la retroalimentación. Una evaluación sumativa interviene al término de una secuencia para establecer un balance y producir una nota que cuenta. Un mismo cuestionario de opción múltiple puede servir para ambas.

¿Qué mide el índice de discriminación de una pregunta?

Mide la capacidad de una pregunta para distinguir a los candidatos fuertes de los débiles, comparando la tasa de acierto en ese ítem entre quienes obtienen las mejores puntuaciones globales y quienes obtienen las peores. Un índice nulo señala una pregunta que no aporta ninguna información; un índice negativo señala casi siempre una plantilla de corrección falsa o un enunciado ambiguo.

¿Debe una plataforma de examen cumplir el RGAA?

El RGAA se impone a los servicios digitales de los organismos públicos franceses y de ciertas empresas, en aplicación del artículo 47 de la ley del 11 de febrero de 2005. Una institución que realiza sus pruebas en una plataforma sigue siendo responsable de la accesibilidad del servicio que ofrece a sus estudiantes: la conformidad de la herramienta es, por tanto, un criterio de compra, y se comprueba en la declaración de accesibilidad publicada por el proveedor.

¿Qué aporta LTI 1.3 frente a una simple conexión con un LMS?

LTI 1.3 es un estándar de 1EdTech: la herramienta externa se lanza desde el LMS sin cuenta separada, y la seguridad del intercambio se apoya en OAuth 2.0 y en tokens JSON Web Token. Con los servicios LTI Advantage, el LMS transmite además la lista de matriculados y sus roles, y recupera automáticamente las notas en su cuaderno — algo que un simple hipervínculo no hace.

¿El tiers-temps está limitado a un tercio del tiempo de la prueba?

El Code de l'éducation francés prevé que el aumento del tiempo de prueba no pueda exceder el tercio del tiempo normalmente previsto. Una prolongación mayor sigue siendo posible con carácter excepcional, a petición motivada del médico que examina la situación del candidato. Es la autoridad administrativa que organiza el examen la que decide las adaptaciones concedidas y notifica su decisión al candidato.

Pon en práctica este vocabulario

Baremos por criterios, análisis de ítems, adaptaciones de tiempo: Evalmee da herramientas para lo que este glosario describe.