Articulo de referencia

Calificación automatizada de ensayos

La calificación automatizada de ensayos ( CAE ) consiste en el uso de programas informáticos especializados para asignar calificaciones a ensayos escritos en un contexto educati...

La calificación automatizada de ensayos ( CAE ) consiste en el uso de programas informáticos especializados para asignar calificaciones a ensayos escritos en un contexto educativo. Es una forma de evaluación educativa y una aplicación del procesamiento del lenguaje natural . Su objetivo es clasificar un gran conjunto de entidades textuales en un número reducido de categorías discretas, que corresponden a las posibles calificaciones, por ejemplo, de 1 a 6. Por lo tanto, puede considerarse un problema de clasificación estadística .

Diversos factores han contribuido al creciente interés en la evaluación del rendimiento académico. Entre ellos se encuentran el costo, la rendición de cuentas, los estándares y la tecnología. El aumento de los costos educativos ha generado presión para que el sistema educativo rinda cuentas de los resultados mediante la imposición de estándares. El avance de la tecnología de la información promete medir el rendimiento académico a un costo reducido.

El uso de AES para pruebas de alto impacto en la educación ha generado una importante reacción en contra, y los opositores señalan investigaciones que demuestran que las computadoras aún no pueden calificar la escritura con precisión y argumentan que su uso para tales fines promueve la enseñanza de la escritura de manera reduccionista (es decir, enseñar para el examen ).

Historia

La mayoría de los resúmenes históricos de AES rastrean los orígenes del campo hasta el trabajo de Ellis Batten Page . [ 1 ] En 1966, argumentó [ 2 ] a favor de la posibilidad de calificar ensayos por computadora, y en 1968 publicó [ 3 ] su exitoso trabajo con un programa llamado Project Essay Grade (PEG). Utilizando la tecnología de ese momento, la calificación computarizada de ensayos no habría sido rentable, [ 4 ] por lo que Page redujo sus esfuerzos durante aproximadamente dos décadas. Finalmente, Page vendió PEG a Measurement Incorporated .

Para 1990, las computadoras de escritorio se habían vuelto tan potentes y estaban tan extendidas que AES era una posibilidad práctica. Ya en 1982, un programa de UNIX llamado Writer's Workbench podía ofrecer consejos sobre puntuación, ortografía y gramática. [ 5 ] En colaboración con varias empresas (en particular Educational Testing Service), Page actualizó PEG y realizó algunas pruebas exitosas a principios de la década de 1990. [ 6 ]

Peter Foltz y Thomas Landauer desarrollaron un sistema que utiliza un motor de calificación llamado Intelligent Essay Assessor (IEA). IEA se utilizó por primera vez para calificar ensayos en 1997 para sus cursos de pregrado. [ 7 ] Actualmente es un producto de Pearson Educational Technologies y se utiliza para la calificación en varios productos comerciales y exámenes estatales y nacionales.

IntelliMetric es el motor AES de Vantage Learning. Su desarrollo comenzó en 1996. [ 8 ] Se utilizó comercialmente por primera vez para calificar ensayos en 1998. [ 9 ]

Educational Testing Service ofrece "e-rater", un programa automatizado para calificar ensayos. Se utilizó comercialmente por primera vez en febrero de 1999. [ 10 ] Jill Burstein fue la líder del equipo en su desarrollo. El servicio de evaluación de escritura en línea Criterion de ETS utiliza el motor de e-rater para proporcionar tanto calificaciones como retroalimentación específica.

Lawrence Rudner ha trabajado con la puntuación bayesiana y ha desarrollado un sistema llamado BETSY (Bayesian Essay Test Scoring System). [ 11 ] Algunos de sus resultados se han publicado en formato impreso o en línea, pero hasta el momento ningún sistema comercial incorpora BETSY.

Bajo el liderazgo de Howard Mitzel y Sue Lottridge, Pacific Metrics desarrolló CRASE, un motor de calificación automatizado para respuestas elaboradas. Actualmente utilizado por varios departamentos de educación estatales y en un proyecto financiado por el Departamento de Educación de los Estados Unidos para la Mejora de la Evaluación, la tecnología de Pacific Metrics se ha empleado en entornos de evaluación formativa y sumativa a gran escala desde 2007.

Measurement Inc. adquirió los derechos de PEG en 2002 y ha continuado desarrollándolo. [ 12 ]

En 2012, la Fundación Hewlett patrocinó una competición en Kaggle llamada Premio de Evaluación Automatizada de Estudiantes (ASAP). [ 13 ] 201 participantes del desafío intentaron predecir, utilizando AES, las puntuaciones que los evaluadores humanos darían a miles de ensayos escritos a partir de ocho indicaciones diferentes. El objetivo era demostrar que AES puede ser tan fiable como los evaluadores humanos, o incluso más. La competición también incluyó una demostración independiente entre nueve proveedores de AES en un subconjunto de los datos de ASAP. Aunque los investigadores informaron de que la calificación automatizada de ensayos era tan fiable como la calificación humana, [ 14 ] esta afirmación no se corroboró con ninguna prueba estadística porque algunos de los proveedores exigieron que no se realizaran tales pruebas como condición previa para su participación. [ 15 ] Además, la afirmación de que el Estudio Hewlett demostró que el AES puede ser tan fiable como los evaluadores humanos ha sido desde entonces fuertemente cuestionada, [ 16 ] [ 17 ] incluso por Randy E. Bennett , titular de la Cátedra Norman O. Frederiksen de Innovación en Evaluación en el Educational Testing Service . [ 18 ] Algunas de las principales críticas al estudio han sido que cinco de los ocho conjuntos de datos consistían en párrafos en lugar de ensayos, cuatro de los ocho conjuntos de datos fueron calificados por lectores humanos solo por contenido en lugar de por habilidad de escritura, y que en lugar de medir a los lectores humanos y las máquinas AES con respecto a la "puntuación verdadera", el promedio de las puntuaciones de los dos lectores, el estudio empleó una construcción artificial, la "puntuación resuelta", que en cuatro conjuntos de datos consistía en la más alta de las dos puntuaciones humanas si había un desacuerdo. Esta última práctica, en particular, dio a las máquinas una ventaja injusta al permitirles redondear hacia arriba para estos conjuntos de datos. [ 16 ]

En 1966, Page planteó la hipótesis de que, en el futuro, el juez basado en computadora estaría mejor correlacionado con cada juez humano que los otros jueces humanos. [ 2 ] A pesar de criticar la aplicabilidad de este enfoque a la calificación de ensayos en general, esta hipótesis fue respaldada para calificar respuestas de texto libre a preguntas cortas, como las típicas del sistema GCSE británico. [ 19 ] Los resultados del aprendizaje supervisado demuestran que los sistemas automáticos funcionan bien cuando la calificación de diferentes profesores humanos coincide. El agrupamiento no supervisado de respuestas mostró que los trabajos excelentes y los trabajos débiles formaban grupos bien definidos, y la regla de calificación automatizada para estos grupos funcionó bien, mientras que las calificaciones otorgadas por profesores humanos para el tercer grupo ("mixto") pueden ser controvertidas, y la confiabilidad de cualquier evaluación de trabajos del grupo "mixto" a menudo puede ser cuestionada (tanto por humanos como por computadora). [ 19 ]

Diferentes dimensiones de la calidad de un ensayo

Según una encuesta reciente, [ 20 ] los sistemas AES modernos intentan calificar diferentes dimensiones de la calidad de un ensayo para proporcionar retroalimentación a los usuarios. Estas dimensiones incluyen los siguientes elementos:

  • Gramaticalidad: seguir las reglas gramaticales
  • Uso: uso de preposiciones, uso de palabras
  • Mecánica: seguir las reglas de ortografía, puntuación y uso de mayúsculas.
  • Estilo: elección de palabras, variedad en la estructura de las oraciones.
  • Relevancia: qué tan relevante es el contenido para la consigna.
  • Organización: qué tan bien está estructurado el ensayo.
  • Desarrollo: desarrollo de ideas con ejemplos
  • Cohesión: uso apropiado de frases de transición
  • Coherencia: transiciones apropiadas entre ideas
  • Claridad de la tesis: claridad de la tesis
  • Persuasión: capacidad de convencer del argumento principal.

Procedimiento

Desde sus inicios, el procedimiento básico de AES ha consistido en comenzar con un conjunto de ensayos de entrenamiento cuidadosamente calificados manualmente. [ 21 ] El programa evalúa características superficiales del texto de cada ensayo, como el número total de palabras, el número de oraciones subordinadas o la proporción de mayúsculas y minúsculas ; cantidades que pueden medirse sin intervención humana. A continuación, construye un modelo matemático que relaciona estas cantidades con las calificaciones obtenidas por los ensayos. Este mismo modelo se aplica posteriormente para calcular las calificaciones de nuevos ensayos.

Recientemente, Isaac Persing y Vincent Ng crearon un modelo matemático de este tipo [ 22 ] que no solo evalúa los ensayos según las características mencionadas, sino también según la solidez de sus argumentos. Evalúa diversas características del ensayo, como el nivel de acuerdo del autor y las razones del mismo, la adhesión al tema de la consigna, la ubicación de los componentes argumentativos (tesis principal, argumento, premisa), los errores en los argumentos y la cohesión argumentativa, entre otras. A diferencia de los otros modelos mencionados, este se acerca más a la capacidad de replicar la intuición humana al calificar ensayos. Debido a la creciente popularidad de las redes neuronales profundas, se han adoptado enfoques de aprendizaje profundo para la calificación automatizada de ensayos, obteniendo generalmente resultados superiores, a menudo superando los niveles de acuerdo entre humanos [ 23 ] .

Los distintos programas AES difieren en las características superficiales específicas que miden, en la cantidad de ensayos necesarios en el conjunto de entrenamiento y, sobre todo, en la técnica de modelado matemático. Los primeros intentos emplearon regresión lineal . Los sistemas modernos pueden utilizar regresión lineal u otras técnicas de aprendizaje automático, a menudo en combinación con otras técnicas estadísticas como el análisis semántico latente [ 24 ] y la inferencia bayesiana [ 11 ] .

La tarea de calificación automatizada de ensayos también se ha estudiado en un contexto interdisciplinario mediante modelos de aprendizaje automático, donde los modelos se entrenan con ensayos escritos para un tema y se prueban con ensayos escritos para otro tema. Los enfoques exitosos en el escenario interdisciplinario se basan en redes neuronales profundas [ 25 ] o modelos que combinan características profundas y superficiales [ 26 ] .

Criterios de éxito

Todo método de evaluación debe juzgarse según su validez, imparcialidad y fiabilidad. [ 27 ] Un instrumento es válido si mide realmente el rasgo que pretende medir. Es imparcial si, en la práctica, no penaliza ni privilegia a ningún grupo de personas. Es fiable si su resultado es reproducible, incluso cuando se modifican factores externos irrelevantes.

Antes de la llegada de los ordenadores, los ensayos importantes solían ser calificados por dos evaluadores humanos capacitados. Si las calificaciones diferían en más de un punto, un tercer evaluador con más experiencia resolvía la discrepancia. En este sistema, existe una forma sencilla de medir la fiabilidad: mediante el acuerdo entre evaluadores . Si los evaluadores no coinciden de forma consistente con una diferencia máxima de un punto, su formación podría ser deficiente. Si un evaluador discrepa sistemáticamente con la forma en que otros evaluadores califican los mismos ensayos, probablemente necesite formación adicional.

Se han propuesto varias estadísticas para medir el acuerdo entre evaluadores. Entre ellas se encuentran el porcentaje de acuerdo, el coeficiente π de Scott , el coeficiente κ de Cohen , el coeficiente α de Krippendorf , el coeficiente de correlación de Pearson r , el coeficiente de correlación de rangos de Spearman ρ y el coeficiente de correlación de concordancia de Lin .

El porcentaje de acuerdo es una estadística simple aplicable a escalas de calificación con puntuaciones de 1 a n, donde generalmente 4 ≤ n ≤ 6. Se informa como tres cifras, cada una como un porcentaje del número total de ensayos calificados: acuerdo exacto (los dos evaluadores dieron al ensayo la misma puntuación), acuerdo adyacente (los evaluadores difirieron en un máximo de un punto; esto incluye el acuerdo exacto) y desacuerdo extremo (los evaluadores difirieron en más de dos puntos). Se encontró que los evaluadores humanos expertos lograron un acuerdo exacto en el 53 % al 81 % de todos los ensayos, y un acuerdo adyacente en el 97 % al 100 %. [ 28 ]

Ahora se puede aplicar la concordancia entre evaluadores para medir el rendimiento de la computadora. Se entrega un conjunto de ensayos a dos evaluadores humanos y a un programa AES. Si las puntuaciones asignadas por la computadora coinciden con las de uno de los evaluadores humanos, y además existe concordancia entre los evaluadores, se considera que el programa AES es fiable. Alternativamente, a cada ensayo se le asigna una "puntuación verdadera" calculando el promedio de las puntuaciones de los dos evaluadores humanos, y se comparan las puntuaciones de ambos con las de la computadora en función de su concordancia con dicha puntuación verdadera.

Algunos investigadores han informado que sus sistemas AES pueden, de hecho, hacerlo mejor que un humano. Page hizo esta afirmación para PEG en 1994. [ 6 ] Scott Elliot dijo en 2003 que IntelliMetric generalmente superaba a los evaluadores humanos. [ 8 ] Sin embargo, las máquinas AES parecen ser menos confiables que los lectores humanos para cualquier tipo de prueba de escritura compleja. [ 29 ]

En la práctica actual, las evaluaciones de alto riesgo como el GMAT siempre son calificadas por al menos un evaluador humano. El AES se utiliza en lugar de un segundo evaluador. Un evaluador humano resuelve cualquier desacuerdo de más de un punto. [ 30 ]

Crítica

AES ha sido criticado por varios motivos. Yang et al . mencionan "la excesiva dependencia de las características superficiales de las respuestas, la insensibilidad al contenido de las respuestas y a la creatividad, y la vulnerabilidad a nuevos tipos de trampas y estrategias para realizar exámenes". [ 30 ] Varios críticos están preocupados de que la motivación de los estudiantes disminuya si saben que ningún ser humano leerá sus escritos. [ 31 ] Entre las críticas más reveladoras se encuentran los informes de ensayos intencionalmente incoherentes que recibieron altas calificaciones. [ 32 ]

Petición de HumanReaders.Org

El 12 de marzo de 2013, HumanReaders.Org lanzó una petición en línea titulada «Profesionales contra la calificación automática de ensayos estudiantiles en evaluaciones de alto impacto». En pocas semanas, la petición obtuvo miles de firmas, incluyendo la de Noam Chomsky , [ 33 ] y fue citada en varios periódicos, como The New York Times , [ 34 ] y en diversos blogs de educación y tecnología. [ 35 ]

La petición describe el uso de AES para pruebas de alto riesgo como "trivial", "reduccionista", "inexacto", "no diagnóstico", "injusto" y "secreto". [ 36 ]

En un resumen detallado de la investigación sobre AES, el sitio de la petición señala: "LOS RESULTADOS DE LA INVESTIGACIÓN DEMUESTRAN QUE nadie —estudiantes, padres, maestros, empleadores, administradores, legisladores— puede confiar en la calificación automática de ensayos... Y QUE la calificación automática no mide, y por lo tanto no promueve, actos auténticos de escritura". [ 37 ]

La petición aborda específicamente el uso de AES para pruebas de alto riesgo y no dice nada sobre otros posibles usos.

Software

La mayoría de los recursos para la calificación automatizada de ensayos son de propiedad privada.

Referencias

  1. Page, EB (2003). "Calificación del ensayo del proyecto: PEG", pág. 43. En Shermis, Mark D., y Jill Burstein, eds., Calificación automatizada de ensayos: una perspectiva interdisciplinaria . Lawrence Erlbaum Associates, Mahwah, Nueva Jersey, ISBN 0805839739- Larkey, Leah S., y W. Bruce Croft (2003). «Un enfoque de categorización de texto para la calificación automatizada de ensayos», pág. 55. En Shermis, Mark D., y Jill Burstein, eds. Calificación automatizada de ensayos: una perspectiva interdisciplinaria . Lawrence Erlbaum Associates, Mahwah, Nueva Jersey, ISBN 0805839739- Keith, Timothy Z. (2003). "Validez de los sistemas automatizados de calificación de ensayos", pág. 153. En Shermis, Mark D., y Jill Burstein, eds., Calificación automatizada de ensayos: una perspectiva interdisciplinaria . Lawrence Erlbaum Associates, Mahwah, Nueva Jersey, ISBN 0805839739- Shermis, Mark D., Jill Burstein y Claudia Leacock (2006). «Aplicaciones de las computadoras en la evaluación y el análisis de la escritura», pág. 403. En MacArthur, Charles A., Steve Graham y Jill Fitzgerald, eds., Manual de investigación sobre la escritura . Guilford Press, Nueva York, ISBN 1-59385-190-1- Attali, Yigal, Brent Bridgeman y Catherine Trapani (2010). "Rendimiento de un enfoque genérico en la calificación automatizada de ensayos", pág. 4. Journal of Technology, Learning, and Assessment , 10 (3) - Wang, Jinhao y Michelle Stallone Brown (2007). "Calificación automatizada de ensayos versus calificación humana: un estudio comparativo", pág. 6. Journal of Technology, Learning, and Assessment , 6 (2) - Bennett, Randy Elliot y Anat Ben-Simon (2005). "Hacia una calificación automatizada de ensayos teóricamente significativa" Archivado el 7 de octubre de 2007 en Wayback Machine , pág. 6. Recuperado el 19 de marzo de 2012-.
  2. 1 2 Page, EB (1966). "La inminencia de... calificar ensayos por computadora". The Phi Delta Kappan . 47 (5): 238– 243. JSTOR 20371545 . 
  3. Page, EB (1968). "El uso de la computadora en el análisis de ensayos estudiantiles", Revista Internacional de Educación , 14 (3), 253-263.
  4. Page, EB (2003), págs. 44-45.
  5. MacDonald, NH, LT Frase, PS Gingrich y SA Keenan (1982). "The Writers Workbench: Computer Aids for Text Analysis", IEEE Transactions on Communications , 3 (1), 105-110.
  6. 1 2 Page, EB (1994). "Nueva calificación computarizada de la prosa estudiantil, utilizando conceptos y software modernos", Journal of Experimental Education , 62 (2), 127-142.
  7. Rudner, Lawrence. "Tres programas destacados de evaluación de la escritura". Archivado el 9 de marzo de 2012 en Wayback Machine . Consultado el 6 de marzo de 2012.
  8. 1 2 Elliot, Scott (2003). "Intellimetric TM: De aquí a la validez", pág. 75. En Shermis, Mark D., y Jill Burstein, eds., Calificación automatizada de ensayos: Una perspectiva interdisciplinaria . Lawrence Erlbaum Associates, Mahwah, Nueva Jersey, ISBN 0805839739
  9. " IntelliMetric®: Cómo funciona ", Vantage Learning. Consultado el 28 de febrero de 2012.
  10. Burstein, Jill (2003). «El motor de calificación E-rater(R): calificación automatizada de ensayos con procesamiento del lenguaje natural», pág. 113. En Shermis, Mark D., y Jill Burstein, eds., Calificación automatizada de ensayos: una perspectiva interdisciplinaria . Lawrence Erlbaum Associates, Mahwah, Nueva Jersey, ISBN 0805839739
  11. 1 2 Rudner, Lawrence (ca. 2002). "Calificación computarizada mediante redes bayesianas: descripción general". Archivado el 8 de marzo de 2012 en Wayback Machine . Recuperado el 7 de marzo de 2012.
  12. "Tecnologías de evaluación" Archivado el 29 de diciembre de 2011 en Wayback Machine , Measurement Incorporated. Recuperado el 9 de marzo de 2012.
  13. Premio Hewlett" Archivado el 30 de marzo de 2012 en Wayback Machine . Consultado el 5 de marzo de 2012.
  14. "El hombre y la máquina: Mejores escritores, mejores calificaciones" . Universidad de Akron. 12 de abril de 2012. Consultado el 4 de julio de 2015 .- Shermis, Mark D., y Jill Burstein, eds. Manual de evaluación automatizada de ensayos: aplicaciones actuales y nuevas direcciones . Routledge, 2013.
  15. Rivard, Ry (15 de marzo de 2013). "Los humanos se pelean por los lectores robóticos" . Inside Higher Ed . Recuperado el 14 de junio de 2015 .
  16. 1 2 Perelman, Les (agosto de 2013). "Crítica de Mark D. Shermis y Ben Hamner, "Análisis de los sistemas automatizados de calificación de ensayos de última generación contrastantes"" . Revista de Evaluación de la Escritura . 6 (1) . Consultado el 13 de junio de 2015 .
  17. Perelman, L. (2014). "Cuando 'el estado del arte es contar palabras'", Assessing Writing , 21 , 104-111.
  18. Bennett, Randy E. (marzo de 2015). "La naturaleza cambiante de la evaluación educativa". Review of Research in Education . 39 (1): 370– 407. doi : 10.3102/0091732X14554179 . S2CID 145592665 . 
  19. 1 2 Süzen, N.; Mirkes, EM; Levesley, J; Gorban, AN (2020). "Calificación y retroalimentación automáticas de respuestas cortas mediante métodos de minería de texto" . Procedia Computer Science . 169 : 726–743 . arXiv : 1807.10543 . doi : 10.1016/j.procs.2020.02.171 .
  20. Ke, Zixuan (9 de agosto de 2019). «Evaluación automatizada de ensayos: una revisión del estado del arte» (PDF) . Actas de la Vigésimo Octava Conferencia Internacional Conjunta sobre Inteligencia Artificial . págs. 6300–6308 . doi : 10.24963/ijcai.2019/879 . ISBN  978-0-9992411-4-1. Consultado el 11 de abril de 2020 .
  21. Keith, Timothy Z. (2003), pág. 149.
  22. Persing, Isaac y Vincent Ng (2015). «Modelado de la fuerza argumentativa en ensayos estudiantiles» , págs. 543-552. En Actas de la 53.ª Reunión Anual de la Asociación de Lingüística Computacional y la 7.ª Conferencia Internacional Conjunta sobre Procesamiento del Lenguaje Natural (Volumen 1: Artículos extensos) . Consultado el 22 de octubre de 2015.
  23. Yang, Ruosong; Cao, Jiannong; Wen, Zhiyuan; Wu, Youzheng; He, Xiaodong (2020). "Mejora del rendimiento de la calificación automatizada de ensayos mediante el ajuste fino de modelos de lenguaje preentrenados con una combinación de regresión y clasificación" . Hallazgos de la Asociación para la Lingüística Computacional: EMNLP 2020. En línea: Asociación para la Lingüística Computacional: 1560–1569 . doi : 10.18653/v1/2020.findings-emnlp.141 . hdl : 10397/105512 . S2CID 226299478 . 
  24. Bennett, Randy Elliot y Anat Ben-Simon (2005), pág. 7.
  25. Cao, Yue; Jin, Hanqi; Wan, Xiaojun; Yu, Zhiwei (25 de julio de 2020). "Calificación automatizada de ensayos neuronal adaptativa al dominio" . Actas de la 43.ª Conferencia Internacional ACM SIGIR sobre Investigación y Desarrollo en Recuperación de Información . SIGIR '20. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 1011–1020 . doi : 10.1145/3397271.3401037 . ISBN  978-1-4503-8016-4. S2CID 220730151 . 
  26. Cozma, Mădălina; Butnaru, Andrei; Ionescu, Radu Tudor (2018). "Calificación automatizada de ensayos con núcleos de cadenas e incrustaciones de palabras" . Actas de la 56.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 2: Artículos breves) . Melbourne, Australia: Asociación de Lingüística Computacional: 503–509 . arXiv : 1804.07954 . doi : 10.18653/v1/P18-2080 . S2CID 5070986 . 
  27. Chung, Gregory KWK y Eva L. Baker (2003). «Problemas de fiabilidad y validez de la calificación automatizada de respuestas construidas», pág. 23. En: Calificación automatizada de ensayos: una perspectiva interdisciplinaria . Shermis, Mark D. y Jill Burstein, eds. Lawrence Erlbaum Associates, Mahwah, Nueva Jersey, ISBN 0805839739
  28. Elliot, Scott (2003), pág. 77.- Burstein, Jill (2003), pág. 114.
  29. Bennett, Randy E. (mayo de 2006). "Tecnología y evaluación de la escritura: lecciones aprendidas de la Evaluación Nacional del Progreso Educativo de EE. UU." (PDF) . Asociación Internacional para la Evaluación Educativa . Archivado del original (PDF) el 24 de septiembre de 2015. Recuperado el 5 de julio de 2015 .- McCurry, D. (2010). "¿Puede la calificación automática manejar pruebas de escritura amplias y abiertas tan bien como los lectores humanos?". Assessing Writing . 15 (2): 118– 129. doi : 10.1016/j.asw.2010.04.002 .- R. Bridgeman (2013). Shermis, Mark D.; Burstein, Jill (eds.). Manual de evaluación automatizada de ensayos . Nueva York: Routledge. págs. 221–232 . 
  30. 1 2 Yang, Yongwei, Chad W. Buckendahl, Piotr J. Juszkiewicz y Dennison S. Bhola (2002). "Una revisión de estrategias para validar la puntuación automatizada por computadora". Archivado el 13 de enero de 2016 en Wayback Machine , Applied Measurement in Education , 15 (4). Recuperado el 8 de marzo de 2012.
  31. Wang, Jinhao y Michelle Stallone Brown (2007), págs. 4-5.- Dikli, Semire (2006). "Una visión general de la calificación automatizada de ensayos" Archivado el 8 de abril de 2013 en Wayback Machine , Journal of Technology, Learning, and Assessment , 5 (1)- Ben-Simon, Anat (2007). "Introducción a la calificación automatizada de ensayos (AES)", presentación de PowerPoint, Tiflis, Georgia, septiembre de 2007.
  32. Winerip, Michael (22 de abril de 2012). "¿Enfrentando una niveladora robótica? Simplemente siga ofuscándose melifluamente" . The New York Times . Recuperado el 5 de abril de 2013 .
  33. "Firmas >> Profesionales en contra de la calificación automática de ensayos estudiantiles en evaluaciones de alto riesgo" . HumanReaders.Org . Archivado del original el 18 de noviembre de 2019. Consultado el 5 de abril de 2013 .
  34. Markoff, John (4 de abril de 2013). "El software de calificación de ensayos ofrece un respiro a los profesores" . The New York Times . Consultado el 5 de abril de 2013 .- Garner, Richard (5 de abril de 2013). "Profesores indignados por ensayos corregidos por ordenador" . The Independent . Consultado el 5 de abril de 2013 .
  35. Corrigan, Paul T. (25 de marzo de 2013). "Petición contra la calificación automática de ensayos, HumanReaders.Org" . Enseñanza y aprendizaje en la educación superior . Recuperado el 5 de abril de 2013 .- Jaffee, Robert David (5 de abril de 2013). "Las computadoras no pueden leer, escribir ni calificar trabajos" . Huffington Post . Consultado el 5 de abril de 2013 .
  36. "Profesionales en contra de la calificación automática de ensayos estudiantiles en evaluaciones de alto riesgo" . HumanReaders.Org . Consultado el 5 de abril de 2013 .
  37. "Resultados de la investigación >> Profesionales en contra de la calificación automática de ensayos estudiantiles en evaluaciones de alto riesgo" . HumanReaders.Org . Consultado el 5 de abril de 2013 .- "Referencias bibliográficas >> Profesionales en contra de la calificación automática de ensayos estudiantiles en evaluaciones de alto riesgo" . HumanReaders.Org . Consultado el 5 de abril de 2013 .
  38. "Tecnologías de evaluación" Archivado el 24 de febrero de 2019 en Wayback Machine , Measurement, Inc.