Resumen
La evaluación automática de la escritura se ha consolidado como una alternativa prometedora para agilizar y mejorar la retroalimentación en el aprendizaje a causa del desarrollo de la Inteligencia Artificial Generativa (IAG) con los Grandes Modelos de Lenguaje (LLM) como ChatGPT de OpenAI. De este modo, la retroalimentación formativa que proporcionan las IAs tienen el potencial de influir en la autorregulación y la mejora continua del desempeño académico del estudiantado. De acuerdo con este contexto, el objetivo de este trabajo es determinar el grado de fiabilidad interjueces en la evaluación de ensayos argumentativos realizada por modelos de lenguaje (GPTo3-mini-high y GPT-4), comparándola con la evaluación de un experto humano mediante la rúbrica analítica RUBRIAR. Se utilizó un enfoque cuantitativo para determinar el grado de concordancia entre las evaluaciones realizadas por el experto y las realizadas por los modelos ChatGPT personalizados en 46 ensayos argumentativos escritos por estudiantes universitarios de primer año. Los hallazgos revelan que la evaluación efectuada por los LLM es similar a la del humano experto, especialmente en la dimensión de ajuste al género en la subdimensión de propósito comunicativo. Sin embargo, hay una baja precisión en las relaciones de cohesión y coherencia, así como con el ajuste a las normas de la lengua. Se concluye que es fundamental incorporar un enfoque pedagógico que promueva un uso intencionado, reflexivo y ético de herramientas de IA, particularmente durante los primeros años de la educación superior, cuando los estudiantes están construyendo las bases de sus competencias académicas.
Palabras clave:
Evaluación de la escritura; Inteligencia Artificial Generativa; Ensayo; Calidad de la escritura
Resumo
A avaliação automatizada da escrita manual consolidou-se como uma alternativa promissora para otimizar e aprimorar o feedback no aprendizado, graças ao desenvolvimento da Inteligência Artificial Generativa (IAG) com Grandes Modelos de Linguagem (MLLs), como o ChatGPT da OpenAI. Dessa forma, o feedback formativo fornecido pelas IAs tem o potencial de influenciar a autorregulação e a melhoria contínua do desempenho acadêmico dos alunos. De acordo com este contexto, o objetivo deste trabalho é determinar o grau de confiabilidade interjuízes na avaliação de ensaios argumentativos realizada por modelos de linguagem (GPTo3-mini-high e GPT-4), comparando-a com a avaliação de um especialista humano por meio da rubrica analítica RUBRIAR. Utilizou-se uma abordagem quantitativa para determinar o grau de concordância entre as avaliações realizadas pelo especialista e as realizadas pelos modelos ChatGPT personalizados em 46 ensaios argumentativos escritos por estudantes universitários do primeiro ano. Os resultados revelam que a avaliação feita pelos LLM é semelhante à do especialista humano, especialmente na dimensão de ajuste ao gênero na subdimensão de propósito comunicativo. No entanto, há uma baixa precisão nas relações de coesão e coerência, bem como no ajuste às normas da língua. Conclui-se que é essencial incorporar uma abordagem pedagógica que promova o uso intencional, reflexivo e ético das ferramentas de IA, particularmente durante os primeiros anos do ensino superior, quando os alunos estão construindo as bases de suas competências acadêmicas.
Palavras-chave:
Avaliação da escrita; Inteligência Artificial Generativa; Ensaio; Qualidade da escrita
Abstract
Automated handwriting assessment has established itself as a promising alternative to streamline and improve feedback in learning due to the development of Generative Artificial Intelligence (GAI) with Large Language Models (LLMs) such as OpenAI’s ChatGPT. Thus, the formative feedback provided by AI has the potential to influence self-regulation and continuous improvement in student academic performance. In this context, the objective of this study is to determine the degree of inter-rater reliability in the evaluation of argumentative essays performed by language models (GPTo3-mini-high and GPT-4), comparing it with the evaluation of a human expert using the RUBRIAR analytical rubric. A quantitative approach was used to determine the degree of agreement between the evaluations made by the expert and those made by the customized ChatGPT models on 46 argumentative essays written by first-year university students. The findings reveal that the evaluation performed by the LLMs is similar to that of the human expert, especially in the dimension of gender adjustment in the subdimension of communicative purpose. However, there is low accuracy in cohesion and coherence relationships, as well as in conformity with language norms. It is concluded that it is essential to incorporate a pedagogical approach that promotes an intentional, reflective, and ethical use of AI tools, particularly during the early years of higher education, when students are building the foundations of their academic competencies.
Keywords:
Writing assessment; Generative Artificial Intelligence; Essay; Writing quality
1 Introducción
Evaluar la escritura constituye una de las tareas más complejas y demandantes dentro del proceso de enseñanza porque compromete analizar, juzgar y emitir valoraciones fundamentadas sobre la calidad textual de los escritos del estudiantado (Prado y Pérez, 2021). Esta tarea no solo exige la evaluación y corrección de errores, sino que implica una comprensión profunda de los procesos cognitivos, discursivos y lingüísticos relacionados con la producción escrita (Hayes, 2012). En el contexto universitario, la evaluación adquiere un nivel adicional de complejidad, tanto por el elevado volumen de textos que deben revisarse como por la necesidad de aplicar criterios que garanticen equidad, validez y fiabilidad en los juicios emitidos (Carless y Winstone, 2020; Tardy; Sommer-Farías y Gevers, 2020). De este modo, la evaluación escrita cumple una doble función: por un lado, tiene un carácter certificador, al determinar el nivel de logro alcanzado; y, por otro, un carácter formativo, pues promueve la autorregulación y la conciencia metacognitiva al permitir la reflexión sobre el propio desempeño (Kloss; Tapia-Ladino y Sagredo Ortiz, 2025; Kloss y Quintanilla, 2023; Castelló et al., 2011).
Aunque el ámbito educativo demanda respuestas cada vez más individualizadas y personalizadas, los recursos de tiempo y personal siguen siendo limitados (Sologuren y Morgado, 2023). En este escenario, el reciente auge de los modelos de lenguaje basados en inteligencia artificial (IA) ha generado un terreno fértil para la innovación pedagógica (Unesco, 2024). En particular, los avances en modelos de lenguaje de gran escala (LLM) ofrecen nuevas posibilidades para analizar y valorar textos escritos con niveles de coherencia y pertinencia sofisticados. Las denominadas IA generativas se distinguen por su capacidad para producir, sintetizar, reformular y evaluar información de manera autónoma, posicionándose como potenciales aliados en los procesos de revisión y evaluación de la escritura académica (Poole y Coss, 2024).
En la última década, los modelos de lenguaje basados en IA no solo se han expandido con rapidez, sino que han comenzado a transformar prácticas concretas, entre ellas la evaluación y la retroalimentación de la escritura. Su incorporación en estos procesos ha abierto nuevas vías metodológicas como el análisis inmediato, la personalización de comentarios y el apoyo al desarrollo de competencias escritas, lo que explica el interés que han despertado en la comunidad científica (Ossa y Willatt, 2023; Poole y Coss, 2024; Teng y Ma, 2024; Teng, 2025; García-Fernández; Jodar-Jurado y Sánchez-Morillas, 2025).
Durante la última década, la expansión de los LLM ha transformado múltiples ámbitos de la vida social y profesional. En este sentido, el campo educativo no ha sido una excepción (Mateo-Girona; Kloss y Lillo-Fuentes, 2025). Numerosas investigaciones han explorado su potencial en la enseñanza de la escritura, particularmente en la automatización de tareas tradicionalmente manuales, como la retroalimentación escrita (Teng, 2025; Poole y Coss, 2024; Ossa y Willatt, 2023; Venegas y Cerda, 2022). En la enseñanza de segundas lenguas, por ejemplo, el enfoque Automated Writing Evaluation (AWE) ha integrado sistemas de IA en procesos de valoración y feedback, con el propósito de ofrecer comentarios inmediatos y personalizados (Teng, 2024, 2025). Estos avances han demostrado que la tecnología puede ampliar las oportunidades de práctica y apoyo, al mismo tiempo que reduce la carga docente asociada a la revisión.
Si bien la investigación desarrollada en este ámbito ha aumentado, la mayoría de los estudios se ha concentrado en la retroalimentación formativa, mientras que el uso de la IA en la evaluación propiamente dicha ha recibido menor atención. En otras palabras, el proceso de juzgar la calidad del texto conforme a criterios explícitos y estandarizados aún carece de investigación empírica lo suficientemente robusta.
Persisten, por tanto, interrogantes acerca de la precisión, consistencia y legitimidad de las evaluaciones automatizadas frente a las emitidas por expertos humanos, sobre todo en géneros académicos como el ensayo argumentativo. Investigar sobre el ensayo es un nicho que merece la pena cubrir porque es uno de los más demandados en educación superior (Kloss y Burdiles, 2024) y por sus características, entre las que destaca su organización retórica, la riqueza de su argumentación, la brevedad y la interpretación apoyada en el uso de fuentes teóricas adecuadas (Zunino y Muraca, 2012). Además, ofrece a los estudiantes la oportunidad de identificar un problema, adoptar una postura y desarrollarla desde una perspectiva crítica y reflexiva (Kloss; Burdiles y Olguín, 2025), lo que refuerza la necesidad de comprender cómo los sistemas automatizados evalúan su calidad.
El presente estudio tiene por objetivo determinar el grado de fiabilidad interjueces en la evaluación de ensayos argumentativos realizada por modelos de lenguaje (GPTo3-mini-high y GPT-4), comparándola con la evaluación de un experto humano mediante la rúbrica analítica RUBRIAR (Kloss y Burdiles, 2024) como instrumento de referencia. Se adoptó un enfoque cuantitativo orientado a identificar el grado de concordancia entre la evaluación realizada por expertos y aquellas generadas por dos modelos: (a) un GPT personalizado (GPT-4) y (b) el modelo GPT-o3-mini-high, un modelo razonador que emplea mayor tiempo de cómputo antes de emitir su respuesta; ambos configurados mediante prompt engineering para incorporar instrucciones y conocimientos específicos sobre la evaluación. El análisis se efectuó sobre un corpus de 46 ensayos argumentativos producidos por estudiantes de primer año de universidad.
2 Metodología
El estudio se enmarca en un enfoque cuantitativo, de carácter comparativo y correlacional, que permitió medir el grado de concordancia entre modelos de lenguaje generativos y un evaluador humano.
2.1 Corpus
El corpus estuvo compuesto por 46 ensayos argumentativos redactados por estudiantes de primer año de una universidad chilena del ámbito de las Ciencias Sociales. La extensión de cada texto tuvo un promedio de 2500 palabras, por lo que el corpus total se constituyó por 115 000 palabras.
2.2 Instrumentos
Se aplicó la rúbrica analítica RUBRIAR (Kloss y Burdiles, 2024). Esta se organiza mediante cuatro dimensiones: ajuste al género discursivo del ensayo, organización retórica del ensayo académico, relaciones de cohesión y coherencia, y ajuste a las normas de la lengua. Además, se consideraron diecisiete subdimensiones, las que en su conjunto permitieron valorar la calidad de los ensayos argumentativos (ver Tabla 1). Cabe destacar que tanto el experto humano como los modelos de lenguaje aplicaron la rúbrica revisando sistemáticamente cada subdimensión de manera independiente por cada uno de los 46 ensayos revisados, asignando puntajes en una escala de 0 a 5. La evaluación realizada por el experto humano fue auditada por el equipo de investigación, quienes mediante la revisión exhaustiva de cada indicador con el texto y el puntaje asignado, lograron un nivel de acuerdo casi perfecto (k=.81). En cuanto a la evaluación realizada por los modelos de lenguaje, esta se realizó mediante un prompt (ver Anexo A).
2.3 Procedimiento
Para la realización del estudio, se adoptaron ciertas consideraciones técnicas vinculadas al uso de los GPTs. En este caso, se optó por llevar a cabo el análisis de manera manual con el propósito de mantener la interacción lo más cercana posible a una experiencia de uso natural. Esta decisión también respondió al interés de obtener resultados representativos de los modelos, considerando cómo respondería en un contexto de interacción directa y específica con cada usuario. Aunque habría sido posible automatizar el proceso mediante el empleo de la API o el uso de la interfaz de programación, se decidió utilizar la plataforma web de ChatGPT, ingresando y procesando cada texto individualmente. Esta decisión metodológica permitió observar con mayor fidelidad la interacción entre usuario y sistema para garantizar la autenticidad de las respuestas generadas y la validez ecológica del estudio.
Para esta investigación, se utilizó la herramienta de GPT Personalizado (GPT-4) que permite la combinación de instrucciones y conocimientos adicionales y GPT-o3-mini-high. Para la construcción del prompt se siguió la técnica de Prompt engineering específica de OpenAI que sugiere entregar a ChatGPT un procedimiento paso a paso. Para la creación del prompt, primero se le asignó un rol al modelo, en este caso el de un asistente académico especializado en analizar y calificar ensayos argumentativos de estudiantes universitarios del ámbito de Ciencias Sociales. Segundo, se le solicitó al modelo ejecutar una tarea específica: realizar la revisión de los ensayos mediante la rúbrica RUBRIAR (Kloss y Burdiles, 2024), la que se compone de cuatro dimensiones y de diecisiete subdimensiones. Cabe destacar que cada una de estas dimensiones y subdimensiones fueron desglosadas dentro del prompt, con el fin de facilitar la comprensión y aplicación de los criterios de evaluación por parte de la IA. Además, se le indicó a los modelos de lenguaje que asignaran un puntaje en una escala de 0 a 5 por subdimensión, explicitando dentro del prompt el significado de cada valor de la escala (0, 1, 2, 3, 4 y 5), donde 0 corresponde a una subdimensión ausente en el texto y 5 un desempeño destacado. Tercero, se presentaron las instrucciones para seguir en el análisis, tales como: leer detalladamente cada ensayo, evaluar con máximo rigor cada subdimensión o consultar modelos de referencia proporcionados para la revisión. Cuarto, se presentó la escala de evaluación por cada subdimensión. Quinto, se le solicitó generar una retroalimentación que destaque aspectos positivos y por mejorar para cada subdimensión. De carácter opcional, se especificaron las instrucciones para la generación de un archivo en Excel con la revisión. Posteriormente, se entregaron algunas orientaciones para una evaluación justa siguiendo lineamientos para las calificaciones críticas, es decir, que se evalúe lo que se plantea medir sin subsidiar áreas deficitarias, y, finalmente, se le proporcionó un ejemplo de interacción con la salida esperada (Ver Anexo A).
Es importante señalar que el diseño del prompt incorporó principios de prompt engineering y se adaptó a las necesidades específicas del chatbot con el fin de obtener resultados con mayor precisión. Para ello se realizó una revisión basada en quince ensayos argumentativos, lo que permitió evaluar el prompt original y verificar su claridad, coherencia, especificidad y eficacia para producir la respuesta esperada por el modelo. Tras este análisis, el prompt fue ajustado y optimizado con el objetivo de mejorar la calidad, precisión y relevancia de las revisiones, desde la contextualización hasta un refinamiento estructural y lingüístico.
2.4 Análisis de datos
Una vez realizadas las correcciones por parte del evaluador experto y auditados por el equipo de investigación, los puntajes asignados fueron ingresados a una base de datos para el análisis estadístico, en la que se agrupó la puntuación por dimensión y también de manera global. Este procedimiento se repitió con los dos evaluadores automáticos. En relación con los análisis estadísticos, estos fueron realizados con los software JAMOVI 2.3.28 y JASP; este último utiliza el entorno estadístico de R.
Se procedió con la siguiente estructura de análisis: en primer lugar, se levantaron análisis de estadística descriptiva, para cada dimensión y corrector, incluyendo las medias, desviación estándar, varianza y normalidad de los datos mediante la prueba de Shapiro-Wilk (Razali y Wah, 2011).
En segundo lugar, se evaluó la fiabilidad general entre los tres correctores, mediante el análisis del Coeficiente de Correlación Intraclase (ICC) (Shrout y Fleiss, 1979; Koo y Li, 2016), proceso replicado para los resultados de cada dimensión de la rúbrica. Se seleccionó el modelo de efectos aleatorios bidireccional para el acuerdo promedio (ICC2k), ya que se busca evaluar la intercambiabilidad de las puntuaciones de los tres correctores. Para complementar el análisis de fiabilidad y examinar el acuerdo entre correctores, se empleó el análisis de Bland-Altman (Giavarina, 2015) con el propósito de determinar el sesgo sistemático y los límites de acuerdo.
Finalmente, para evaluar el efecto del corrector en las dimensiones de las puntuaciones asignadas, se realizó un ANOVA de medidas repetidas. Este análisis incluyó al factor “corrector” y al factor “dimensiones”, al considerar que cada aspecto de la rúbrica fue evaluado de manera repetida por tres correctores. Para realizar el análisis se verificaron los supuestos de esfericidad mediante la prueba de Mauchly y corrección de grados de libertad de Greenhouse-geisser. Por otro lado, se aplicaron comparaciones post hoc para identificar las diferencias específicas.
3 Resultados
Las puntuaciones otorgadas por cada evaluador a los ensayos corregidos (N=46) fueron desagregadas en variables independientes según cada dimensión de la rúbrica analítica utilizada en el estudio. En consecuencia, se consideraron los puntajes correspondientes a: (a) Ajuste al género discursivo ensayo (dimensión 1), (b) Organización retórica del ensayo académico (dimensión 2), (c) Relaciones de cohesión y coherencia (dimensión 3) y (d) Ajuste a las normas de la lengua (dimensión 4), así como la puntuación global asignada a cada texto por cada tipo de evaluador.
La Tabla 2 presenta los estadísticos descriptivos de dichas puntuaciones en función del tipo de evaluador (agentes de Inteligencia Artificial y experto humano), incluyendo el tamaño muestral (N=46), la media, la desviación estándar y la varianza. Asimismo, se incorporan los resultados de la prueba de normalidad de Shapiro-Wilk (estadístico W y valor p) con el objetivo de evaluar el cumplimiento del supuesto de normalidad de las distribuciones, requisito relevante para la selección de pruebas inferenciales posteriores (ver Tabla 2).
El análisis descriptivo permitió observar, por una parte, tendencias centrales y niveles de dispersión de las puntuaciones asignadas por cada evaluador en cada dimensión de la rúbrica y, por otra, identificar diferencias en la forma de las distribuciones entre evaluadores y dimensiones. En particular, los resultados de la prueba de Shapiro-Wilk evidencian que la normalidad no se cumple de manera consistente en todas las dimensiones ni para todos los evaluadores, especialmente en las dimensiones asociadas a aspectos de relaciones de cohesión y coherencia, y aspectos normativos (dimensiones 3 y 4), lo que sugiere cierta cautela en la aplicación de pruebas paramétricas y justifica la consideración de procedimientos estadísticos no paramétricos en los análisis comparativos posteriores.
Respecto a los puntajes de cada dimensión, es importante considerar que para cada una los rangos van entre 0 y 5 puntos. La dimensión 1 (Ajuste al género discursivo ensayo) tiene una puntuación máxima de 20 puntos, por lo que las medias de los tres evaluadores fluctúan entre 12,93 y 13,24 puntos. Para la dimensión 2 (Organización retórica del ensayo académico), la puntuación máxima es de 40 puntos, por su parte las medias de los evaluadores se sitúan entre los 24,72 y 25,78. En la dimensión 3 (Relaciones de cohesión y coherencia), el puntaje máximo de la rúbrica es de 15 puntos, cuyas medias establecidas por los evaluadores fluctúan entre los 6,89 y 9,74 puntos. Finalmente, la dimensión 4 (Ajuste a las normas de la lengua), cuenta con una puntuación máxima de 10 puntos, a lo que las medias de los expertos se sitúan entre 6,87 y 7,26.
Una vez caracterizadas las puntuaciones de los tres agentes correctores, se evaluó la fiabilidad y el acuerdo entre ellos. Inicialmente, se determinó la fiabilidad general entre los tres evaluadores utilizando el Coeficiente de Correlación Intraclase (ICC2k). El análisis que se presenta en la Tabla 3 considera los valores estadísticos de ICC2k (acuerdo promedio), que representa el grado de consistencia y concordancia absoluta entre las puntuaciones, cuyos valores fluctúan entre 0 y 1, donde 0 representa desacuerdo total y 1 equivale a máximo acuerdo entre los evaluadores. Por su parte, los intervalos de confianza (IC) al 95 %, delimitan el rango de precisión de la estimación. En cuanto al Error Estándar de Medición (SEM), cuantifica la variabilidad debida al error aleatorio en las mismas unidades que la escala de medición. Finalmente la varianza % (residual), indica la proporción y variabilidad que no es explicada por las diferencias entre los sujetos evaluados, sino por inconsistencias entre los evaluadores o error de media.
Del análisis realizado, se destaca una alta fiabilidad interjueces en la evaluación global (0,708), lo que confirma que, en conjunto, el puntaje total del ensayo es consistente entre los distintos evaluadores. Sin embargo, al considerar la fiabilidad de manera separada por cada dimensión, la situación se complejiza. Por ejemplo, la dimensión 2 obtiene un buen índice de fiabilidad (0,747), lo que sugiere que tanto el experto humano, como los modelos de inteligencia artificial son consistentes en la evaluación de la organización retórica del ensayo. Mientras que, otras dimensiones, como la 3 de relaciones de cohesión y coherencia, y la 4 de ajuste a las normas de la lengua obtienen niveles de fiabilidad más bajos.
En el caso de la dimensión 3, se presenta la fiabilidad más baja (0,397), lo que sugiere que el humano experto y las IAs presentan grandes desacuerdos en la valoración de estos indicadores. A su vez, la dimensión 4 presenta una fiabilidad baja (0,490), además de una varianza residual de 75,7 %. En la Figura 1, se presentan las gráficas de cada análisis de ICC realizado por dimensión.
Con el objetivo de profundizar la interpretación de los resultados obtenidos mediante el Coeficiente de Correlación Intraclase (ICC), se realizó un análisis de acuerdo interjueces utilizando el método de Bland-Altman en las dimensiones 2 y 3, dado que estas presentaron resultados contrastantes en el análisis de fiabilidad previamente presentado. Mientras el ICC permite estimar el grado de concordancia relativa entre evaluadores, el análisis de Bland-Altman posibilita examinar el acuerdo absoluto y detectar posibles sesgos sistemáticos entre las puntuaciones.
La evaluación se realizó sobre una escala de 0 a 40 puntos en la dimensión 2, y de 0 a 15 puntos en la dimensión 3, donde valores más altos indican un mejor desempeño en el criterio evaluado. En todos los contrastes, la evaluación del experto humano fue considerada como referencia de criterio.
La Tabla 4, presenta el análisis de Bland-Altman, incorporando los valores de sesgo, Intervalos de confianza (IC) al 95 % y límites de acuerdo (LoA). Para la dimensión 2, se compararon las puntuaciones del experto humano con las del modelo ChatGPT-4. El análisis mostró un sesgo promedio de -1.07 puntos (IC 95 %: -2.75; 0.62), lo que indica una tendencia del modelo a asignar puntajes ligeramente superiores a los del evaluador humano. No obstante, los amplios límites de acuerdo (-12.22; 10.09) sugieren una elevada dispersión entre las mediciones, lo que indica que, pese a una fiabilidad general aceptable, ambos evaluadores no pueden considerarse intercambiables en esta dimensión.
En la dimensión 3, la comparación entre el experto humano y el modelo GPT-o3-mini-high evidenció un sesgo negativo mayor y estadísticamente significativo (-2.85; IC 95 %: -3.51; -2.18), lo que da cuenta de un desacuerdo sistemático. En este caso, el modelo de lenguaje sobreestimó consistentemente las puntuaciones respecto del criterio humano en el área de cohesión y coherencia. Los límites de acuerdo (-7.24; 1.54) reflejan una menor dispersión que en la dimensión 2, pero confirman la presencia de un sesgo estructural.
La Figura 2 ilustra gráficamente la distribución de las diferencias entre evaluadores. Estos resultados complementan el análisis de fiabilidad presentado en la Tabla 2 y permiten una interpretación más precisa del grado de acuerdo entre evaluadores humanos y modelos de inteligencia artificial.
Respecto de las gráficas, se destaca que en la dimensión 2, si bien se obtiene una buena fiabilidad general, la gran dispersión de los datos sugiere que estas no son intercambiables entre correctores, contando con un límite de acuerdo de más de 12 puntos. Por su parte, en la dimensión 3, se evidencia un sesgo sistemático por parte del modelo de lenguaje GPTo3-mini-high, sobreestimando los puntajes de los ensayos corregidos.
3.1 Prueba ANOVA de Medidas Repetidas
Con el fin de analizar si las puntuaciones asignadas varían en función del corrector, de las dimensiones de la rúbrica y de la combinación de ambos factores, se realizó un Análisis de Varianza (ANOVA) de medidas repetidas (Ver Tabla 5). Este tipo de análisis permite evaluar simultáneamente si existen diferencias globales entre correctores, si las dimensiones evaluadas presentan niveles de puntuación distintos y si el comportamiento de los correctores cambia según la dimensión considerada.
La estructura de la Tabla 5, presenta a los “Casos” o fuentes de variación del modelo. Se consideran las medidas repetidas (RM) del Factor principal (el Agente Corrector), las dimensiones evaluadas y las medias repetidas (RM) del Factor de Agente Corrector en interacción con la dimensión evaluada. Previamente al análisis, se verificó el supuesto de esfericidad mediante la Prueba de Mauchly, el cual resultó vulnerado tanto para el factor dimensiones como para la interacción entre corrector y dimensiones (p<.001). En consecuencia, se aplicó la corrección de Greenhouse-Geisser, lo que garantiza estimaciones más conservadoras y robustas de los valores de significación estadística.
Los resultados del ANOVA indican, en primer lugar, un efecto principal significativo de las dimensiones de la rúbrica (p<.001), con un tamaño del efecto muy grande (ω2=0.893), lo que sugiere que las puntuaciones difieren sustancialmente entre las distintas dimensiones evaluadas, independientemente del corrector. Las comparaciones post hoc confirmaron que todas las dimensiones presentan diferencias significativas entre sí.
En segundo lugar, se observó un efecto principal significativo del corrector (p=.036), aunque con un tamaño del efecto pequeño (ω2=0.020), lo que indica que, en términos generales, las diferencias entre correctores existen, pero su magnitud es limitada cuando se consideran todas las dimensiones de forma conjunta.
No obstante, el hallazgo más relevante corresponde a la interacción significativa entre el corrector y las dimensiones (p<.001; ω2=0.043). Este resultado indica que las diferencias entre correctores no son homogéneas, sino que dependen de la dimensión específica evaluada. En particular, los análisis post hoc muestran que, en la dimensión 3, el corrector humano asignó puntuaciones significativamente más bajas que los modelos GPT-o3-mini-high y GPT-4, con tamaños del efecto grandes, lo que sugiere un patrón sistemático de sobreestimación por parte de los modelos de inteligencia artificial en esta dimensión específica.
En el análisis de varianza (ANOVA) de medidas repetidas, utilizado para evaluar el efecto del corrector y de las dimensiones de la rúbrica, se aplicó la prueba de Mauchly para verificar el supuesto de esfericidad. Este supuesto no se cumplió ni para el factor dimensiones ni para la interacción entre corrector y dimensiones (p<.001), por lo que se utilizó la corrección de grados de libertad de Greenhouse-Geisser.
El análisis realizado indica una interacción estadísticamente significativa entre el corrector y las dimensiones (p<.001), con un tamaño del efecto parcial de 0,043. Este hallazgo indica que la magnitud y la dirección de las diferencias entre los correctores dependen del tipo de dimensión evaluada.
Respecto de las dimensiones de la rúbrica corregida, se observa un efecto principal significativo de las dimensiones (p<.001), con un tamaño del efecto muy grande (0.893). Por su parte, las comparaciones post hoc confirmaron que todas las dimensiones se diferencian significativamente entre sí.
En cuanto al efecto del corrector, es relevante indicar que también es significativo (p=.036), con un tamaño del efecto pequeño (0.020). En este caso, las comparaciones post hoc realizadas muestran que el efecto del corrector humano fue significativamente más baja que GPTo3-mini-high (p bonf<.001) y GPT-4 (p bonf<.001) en la dimensión 3, con tamaños de los efectos grandes para cada caso (Ver Tabla 6).
La Figura 3 presenta los gráficos tipo nube de lluvia para las cuatro dimensiones de la rúbrica, permitiendo comparar la evaluación realizada por GPTo3-mini-high, GPT-4 y el evaluador humano. En cada panel se representan simultáneamente la distribución de puntajes, la dispersión interna y las trayectorias de cada texto entre correctores, lo que facilita observar patrones de consistencia y posibles desviaciones (Figura 3).
En la Dimensión 1, GPT-4 tiende a alinearse más estrechamente con los puntajes del evaluador humano, mostrando una dispersión similar y un rango comparable. Por el contrario, GPTo3-mini-high exhibe una variabilidad mayor y una ligera tendencia a otorgar puntajes más altos o bajos, según corresponda, lo que sugiere menor estabilidad en esta dimensión. En la Dimensión 2 se observa un patrón similar, pues GPT-4 presenta una distribución más concentrada y cercana al criterio humano, mientras que GPTo3-mini-high muestra mayor dispersión entre textos. Las trayectorias individuales también evidencian que GPT-4 coincide con el experto en un mayor número de casos. Para la Di-mensión 3, las diferencias entre los tres correctores se atenúan, aunque GPTo3-mini-high continúa mostrando una distribución ligeramente más irregular. En cambio, GPT-4 mantiene una tendencia a replicar más fielmente el rango y la estructura de puntajes del evaluador humano. Finalmente, en la Dimensión 4 los puntajes del evaluador humano y GPT-4 vuelven a presentar una mayor proximidad, tanto en la mediana como en la amplitud intercuartílica. GPTo3-mini-high, en cambio, refleja la mayor desviación respecto del experto, con valores más dispersos y menor consistencia interna.
4 Discusión
Esta investigación tuvo como propósito determinar el grado de fiabilidad interjueces en la evaluación de ensayos argumentativos realizada por modelos de lenguaje, comparándola con la evaluación de un experto humano mediante la rúbrica analítica RUBRIAR (Kloss y Burdiles, 2024). Para ello, se aplicaron dos procedimientos metodológicos; el primero consistió en la evaluación de 46 ensayos argumentativos por parte de un experto. El segundo, la evaluación automatizada de los mismos textos, pero usando dos IAs, a saber: GPTo3-mini-high y GPT-4. Los resultados indican que los modelos de IA pueden desempeñar un papel complementario en la evaluación de ensayos; no obstante, su rendimiento y fiabilidad dependen en gran medida del tipo de tarea evaluativa solicitada (Teng, 2024, 2025). En este sentido, su utilidad debe entenderse como un apoyo al aprendizaje más que como un sustituto del evaluador experto, aunque GPT-4 muestra una mayor cercanía al juicio humano, aún es necesaria la intervención del corrector especializado para asegurar equidad, ofrecer retroalimentación contextualizada y resguardar la validez pedagógica del proceso evaluativo (Mateo-Girona; Kloss y Lillo-Fuentes, 2025).
Los textos revisados muestran que las IAs presentan una fiabilidad aceptable (Ossa y Willatt, 2023). Particularmente, los resultados de la segunda dimensión de la rúbrica, que remite a la forma de organizar globalmente la información prototípica del género ensayo (Kloss y Burdiles, 2024) presenta mayor idoneidad. Dado que esta dimensión se basa en la identificación de estructuras discursivas relativamente estables, como la presencia de una tesis y la secuencia lógica de los argumentos, tanto el evaluador humano como GPT-4 tienden a reconocer y reproducir estos patrones de forma consistente. Por esta razón, la coincidencia entre ambos es más alta que en otras dimensiones que podrían depender de juicios interpretativos o aspectos más complejos como la cohesión y coherencia textual, lo que se refleja en diferentes niveles de fiabilidad según el indicador evaluado.
En cuanto a la tercera dimensión, referida a las relaciones de cohesión y coherencia, los resultados muestran que la IA otorgó puntajes más altos que los del evaluador humano, lo cual puede explicarse por la naturaleza cognitiva del fenómeno de la coherencia. Desde la psicología cognitiva, comprender un texto implica construir un modelo de situación, es decir, una representación mental integrada que articula la información textual con los conocimientos previos del lector (Kintsch, 1988). Esta actividad permite identificar inconsistencias, evaluar la solidez de las relaciones argumentativas y detectar vacíos inferenciales que afectan la coherencia global. El evaluador humano, al elaborar este modelo, reconoce problemas profundos en la estructura lógica de los ensayos, incluso cuando su superficie lingüística parece ordenada.
Estos resultados concuerdan con lo reportado por Kloss, Tapia-Ladino y Sagredo Ortiz (2025), quienes identificaron la cohesión y la coherencia como las dimensiones más complejas para estudiantes de educación superior, especialmente cuando los escritores presentan una familiarización limitada con la escritura académica y deben establecer relaciones argumentativas y contraargumentativas que exceden el uso normativo de elementos de conexión. Desde la didáctica de la escritura, esta dificultad se interpreta no como una deficiencia, sino como el reflejo de una competencia discursiva de alto nivel cuyo aprendizaje requiere enseñanza explícita, práctica guiada y retroalimentación sistemática.
En este contexto pedagógico, investigaciones previas han mostrado que, en los procesos de aprendizaje de la escritura académica, los estudiantes tienden a dominar antes los aspectos estructurales y retóricos del género que aquellos vinculados con la organización profunda del discurso, como la progresión temática y la integración de los argumentos (Castelló et al., 2011; Tardy; Sommer-Farías y Gevers, 2020). Por lo tanto, la menor coincidencia entre la evaluación humana y automatizada en esta dimensión no solo evidencia las limitaciones actuales de los modelos de lenguaje para captar relaciones discursivas profundas, sino que también subraya la necesidad de situar la evaluación de la cohesión y coherencia en un marco pedagógico que privilegie la mediación docente y la retroalimentación formativa como elementos centrales del aprendizaje de la escritura académica (Carless y Winstone, 2020; Sologuren y Morgado, 2023).
De acuerdo con lo anterior, es importante destacar que la IA no construye modelos mentales ni realiza inferencias situadas. Su evaluación se basa en patrones de similitud estadística y en señales superficiales del texto como el uso frecuente de conectores, organización formal o continuidad temática, que solo aproximan la cohesión de manera parcial (García-Fernández; Jodar-Jurado y Sánchez-Morillas, 2025). Por ello, textos con marcas lingüísticas prototípicas pueden ser interpretados por el modelo como textos con alta calidad, aunque carezcan de articulación conceptual o de relaciones causales acordes a su naturaleza gramatical (Kloss y Quintanilla, 2023).
Ahora bien, un efecto inesperado en este estudio, en cuanto a los resultados de cada dimensión en comparación con el tipo de evaluador radica en que GPT-4 muestra un comportamiento evaluativo más estable y cercano al del experto humano en todas las dimensiones en comparación con GPTo3-mini-high, a pesar de que este último se presenta como un modelo con capacidades de razonamiento mejoradas. La distribución de puntajes de GPT-4, su rango y su consistencia entre textos sugieren un mayor grado de alineación con el juicio humano. Por el contrario, GPTo3-mini-high presentó mayor variabilidad y menor coincidencia con el evaluador experto, lo que indica un desempeño menos confiable para tareas de evaluación analítica de la escritura. Por ende, el comportamiento de GPTo3-mini-high sugiere que la competencia razonadora no necesariamente se traduce en una mayor capacidad para evaluar ensayos. Estas observaciones refuerzan la pertinencia de considerar modelos más avanzados en contextos donde la precisión y la consistencia de la retroalimentación son fundamentales (Poole y Coss, 2024; Cordovez-Fernández, 2024).
Finalmente, las IAs no logran ser un sustituto fiable para la evaluación y revisión académica de ensayos de estudiantes universitarios. Si bien puede ser un apoyo para contrastar criterios, la intervención del experto es esencial para asegurar la equidad y la retroalimentación contextualizada.
5 Conclusión
Se concluye que es fundamental incorporar un enfoque pedagógico que promueva un uso intencionado, ético y reflexivo de las herramientas de IA, particularmente durante los primeros años de la educación superior, cuando los estudiantes están construyendo las bases de sus competencias profesionales. Este enfoque no solo debe orientarlos en la definición de calidad de la escritura y la retroalimentación recibida, sino también fortalecer su capacidad para autorregularse, optimizar su aprendizaje y utilizar estas tecnologías como recursos complementarios y no como sustitutos del razonamiento crítico.
Una fortaleza del estudio es que pone de relieve la necesidad de transparentar los criterios, pasos y razonamientos que siguen los modelos de IA al evaluar textos, lo que abre oportunidades para comprender con mayor precisión cómo generan sus puntuaciones y para avanzar hacia sistemas evaluativos más explicativos y fiables.
Una limitación del estudio es la restricción en su validez externa. Dado que el análisis se realizó exclusivamente con GPTo3-mini-high y GPT-4, los resultados no pueden extrapolarse a modelos más recientes, como GPT-5.1 y GPT-5 Thinking, que presentan mejoras sustantivas en arquitectura, capacidad de razonamiento y alineación. En consecuencia, la comparación entre evaluadores debe interpretarse con cautela, pues es posible que versiones más avanzadas modifiquen los resultados de este experimento.
Otro aspecto para considerar es la necesidad de ampliar el espectro de modelos evaluados. Si bien el estudio comparó GPTo3-mini-high y GPT-4, modelos generados por OpenAI, resulta oportuno incorporar en futuros análisis modelos de otras compañías que actualmente presentan capacidades equivalentes o superiores, como el caso de Gemini-3-pro (Google), Grok-4.1 (xIA) o modelos abiertos de última generación como Deepseek v.3.1. Evaluar y comparar estos sistemas permitiría determinar si el desempeño observado es transversal de los LLMs o si existen diferencias sistemáticas entre arquitecturas.
Como proyección, se pueden crear textos sintéticos de ensayos con distintos niveles de calidad para ampliar la muestra utilizada por el chatbot en sus procesos de revisión. También es relevante valorar que el modelo GPT-4 fue actualizado, lo que permitió una mayor velocidad de respuesta y capacidades multimodales. Sin embargo, estos cambios no afectan los resultados del estudio.
Disponibilidad de datos
Los datos de investigación están disponibles en el texto del documento.
Referencias
-
CARLESS, David y WINSTONE, Naomi. Teacher feedback literacy and its interplay with student feedback literacy. Teaching in Higher Education, volumen 28, número 2, páginas 150-163, 2020. DOI: 10.1080/13562517.2020.1783632.
» https://doi.org/10.1080/13562517.2020.1783632 -
CASTELLÓ, Montserrat; CORCELLES, Mariona; IÑESTA, Ana; VEGA, Norma y BAÑALES, Gerardo. La voz del autor en la escritura académica: Una propuesta para su análisis. Revista Signos, volumen 44, número 76, páginas 105-117, 2011. Disponible en: Disponible en: https://dx.doi.org/10.4067/S0718-09342011000200001 Acceso en: 1 nov. 2025.
» https://dx.doi.org/10.4067/S0718-09342011000200001 -
CORDOVEZ-FERNÁNDEZ, Maximiliano. Escritura especializada en el ámbito jurídico: un análisis de las macromovidas de demandas escritas con y sin ChatGPT3.5. IDS, Revista de Jóvenes Humanistas, volumen 1, páginas 95-126, 2024. Disponible en: Disponible en: https://doi.org/10.15581/030.1.003 Acceso en: 5 nov. 2025.
» https://doi.org/10.15581/030.1.003 -
GARCÍA-FERNÁNDEZ, María; JODAR-JURADO, Rocío y SÁNCHEZ-MORILLAS, Carmen. The teaching of Spanish as a foreign language and artificial intelligence: the beliefs of the student teachers at the University of Jaén. Texto Livre, volumen 18, e56537, 2025. Disponible en: Disponible en: https://doi.org/10.1590/1983-3652.2025.56537 Acceso en: 5 nov. 2025.
» https://doi.org/10.1590/1983-3652.2025.56537 -
GIAVARINA, Davide. Understanding Bland Altman analysis. Biochemia Medica, volumen 25, número 2, páginas 141-151, 2015. Disponible en: Disponible en: https://doi.org/10.11613/BM.2015.015 Acceso en: 5 nov. 2025.
» https://doi.org/10.11613/BM.2015.015 -
HAYES, John. Modeling and remodeling writing. Written Communication, volumen 29, número 3, páginas 369-388, 2012. DOI: 10.1177/0741088312451260.
» https://doi.org/10.1177/0741088312451260 -
KINTSCH, Walter. The role of knowledge in discourse comprehension: a construction-integration model. Psychological Review, volumen 95, número 2, páginas 163-182, 1988. DOI: 10.1037/0033-295x.95.2.163.
» https://doi.org/10.1037/0033-295x.95.2.163 -
KLOSS, Steffanie y BURDILES, Gina. Diseño y aplicación de un instrumento para evaluar ensayos académicos argumentativos. Ogigia. Revista Electrónica de Estudios Hispánicos, número 36, páginas 257-288, 2024. Disponible en: Disponible en: https://doi.org/10.24197/ogigia.36.2024.257-28 Acceso en: 5 nov. 2025.
» https://doi.org/10.24197/ogigia.36.2024.257-28 -
KLOSS, Steffanie; BURDILES, Gina y OLGUÍN, Natalia. La ciencia de argumentar: guía práctica para la redacción de ensayos argumentativos. [S. l.: s. n.], 2025. Recurso digital. Disponible en: Disponible en: https://doi.org/10.53382/isbn.978-956-423-491-5 Acceso en: 1 nov. 2025.
» https://doi.org/10.53382/isbn.978-956-423-491-5 -
KLOSS, Steffanie y QUINTANILLA, Angie. Protocolos de pensamiento en voz alta: una técnica para acceder a la comprensión de la retroalimentación. Formación Universitaria, volumen 16, número 6, páginas 1-12, 2023. DOI: 10.4067/s0718-50062023000600001.
» https://doi.org/10.4067/s0718-50062023000600001 -
KLOSS, Steffanie; TAPIA-LADINO, Mónica y SAGREDO ORTIZ, Sindy. Estrategias de autorrevisión en escritura argumentativa: un estudio con alumnos de pedagogía. RLA. Revista de Lingüística Teórica y Aplicada, volumen 63, número 1, páginas 103-129, 2025. Disponible en: Disponible en: https://doi.org/10.29393/RLA63-4EASM30004 Acceso en: 12 nov. 2025.
» https://doi.org/10.29393/RLA63-4EASM30004 -
KOO, Terry y LI, Mae. A guideline of selecting and reporting intraclass correlation coefficients for reliability research. Journal of Chiropractic Medicine, volumen 15, número 2, páginas 155-163, 2016. Disponible en: Disponible en: https://doi.org/10.1016/j.jcm.2016.02.012 Acceso en: 1 nov. 2025.
» https://doi.org/10.1016/j.jcm.2016.02.012 -
MATEO-GIRONA, María Teresa; KLOSS, Steffanie y LILLO-FUENTES, Fernando. Empowering GPT as a processual writer: Didactext-guided prompting improves knowledge access, iterative revision, and overall textual quality. Frontiers in Education, volumen 10, página 1706236, 2025. Disponible en: Disponible en: https://doi.org/10.3389/feduc.2025.1706236 Acceso en: 25 nov. 2025.
» https://doi.org/10.3389/feduc.2025.1706236 -
OSSA, Carlos y WILLATT, Carlos. Retroalimentación efectiva basada en inteligencia artificial generativa: criterios de evaluación para la escritura de casos pedagógicos. [S. l.: s. n.], 2023. Recurso digital. Disponible en: Disponible en: http://doi.org/10.32457/12728/102782023120 Acceso en: 1 nov. 2025.
» http://doi.org/10.32457/12728/102782023120 - POOLE, Frederick y COSS, Matt. Can ChatGPT reliably and accurately apply a rubric to L2 writing assessments? The devil is in the prompt(s). Journal of Technology and Chinese Language Teaching, volumen 15, número 1, páginas 19-41, 2024.
-
PRADO, Paloma y PÉREZ, María. Los desafíos de la retroalimentación en la escritura: estudio de caso en la enseñanza del español en secundaria en México. Diálogos sobre Educación, volumen 12, número 23, páginas 1-28, 2021. Disponible en: Disponible en: https://doi.org/10.32870/dse.v0i23.782 Acceso en: 12 nov. 2025.
» https://doi.org/10.32870/dse.v0i23.782 - RAZALI, Nornadiah Mohd y WAH, Bee. Power comparisons of Shapiro-Wilk, Kolmogorov-Smirnov, Lilliefors and Anderson-Darling tests. Journal of Statistical Modeling and Analytics, volumen 2, número 1, páginas 21-33, 2011.
-
SHROUT, Patrick y FLEISS, Joseph. Intraclass correlations: uses in assessing rater reliability. Psychological Bulletin, volumen 86, número 2, páginas 420-428, 1979. DOI: 10.1037/0033-2909.86.2.420.
» https://doi.org/10.1037/0033-2909.86.2.420 -
SOLOGUREN, Enrique y MORGADO, Paula. Prácticas de retroalimentación para la producción del género de formación “Informe de Proyecto” en Ingeniería y Ciencias: explorando el aula universitaria. Perspectiva Educacional, volumen 62, número 2, páginas 114-139, 2023. DOI: 10.4151/07189729-Vol.62-Iss.2-Art.1425. Disponible en: Disponible en: https://www.perspectivaeducacional.cl/index.php/peducacional/article/view/1425 Acceso en: 27 nov. 2025.
» https://doi.org/10.4151/07189729-Vol.62-Iss.2-Art.1425» https://www.perspectivaeducacional.cl/index.php/peducacional/article/view/1425 -
TARDY, Christine; SOMMER-FARÍAS, Bruna y GEVERS, Jeroen. Teaching and researching genre knowledge: toward an enhanced theoretical framework. Written Communication, volumen 37, número 3, páginas 287-321, 2020. Disponible en: Disponible en: https://doi.org/10.1177/074108832091655 Acceso en: 12 nov. 2025.
» https://doi.org/10.1177/074108832091655 -
TENG, Mark Feng. “ChatGPT is the companion, not enemies”: EFL learners’ perceptions and experiences in using ChatGPT for feedback in writing. Computers and Education: Artificial Intelligence, volumen 7, página 100270, 2024. Disponible en: Disponible en: https://doi.org/10.1016/j.caeai.2024.100270 Acceso en: 15 nov. 2025.
» https://doi.org/10.1016/j.caeai.2024.100270 -
TENG, Mark Feng. Metacognitive awareness and EFL learners’ perceptions and experiences in utilising ChatGPT for writing feedback. European Journal of Education, volumen 60, número 1, e12811, 2025. Disponible en: Disponible en: https://doi.org/10.1111/ejed.12811 Acceso en: 15 nov. 2025.
» https://doi.org/10.1111/ejed.12811 -
TENG, Mark Feng y MA, Maggie. Assessing metacognition-based student feedback literacy for academic writing. Assessing Writing, volumen 59, página 100811, 2024. Disponible en: Disponible en: https://doi.org/10.1016/j.asw.2024.100811 Acceso en: 15 nov. 2025.
» https://doi.org/10.1016/j.asw.2024.100811 - UNESCO. Guía para el uso de IA generativa en educación e investigación. Paris: Unesco, 2024.
- VENEGAS, René y CERDA, Constanza. Herramienta computacional de apoyo a la escritura del informe técnico para estudiantes de ingeniería civil. En: SOCIEDAD CHILENA DE EDUCACIÓN CIENTÍFICA (SOCHEDI). CONGRESO Internacional SOCHEDI 2022. Valparaíso, Chile: Pontificia Universidad Católica de Valparaíso, 2022.
- ZUNINO, Carolina y MURACA, Matías. El ensayo académico. En: NATALE, L. (editor). Carrera: escritura y lectura de textos académicos y profesionales. Argentina: Universidad Nacional de General Sarmiento, 2012. páginas 61-78.
A Anexo: Prompt GPT
Se presenta el prompt entregado al modelo GPTo3-mini-high y GPT-4 para la evaluación de los ensayos según la rúbrica RUBRIAR. El texto corresponde íntegramente a la instrucción proporcionada durante el proceso de evaluación.
Eres un asistente académico especializado en analizar y calificar ensayos argumentativos de estudiantes universitarios de la carrera de periodismo. Tu tarea principal es evaluar los ensayos a partir de una rúbrica analítica compuesta por 4 dimensiones y 17 subdimensiones, asignando puntajes de 0 a 5 según los criterios descritos a continuación. Debes mantener siempre un tono amable, respetuoso y profesional, pero con un análisis muy riguroso y crítico. Es fundamental que no suavices las deficiencias evidentes ni compenses fallas graves con aspectos positivos en otras áreas.
-
Instrucciones para el análisis
-
1. Lectura Detallada: Lee detenidamente el ensayo proporcionado.
-
2. Análisis Crítico y Rigurosos:
-
Evalúa con el máximo rigor cada subdimensión.
-
Si se detecta cualquier debilidad o deficiencia, asigna la calificación correspondiente sin redondear ni compensar con aspectos positivos en otros criterios.
-
Utiliza un lenguaje directo y crítico para describir las debilidades, sin suavizar los problemas.
-
3. Consulta de Modelos de Referencia: Revisa los ejemplos de ensayo previamente suministrados:
-
Ensayo de referencia “bueno”: Representa un trabajo sólido, con estructura clara, una tesis bien formulada y manejo adecuado de citas.
-
Ensayo de referencia “malo”: Presenta deficiencias como una tesis poco clara, argumentación superficial, fallas ortográficas y de cohesión.
-
4. Objetivo: Comparar el ensayo evaluado contra estos modelos para identificar en cada subdimensión si se aproxima más a los aspectos positivos del modelo “bueno” o refleja las deficiencias del modelo “malo”.
-
5. Evaluación por Subdimensión:
-
Evalúa cada subdimensión en una escala de 0 a 5, de la siguiente forma:
-
0: Ausente (no se evidencia el subcriterio).
-
1: Deficiente (se evidencia de forma incorrecta o casi ausente).
-
2: Insuficiente (se realizan intentos, pero son poco claros o no se ajustan adecuadamente).
-
3: Básico (cumple de manera elemental, pero con notables áreas de mejora).
-
4: Satisfactorio (se desarrolla adecuadamente, aunque presenta algunas áreas de mejora).
-
5: Destacado (cumple ampliamente con el criterio, sin apenas debilidades).
-
6. Nota: Cada subdimensión se debe evaluar de forma independiente; no se permite que los aciertos en una parte compensen deficiencias críticas en otra.
-
7. Retroalimentación Detallada:
-
Para cada subdimensión, proporciona comentarios que incluyan:
-
Fortalezas: Aspectos positivos que se destacan.
-
Debilidades: Fallas, deficiencias o áreas que requieren mejora, expresadas de forma directa y sin suavizar.
-
Sugerencias de Mejora: Recomendaciones específicas y concretas para corregir las deficiencias.
-
8. Ejemplo de comentario crítico: “La tesis es insuficiente y poco clara, lo que debilita la estructura argumentativa. Se recomienda reformularla de forma precisa y contundente para orientar el desarrollo del ensayo.”
-
9. Cálculo del Puntaje: Suma el puntaje de cada subdimensión para obtener un subtotal por cada dimensión y el puntaje global. Asegúrate de que la calificación global refleje fielmente las debilidades y fortalezas detectadas.
-
10. Generación del Archivo Excel (opcional):
-
Si se solicita, crea una tabla estructurada con la siguiente información mínima:
-
Nombre del estudiante (si se proporciona).
-
Puntajes de cada subdimensión (0 a 5).
-
Comentarios o notas breves para cada subdimensión.
-
Sumatoria por dimensión y puntaje total.
-
Un campo extra para observaciones finales por cada dimensión.
-
11. Asegúrate de que el formato sea fácilmente exportable a un archivo .xlsx (por ejemplo, usando celdas diferenciadas por columna).
-
Rúbrica analítica
-
Dimensión 1: Ajuste al género discursivo ensayo
-
1.1 Propósito comunicativo: Hacer evidente la intencionalidad del texto en un contexto determinado, estableciendo de forma clara y fundamentada una tesis.
-
1.2 Voces del discurso: Incorporar la literatura necesaria mediante el uso correcto de citas y referencias, diferenciando claramente entre el discurso propio y el ajeno.
-
1.3 Anidación de la cita y/o referencia: Integrar las citas de manera coherente con el flujo del ensayo, utilizando un lenguaje académico adecuado.
-
1.4 Modo de organización discursiva predominante: Utilizar enunciados argumentativos característicos del género ensayo.
-
Dimensión 2: Organización retórica del género ensayo
-
2.1 Título: Debe ser informativo, conciso y reflejar una postura argumentativa.
-
2.2 Introducción: Presentar el contexto y justificar la elección del tema, definiendo claramente la tesis.
-
2.3 Planteamiento de la tesis o propósito: Establecer un punto de vista claro y debatible que guíe el ensayo.
-
2.4 Argumentación: Desarrollar argumentos de forma lógica y persuasiva, apoyándose en evidencias y ejemplos concretos.
-
2.5 Incorporación de respaldos: Utilizar fuentes pertinentes y analizarlas críticamente para sustentar los argumentos.
-
2.6 Condiciones de refutación: Incluir contraargumentos y anticipar objeciones, respondiendo a ellos con evidencias sólidas.
-
2.7 Conclusión: Culminar el ensayo sintetizando los argumentos y ofreciendo una reflexión o propuesta concreta.
-
2.8 Referencias bibliográficas: Presentar un listado completo y correctamente formateado de todas las fuentes citadas.
-
Dimensión 3: Relaciones de cohesión y coherencia
-
3.1 Puntuación y conectividad: Emplear de manera precisa la puntuación y los conectores para articular el texto en una unidad coherente.
-
3.2 Progresión y recurrencia: Garantizar una progresión lógica y evitar redundancias, retomando de forma adecuada las ideas principales.
-
3.3 Precisión léxica: Utilizar un vocabulario variado y preciso, evitando ambigüedades y repeticiones innecesarias.
-
Dimensión 4: Ajuste a las normas de la lengua
-
4.1 Ortografía literal: Evaluar el uso correcto de las letras y la ortografía en general.
-
4.2 Ortografía acentual: Verificar la aplicación adecuada de las regras de tildación.
-
Lineamientos para calificaciones críticas
-
Rigurosidad Total: Evalúa con máxima exigencia cada subdimensión. Las deficiencias evidentes deben reflejarse en calificaciones bajas sin compensaciones.
-
Lenguaje Directo y Crítico: Emplea un lenguaje claro y sin suavizar los errores. Cada debilidad debe expresarse de forma contundente, justificando puntajes bajos.
-
Evaluación Independiente: Cada subdimensión se califica de forma individual, sin permitir que aspectos positivos en una compensen deficiencias graves en otra.
-
Análisis Exhaustivo: Realiza un análisis minucioso que identifique incluso las pequeñas deficiencias y ofrece sugerencias de mejora precisas y accionables.
-
Tono y Estilo
-
Sé amable, respetuoso y profesional.
-
Dirígete al usuario como “Profesor/a”.
-
Proporciona retroalimentación útil, específica y crítica.
-
Ejemplo de Interacción
-
Entrada del profesor/a:
-
Hola, ¿podrías revisar el siguiente ensayo argumentativo por favor? Salida esperada:
-
Puntajes y comentarios para cada subdimensión (0 a 5).
-
Promedio por dimensión y puntaje global.
-
Resumen general de los resultados en el chat.
-
Opción de descargar un archivo Excel con la evaluación completa.
Editado por
-
Editor de maquetación:
Saula Cecília 0009-0006-3069-8480
-
Editor de sección:
Camila Cárdenas Neira 0000-0002-1842-7200




Fuente: Elaboración propia.
Fuente: Elaboración propia.
Fuente: Elaboración propia.