Inteligencia artificial generativa y pensamiento crítico: detección estudiantil de errores y sesgos en contenidos educativos
Generative Artificial Intelligence and Critical Thinking: Students’ Detection of Errors and Biases in Educational Content
Bryan Oswaldo Valenzuela Espinoza1, Rocio Alexandra Malla Malla2, Briggitte Gisela Ochoa Cojitambo3, Diana María Guamán Moreno4 y Karla Paola Arízaga López5
¹Unidad educativa particular Santo Domingo de Guzmán Gualaceo, bryan.valenzuela@stodomingogualaceo.edu.ec, https://orcid.org/0009-0005-0504-1877, Ecuador
2Unidad educativa Dr. José María Velasco Ibarra, rocio.malla@educacion.gob.ec, https://orcid.org/0009-0004-7650-6902, Ecuador
3Unidad educativa Isabel de Castilla, briggitte.ochoa@docentes.educacion.edu.ec, https://orcid.org/0009-0001-1463 -5192, Ecuador
4Unidad Educativa Abdón Calderon Garaicoa, dianam.guaman@educacion.gob.ec, https://orcid.org/0000-0002-5446-8093, Ecuador
5Universidad Técnica de Machala, karlitaarizaga@gmail.com, https://orcid.org/0009-0003-6949-7086, Ecuador
|
Información del Artículo |
|
RESUMEN |
|
|
Trazabilidad: Recibido 11-07-2026 Revisado 27-07-2026 Aceptado 15-09-2026
|
|
La expansión de la inteligencia artificial generativa en los entornos escolares plantea la necesidad de formar estudiantes capaces de evaluar la veracidad, confiabilidad e imparcialidad de sus respuestas. El objetivo de esta investigación fue analizar la capacidad de estudiantes de Educación Básica para detectar errores y sesgos en contenidos educativos producidos mediante inteligencia artificial generativa, considerando sus criterios de evaluación y estrategias de verificación. Se desarrolló un estudio cualitativo de caso con 18 estudiantes de octavo año de una institución educativa fiscal de Cuenca, Ecuador. Los participantes analizaron ocho contenidos generados mediante ChatGPT que incorporaban deliberadamente errores factuales, contradicciones, referencias inexistentes y sesgos de género, culturales, étnicos, geográficos, socioeconómicos y lingüísticos. La información se recopiló mediante entrevistas semiestructuradas, producciones escritas y notas de campo, y se examinó mediante análisis temático mixto y triangulación. Los estudiantes identificaron problemas en 132 de las 144 evaluaciones realizadas. Los errores factuales y las contradicciones fueron reconocidos con mayor facilidad que los sesgos implícitos y las referencias inexistentes. La organización y fluidez de los textos generaron confianza inicial; no obstante, la consulta de libros y fuentes institucionales favoreció la revisión de las respuestas. También se identificaron confianza cautelosa, conciencia metacognitiva y contraste colaborativo. Se concluye que la capacidad crítica frente a la inteligencia artificial no depende únicamente de su utilización, sino de actividades pedagógicas que exijan cuestionar, verificar, argumentar y corregir sus contenidos mediante evidencias. |
|
|
Palabras Clave: Alfabetización en inteligencia artificial Contenidos educativos Detección de errores Inteligencia artificial generativa Pensamiento crítico |
|||
|
|||
|
Keywords: AI literacy Educational content Error detection Generative artificial intelligence Critical thinking |
|
ABSTRACT The expansion of generative artificial intelligence in school environments has created a need to prepare students to evaluate the accuracy, reliability, and impartiality of AI-generated responses. This study aimed to analyze Basic Education students’ ability to detect errors and biases in educational content produced by generative artificial intelligence, considering their evaluation criteria and verification strategies. A qualitative case study was conducted with 18 eighth-grade students from a public educational institution in Cuenca, Ecuador. Participants analyzed eight pieces of educational content generated using ChatGPT that deliberately incorporated factual errors, contradictions, nonexistent references, and gender, cultural, ethnic, geographical, socioeconomic, and linguistic biases. Data were collected through semi-structured interviews, written student work, and field notes and were examined using mixed thematic analysis and source triangulation. Students identified problems in 132 of the 144 evaluations performed. Factual errors and contradictions were recognized more readily than implicit biases and fabricated references. The organization and fluency of the texts initially increased students’ trust; however, consulting textbooks and institutional sources prompted them to reconsider several responses. Cautious trust, metacognitive awareness, and collaborative comparison also emerged as relevant patterns. The study concludes that critical engagement with artificial intelligence does not depend solely on using the technology. It requires pedagogical activities that prompt students to question, verify, substantiate, and correct AI-generated content through evidence. Teacher mediation and explicit source-evaluation criteria are therefore essential for promoting responsible and critical use of generative artificial intelligence in Basic Education.
|
INTRODUCCIÓN
La inteligencia artificial generativa se ha incorporado con rapidez a las prácticas educativas cotidianas. Herramientas capaces de producir textos, explicaciones, ejercicios, resúmenes e imágenes ofrecen nuevas posibilidades para personalizar el aprendizaje, acceder a información y recibir retroalimentación inmediata. Sin embargo, su funcionamiento probabilístico impide asumir que los contenidos generados son necesariamente correctos, pertinentes o imparciales. Estos sistemas pueden elaborar respuestas lingüísticamente convincentes que contienen datos falsos, referencias inexistentes, razonamientos inconsistentes o representaciones sesgadas, lo que plantea desafíos para su utilización educativa responsable (Kasneci et al., 2023; UNESCO, 2023).
La aparente coherencia de las respuestas generadas constituye una dificultad particular para los estudiantes. Los modelos de lenguaje producen sus resultados mediante patrones estadísticos aprendidos de grandes conjuntos de datos, sin verificar la verdad de cada afirmación ni comprender el contenido en el sentido humano del término. Por esta razón, pueden presentar información incorrecta con un nivel elevado de seguridad discursiva, fenómeno denominado comúnmente “alucinación” de la inteligencia artificial (Ji et al., 2023). Asimismo, los datos empleados para entrenar estos sistemas pueden reproducir prejuicios culturales, lingüísticos, sociales o de género presentes en las fuentes originales, de manera que sus resultados no son neutrales ni están exentos de consecuencias educativas (Weidinger et al., 2022).
El problema no radica únicamente en que la inteligencia artificial pueda equivocarse, sino en la posibilidad de que los estudiantes acepten sus respuestas sin analizarlas. La confianza excesiva en sistemas conversacionales puede reducir la comprobación de fuentes, favorecer el uso de atajos cognitivos y debilitar la participación activa en la construcción del conocimiento. Una revisión sistemática realizada por Zhai et al. (2024) advierte que la dependencia de los sistemas de diálogo basados en inteligencia artificial puede afectar procesos como la toma de decisiones, el razonamiento analítico y el pensamiento crítico. De manera complementaria, Fan et al. (2025) identificaron el riesgo de “pereza metacognitiva” cuando los estudiantes transfieren a la tecnología tareas de planificación, supervisión y evaluación que deberían formar parte de su propio proceso de aprendizaje.
No obstante, la relación entre inteligencia artificial y pensamiento crítico no debe interpretarse exclusivamente desde una perspectiva negativa. La tecnología también puede utilizarse como objeto de análisis, contraste y cuestionamiento. Una respuesta incorrecta puede convertirse en un recurso didáctico cuando el estudiante debe localizar el error, explicar su origen, consultar fuentes confiables y formular una corrección argumentada. El efecto formativo depende, por tanto, de la actividad cognitiva que acompaña al uso de la herramienta. La evidencia disponible sugiere que la inteligencia artificial puede apoyar el aprendizaje cuando su utilización exige evaluar, comparar y reelaborar la información; en cambio, puede empobrecerlo cuando reemplaza el esfuerzo intelectual necesario para comprender y resolver una tarea (Lee et al., 2025).
Desde esta perspectiva, el pensamiento crítico comprende la capacidad de interpretar información, examinar argumentos, valorar evidencias, reconocer supuestos y formular juicios fundamentados. En entornos mediados por inteligencia artificial, estas operaciones adquieren una dimensión específica: el estudiante necesita distinguir entre fluidez verbal y exactitud, verificar la procedencia de la información, identificar contradicciones y reconocer posibles perspectivas excluidas. La detección de errores y sesgos constituye, por consiguiente, una manifestación observable del pensamiento crítico, porque demanda algo más que conocer el funcionamiento técnico de la herramienta: exige interrogar su autoridad y evaluar las implicaciones de sus respuestas.
Esta capacidad se relaciona directamente con la alfabetización en inteligencia artificial. Long y Magerko (2020) explican que dicha alfabetización implica un conjunto de competencias que permiten comprender, evaluar y utilizar críticamente sistemas de inteligencia artificial. Ng et al. (2021) agregan que esta formación integra dimensiones cognitivas, prácticas y éticas, por lo que no debería limitarse al manejo instrumental de aplicaciones. Un estudiante alfabetizado en inteligencia artificial necesita comprender que los resultados generados pueden variar según la instrucción introducida, que requieren verificación externa y que su aparente objetividad puede ocultar decisiones humanas, omisiones y patrones sesgados.
La formación de estas competencias resulta especialmente relevante en Educación Básica. Los estudiantes de este nivel acceden a herramientas generativas mientras todavía desarrollan conocimientos disciplinares y criterios para valorar la confiabilidad de las fuentes. Cuando el conocimiento previo es insuficiente, resulta más difícil advertir que una explicación contiene un error, porque la respuesta puede parecer válida por su vocabulario, estructura y seguridad expresiva. La revisión desarrollada por Alfarwan (2025) muestra que la investigación empírica sobre inteligencia artificial generativa en educación escolar continúa siendo menor que la realizada en educación superior y se concentra principalmente en el bachillerato y en áreas relacionadas con ciencia, tecnología, ingeniería y matemáticas. De manera similar, Zhang y Tur (2024) identificaron una base todavía limitada de estudios sobre ChatGPT en contextos K–12, lo que evidencia la necesidad de examinar sus usos y efectos en poblaciones escolares concretas.
Las investigaciones disponibles muestran, además, que los estudiantes manifiestan simultáneamente interés y preocupación frente a estas tecnologías. Doty y Lipien (2024) encontraron que estudiantes de secundaria reconocían la utilidad educativa de ChatGPT, pero también expresaban inquietudes por la pérdida de pensamiento crítico y la dependencia tecnológica. Klarin et al. (2024), por su parte, observaron que la utilización y la percepción de utilidad de la inteligencia artificial generativa se relacionan con características individuales, como las funciones ejecutivas y el rendimiento académico. Estos antecedentes sugieren que la capacidad de evaluar contenidos generados no puede deducirse únicamente de la frecuencia de uso: utilizar una herramienta habitualmente no significa comprender sus limitaciones ni disponer de criterios suficientes para juzgar la calidad de sus respuestas.
En el contexto ecuatoriano, la incorporación de la inteligencia artificial en las prácticas escolares avanza en medio de diferencias de acceso, formación y acompañamiento pedagógico. Vallejo Rodríguez et al. (2025) identificaron un crecimiento del interés académico por la inteligencia artificial en la Educación Básica del Ecuador, acompañado de desafíos relacionados con la preparación docente, la infraestructura y la integración pedagógica. Asimismo, Altafuya Rojas y Suárez Tigse (2026) evidenciaron que los estudiantes ecuatorianos de bachillerato utilizan herramientas generativas y reconocen su utilidad, aunque persisten necesidades formativas para orientar un empleo crítico y responsable. Estos antecedentes muestran que la discusión nacional ha comenzado a abordar el uso y la percepción de la inteligencia artificial, pero todavía se conoce poco acerca de los criterios concretos mediante los cuales los estudiantes juzgan la veracidad, consistencia e imparcialidad de sus contenidos.
En consecuencia, el vacío científico no consiste solamente en establecer si los estudiantes utilizan inteligencia artificial generativa, sino en comprender qué hacen cuando reciben una respuesta problemática. Sigue siendo necesario conocer cómo identifican un dato falso, qué señales despiertan sus sospechas, cuáles fuentes emplean para verificarlo, cómo interpretan un contenido sesgado y qué dificultades enfrentan al justificar sus decisiones. La mayor parte de los estudios ha privilegiado encuestas, mediciones de aceptación, revisiones documentales o análisis del rendimiento, mientras que las experiencias y razonamientos expresados directamente por estudiantes de Educación Básica han recibido menor atención. Las entrevistas resultan pertinentes para aproximarse a este problema porque permiten reconstruir los criterios, dudas, estrategias de comprobación y significados que no pueden comprenderse únicamente mediante puntuaciones cerradas.
La importancia del estudio se sustenta en sus implicaciones pedagógicas y éticas. Comprender cómo los estudiantes evalúan los contenidos generados puede orientar el diseño de actividades de verificación, comparación de fuentes, análisis de argumentos y reconocimiento de sesgos. También puede aportar criterios para que los docentes integren estas herramientas sin convertirlas en autoridades incuestionables. La orientación de la UNESCO sobre inteligencia artificial generativa sostiene que su incorporación educativa debe preservar la agencia humana, promover la formación crítica y garantizar un uso ético y seguro (UNESCO, 2023). En este sentido, enseñar a cuestionar las respuestas de la inteligencia artificial es tan importante como enseñar a formular instrucciones para obtenerlas.
Por lo expuesto, el objetivo de la investigación es analizar la capacidad de los estudiantes para detectar errores y sesgos en contenidos educativos producidos mediante inteligencia artificial generativa, a partir de sus experiencias, criterios de evaluación y estrategias de verificación. El estudio se desarrollará mediante un enfoque cualitativo basado en entrevistas, con la finalidad de comprender cómo los participantes interpretan, cuestionan y comprueban las respuestas generadas. Después de esta introducción, el artículo presenta los materiales y métodos, expone los resultados obtenidos, discute los hallazgos en relación con la literatura científica y, finalmente, formula las conclusiones e implicaciones educativas correspondientes.
MATERIALES Y MÉTODOS
Enfoque y diseño de investigación
La investigación se desarrolló desde un enfoque cualitativo, bajo un paradigma interpretativo, debido a que se buscó comprender los criterios, razonamientos y estrategias empleados por los estudiantes para detectar errores y sesgos en contenidos educativos producidos mediante inteligencia artificial generativa. Este enfoque permitió examinar no solo cuáles elementos fueron identificados, sino también cómo los participantes justificaron sus decisiones, valoraron la confiabilidad de las respuestas y reflexionaron sobre sus propias limitaciones al interactuar con la herramienta.
Se adoptó un diseño de estudio de caso cualitativo, delimitado por una institución, un nivel educativo y una experiencia pedagógica específica. El caso estuvo constituido por estudiantes de octavo año de Educación General Básica que participaron en actividades de análisis crítico de contenidos generados mediante ChatGPT. La selección de este diseño respondió al interés por estudiar el fenómeno dentro de su contexto educativo, considerando las experiencias y significados construidos por los participantes (Creswell & Poth, 2018).
La investigación se efectuó entre el 4 de mayo y el 19 de junio de 2026 en una institución educativa fiscal ubicada en Cuenca, provincia del Azuay, Ecuador. Para proteger su identidad, se empleó la denominación “Institución Educativa A”. Todas las actividades se desarrollaron presencialmente. La institución disponía de conexión a internet, laboratorio de informática, computadoras compartidas y tabletas institucionales.
Participantes y muestreo
Inicialmente fueron convocados 20 estudiantes de octavo año de Educación General Básica. La muestra final estuvo integrada por 18 participantes, con edades comprendidas entre 12 y 13 años. La distribución por sexo fue paritaria: nueve mujeres y nueve hombres. Trece estudiantes habían utilizado previamente alguna herramienta de inteligencia artificial generativa, mientras que cinco no contaban con experiencia directa.
Se empleó un muestreo intencional orientado a incorporar diversidad en cuanto al rendimiento académico, la participación en clase y la experiencia previa con herramientas digitales. Esta selección no tuvo como finalidad alcanzar representatividad estadística, sino obtener perspectivas heterogéneas que permitieran comprender las distintas formas de interacción, evaluación y cuestionamiento de los contenidos generados.
Los criterios de inclusión fueron: estar matriculado en octavo año de Educación General Básica; disponer de autorización del representante legal; expresar voluntariamente el asentimiento; asistir a las actividades programadas; participar en la entrevista individual; y entregar la producción escrita elaborada durante las sesiones. Dos estudiantes no completaron el proceso: uno no asistió a las entrevistas y otro se retiró voluntariamente. La información de ambos fue excluida del análisis.
La suficiencia del número de participantes se determinó mediante saturación temática. Después de la entrevista 16 no se identificaron aportes sustancialmente diferentes respecto de las categorías centrales; las entrevistas 17 y 18 se emplearon para confirmar la recurrencia y estabilidad de los patrones interpretativos. Este criterio concuerda con la comprensión de la saturación como el momento en que la recopilación adicional de información deja de aportar dimensiones relevantes para el fenómeno estudiado (Hennink & Kaiser, 2022).
Tabla 1: Características de los participantes
|
Característica |
Descripción |
|
Estudiantes convocados |
20 |
|
Participantes finales |
18 |
|
Estudiantes que no completaron el estudio |
2 |
|
Curso |
Octavo año de Educación General Básica |
|
Edad |
12–13 años |
|
Mujeres |
9 |
|
Hombres |
9 |
|
Con experiencia previa en inteligencia artificial generativa |
13 |
|
Sin experiencia directa |
5 |
|
Tipo de muestreo |
Intencional |
|
Criterio de suficiencia |
Saturación temática |
Nota. Los dos estudiantes que no completaron el proceso fueron excluidos del análisis. La información se presenta de manera agregada para proteger la identidad de los participantes.
Herramienta de inteligencia artificial y materiales educativos
Se utilizó la versión web gratuita de ChatGPT disponible durante el periodo de aplicación. No se registró un modelo específico, por lo que los resultados deben interpretarse en relación con la funcionalidad general de la plataforma y no atribuirse a una versión determinada del modelo. Los estudiantes interactuaron directamente con la herramienta durante una actividad supervisada. También se utilizaron materiales impresos generados previamente por el equipo investigador.
Para evitar el empleo de cuentas personales, se habilitó una cuenta educativa destinada exclusivamente a la actividad. Se prohibió introducir nombres, fotografías, direcciones, información familiar o cualquier otro dato que permitiera identificar a los participantes. La interacción con ChatGPT se efectuó bajo supervisión docente permanente.
El material de análisis estuvo compuesto por ocho contenidos educativos: cuatro textos explicativos, dos respuestas argumentativas y dos síntesis históricas. Cada contenido presentó una extensión aproximada de 250 a 350 palabras. Los materiales abordaron temas de Lengua y Literatura, Ciencias Naturales y Estudios Sociales: características de los textos argumentativos; cambio climático y ecosistemas; alimentación y salud; diversidad cultural del Ecuador; participación histórica de mujeres y pueblos indígenas; y regiones naturales y organización territorial del país.
Los errores y sesgos fueron incorporados deliberadamente por los investigadores para garantizar que todos los participantes analizaran materiales equivalentes. Esta decisión permitió controlar la presencia de los elementos que debían ser evaluados y comparar las estrategias utilizadas para reconocerlos. Antes de su aplicación, los materiales fueron revisados por tres docentes especialistas: uno de Lengua y Literatura, uno de Ciencias Naturales y uno de Estudios Sociales.
Entre los errores incorporados se incluyeron datos falsos o imprecisos, fechas y nombres incorrectos, explicaciones científicas equivocadas, contradicciones internas, referencias inexistentes, generalizaciones sin evidencia y confusiones entre hechos y opiniones. Los sesgos correspondieron a representaciones relacionadas con género, cultura, pertenencia étnica, ubicación geográfica, condición socioeconómica y diversidad lingüística.
Todos los participantes analizaron los mismos ocho contenidos. Para comprobar la información tuvieron acceso a libros escolares, enciclopedias digitales, páginas institucionales y sitios web seleccionados previamente por los docentes. La disponibilidad de estas fuentes permitió observar si los estudiantes contrastaban las respuestas de ChatGPT y qué criterios empleaban para valorar la confiabilidad de la información.
Técnicas e instrumentos de recopilación de información
La técnica principal fue la entrevista individual semiestructurada. Esta se complementó con las producciones escritas elaboradas por los estudiantes y con las notas de campo registradas durante las actividades. La combinación de estas fuentes permitió contrastar lo expresado por los participantes con las acciones realizadas al identificar, justificar y corregir los contenidos.
La guía de entrevista estuvo integrada por 12 preguntas abiertas. Su estructura permitió mantener un conjunto común de temas y, simultáneamente, formular preguntas de profundización sobre ejemplos, decisiones, dificultades y estrategias de verificación. Las entrevistas fueron realizadas presencialmente por el investigador principal en una sala privada de la institución, fuera del horario regular de clases. Cada encuentro tuvo una duración de entre 20 y 30 minutos, con un promedio aproximado de 24 minutos.
Con la autorización correspondiente, las entrevistas fueron grabadas en audio y transcritas literalmente. Durante su desarrollo se registraron notas de campo sobre silencios, dudas, seguridad al responder, cambios de opinión, formas de consultar las fuentes, solicitudes de ayuda y reacciones ante los errores y sesgos.
La guía fue examinada por tres expertos: un especialista en investigación educativa, un docente con experiencia en pensamiento crítico y un especialista en tecnología educativa e inteligencia artificial. Los criterios de valoración fueron claridad, pertinencia, coherencia, suficiencia y correspondencia entre las preguntas, el objetivo y las categorías de análisis. El proceso produjo un coeficiente global de validez de contenido de 0,91. Posteriormente, se efectuó una entrevista piloto con dos estudiantes pertenecientes a otro paralelo. Sus respuestas permitieron revisar la claridad y secuencia de las preguntas, pero no fueron incorporadas al corpus definitivo.
Guía de entrevista semiestructurada
Tabla 2: Preguntas de la entrevista semiestructurada
|
N.º |
Pregunta |
Categoría principal |
|
1 |
Cuando recibiste los contenidos generados por ChatGPT, ¿qué hiciste primero para decidir si la información era correcta? |
Estrategias de verificación |
|
2 |
¿Qué características de una respuesta hicieron que sospecharas que podía contener un error? |
Detección de errores |
|
3 |
Cuéntame un error que hayas identificado. ¿Cómo comprobaste que realmente era incorrecto? |
Detección de errores |
|
4 |
¿Qué errores te resultaron más difíciles de reconocer y por qué? |
Detección de errores |
|
5 |
¿Cómo decidiste qué fuentes podían utilizarse para comprobar o corregir la información? |
Criterios de confiabilidad |
|
6 |
¿Qué haces cuando dos fuentes ofrecen información diferente sobre el mismo tema? |
Pensamiento crítico |
|
7 |
¿Qué expresiones o ideas te hicieron pensar que un contenido podía presentar un estereotipo, una generalización o un sesgo? |
Reconocimiento de sesgos |
|
8 |
Describe un sesgo que hayas identificado. ¿A qué persona o grupo podía afectar y de qué manera? |
Reconocimiento de sesgos |
|
9 |
¿Cambió alguna de tus respuestas después de conversar con un compañero? Explica qué ocurrió. |
Aprendizaje colaborativo |
|
10 |
¿Confías de la misma manera en una respuesta de ChatGPT y en la información de un libro o una página institucional? ¿Por qué? |
Actitud frente a la IA |
|
11 |
¿En qué momento necesitaste ayuda para evaluar o corregir los contenidos y qué tipo de ayuda solicitaste? |
Conciencia metacognitiva |
|
12 |
Después de esta experiencia, ¿qué pasos seguirías antes de utilizar un contenido generado por inteligencia artificial en una tarea escolar? |
Pensamiento crítico |
Nota. Las preguntas adicionales se formularon en función de las respuestas de cada participante. Estas preguntas buscaron ampliar ejemplos, aclarar contradicciones y profundizar en los criterios empleados para verificar la información.
Procedimiento
El trabajo de campo se organizó en cuatro sesiones presenciales de 90 minutos. Antes de iniciar las actividades se verificó la disponibilidad de los consentimientos y asentimientos, se asignaron códigos a los participantes y se recordaron las normas de uso seguro de la inteligencia artificial.
En la primera sesión se explicó, mediante ejemplos adecuados al nivel educativo, el funcionamiento general de la inteligencia artificial generativa. Se abordaron los conceptos de alucinación, error factual, desinformación, estereotipo, generalización y sesgo algorítmico. Posteriormente, se desarrolló un ejercicio de familiarización con un texto diferente de los ocho contenidos incluidos en el análisis.
En la segunda sesión, los estudiantes examinaron individualmente cuatro contenidos y registraron los errores encontrados. Cada señalamiento debía estar acompañado por una explicación que indicara por qué la información se consideraba falsa, contradictoria o imprecisa.
Durante la tercera sesión analizaron los cuatro contenidos restantes. La actividad se concentró en la identificación de sesgos y en la verificación de la información mediante fuentes educativas. Después del análisis individual, los estudiantes compararon sus observaciones en parejas. El intercambio tuvo la finalidad de permitir la revisión de las decisiones iniciales, sin reemplazar la producción individual.
En la cuarta sesión, los participantes corrigieron los fragmentos problemáticos y registraron las fuentes utilizadas para fundamentar las modificaciones. Las entrevistas comenzaron después de las actividades y continuaron mediante encuentros individuales fuera del horario habitual de clases, debido a que su duración total excedía el tiempo de una sola sesión. El investigador realizó las preguntas sin comunicar a los estudiantes si sus respuestas eran correctas o incorrectas.
Tabla 3: Organización de las sesiones de trabajo
|
Sesión |
Duración |
Actividades |
|
1 |
90 minutos |
Introducción a la IA generativa; explicación de errores, alucinaciones y sesgos; ejercicio de familiarización |
|
2 |
90 minutos |
Análisis individual de cuatro contenidos; identificación y registro de errores |
|
3 |
90 minutos |
Análisis de cuatro contenidos adicionales; reconocimiento de sesgos; verificación con fuentes; contraste en parejas |
|
4 |
90 minutos |
Corrección fundamentada de los contenidos; registro de fuentes e inicio de las entrevistas |
|
Entrevistas |
20–30 minutos por participante |
Entrevistas individuales realizadas fuera del horario regular de clases |
Nota. Los estudiantes dispusieron de 90 minutos para analizar cada bloque de cuatro contenidos. La persona docente proporcionó orientaciones procedimentales y supervisó el uso seguro de ChatGPT, pero no señaló directamente los errores ni los sesgos.
Categorías de análisis
Las categorías iniciales se establecieron antes de las entrevistas a partir del objetivo de investigación y de la revisión teórica. Se utilizó una estructura flexible que permitió incorporar códigos y categorías emergentes cuando los datos aportaron dimensiones no previstas. Esta combinación respondió a una lógica deductiva e inductiva propia del análisis temático reflexivo (Braun & Clarke, 2021).
Tabla 4: Categorías iniciales de análisis
|
Categoría |
Definición operativa |
Aspectos examinados |
|
Detección de errores |
Capacidad para reconocer información incorrecta o inconsistente en contenidos generados mediante IA |
Datos falsos, contradicciones, imprecisiones, fechas o nombres incorrectos y referencias inexistentes |
|
Reconocimiento de sesgos |
Capacidad para identificar representaciones parciales o injustificadamente generalizadas |
Estereotipos, exclusiones, generalizaciones y representaciones desequilibradas |
|
Estrategias de verificación |
Procedimientos utilizados para comprobar la validez de la información |
Consulta de fuentes, comparación de respuestas, búsqueda de evidencias y solicitud de ayuda |
|
Criterios de confiabilidad |
Características consideradas para aceptar o rechazar una fuente o afirmación |
Autoridad, evidencia, coherencia, actualidad y coincidencia entre fuentes |
|
Actitud frente a la IA |
Posición adoptada frente a la utilidad y credibilidad de la herramienta |
Confianza, duda, dependencia, utilidad percibida y disposición para cuestionar |
|
Pensamiento crítico |
Procesos empleados para examinar y reformular la información |
Análisis, evaluación, argumentación, formulación de juicios y corrección fundamentada |
Nota. Las categorías funcionaron como referentes iniciales y no como una estructura cerrada. Durante la codificación se admitió la incorporación de categorías emergentes sustentadas en las entrevistas, producciones escritas y notas de campo.
Análisis de la información
Se aplicó análisis temático mixto, combinando codificación deductiva e inductiva. El proceso siguió seis momentos: familiarización con la información; codificación inicial; agrupación de códigos; construcción de temas; revisión y delimitación temática; y elaboración interpretativa (Braun & Clarke, 2021).
En primer lugar, las transcripciones fueron leídas junto con las notas de campo y las producciones escritas. Posteriormente, dos investigadores codificaron los fragmentos relacionados con los criterios, estrategias, dificultades, actitudes y argumentos de los participantes. La codificación se efectuó manualmente mediante una matriz de Excel.
La matriz incluyó las columnas: participante, pregunta, fragmento textual, categoría, subcategoría, código, definición del código, interpretación, fuente de triangulación y observación analítica. Los códigos elaborados por ambos investigadores fueron comparados. Las discrepancias se resolvieron mediante discusión, revisión de las transcripciones y contraste con las producciones escritas.
Las frecuencias de aparición de los códigos se registraron únicamente como apoyo descriptivo para reconocer patrones recurrentes. No se utilizaron para realizar inferencias estadísticas ni para transformar el estudio cualitativo en un diseño cuantitativo. Las interpretaciones se respaldaron mediante citas textuales identificadas con los códigos E01–E18.
Criterios de rigor científico
El rigor se sustentó en los criterios de credibilidad, dependencia, confirmabilidad y transferibilidad. La credibilidad se fortaleció mediante la triangulación de entrevistas, producciones escritas y notas de campo, así como a través de la revisión de algunas interpretaciones con los participantes. La dependencia se atendió mediante el registro de las decisiones analíticas y la revisión de la codificación por un segundo investigador.
La confirmabilidad se apoyó en la conservación de las transcripciones, los códigos y las evidencias utilizadas para sustentar cada interpretación. La transferibilidad se favoreció mediante la descripción del contexto, las características de los participantes, los materiales y el procedimiento. Además, se incorporaron citas textuales anonimizadas para mantener una conexión verificable entre las interpretaciones y los testimonios. La presentación metodológica consideró principios de transparencia recomendados para estudios cualitativos basados en entrevistas (O’Brien et al., 2014; Tong et al., 2007).
Consideraciones éticas
Antes de iniciar el estudio se obtuvo autorización escrita de la institución. Los representantes legales firmaron el consentimiento informado y los estudiantes expresaron su asentimiento. Se comunicó que la participación era voluntaria y que podían retirarse en cualquier momento, sin sanciones ni consecuencias académicas. La actividad no estuvo asociada con calificaciones.
Para preservar el anonimato, se emplearon los códigos E01–E18 y se eliminaron nombres, paralelos específicos y otros datos identificables. El consentimiento contempló el empleo académico de citas textuales anonimizadas. Los audios y transcripciones se almacenaron en una carpeta cifrada y protegida mediante contraseña, accesible únicamente para los investigadores.
La protección de los menores durante el uso de ChatGPT incluyó supervisión docente permanente, utilización de una cuenta preparada para la actividad, prohibición de introducir datos personales, acceso limitado a contenidos educativos y revisión previa de los materiales. También se proporcionó orientación sobre los riesgos asociados con información falsa, referencias inexistentes y resultados sesgados.
RESULTADOS
El análisis integró 18 entrevistas individuales, 18 producciones escritas, 144 registros de evaluación correspondientes a ocho contenidos educativos y 18 notas de campo. Las entrevistas generaron 457 minutos de grabación, con una duración individual de entre 20 y 30 minutos. La triangulación permitió contrastar lo expresado por los participantes con los errores y sesgos señalados, las correcciones propuestas y las conductas observadas durante las actividades.
Detección de errores y sesgos
Los participantes identificaron problemas en 132 de las 144 evaluaciones realizadas, equivalentes al 91,7 % de los registros. Los contenidos T01–T04 fueron cuestionados por 17 estudiantes cada uno, mientras que T05–T08 fueron identificados como problemáticos por 16 participantes. El registro detallado reunió 256 señalamientos de errores y 73 de sesgos.
Tabla 5: Detección de errores y sesgos según el contenido analizado
|
Contenido |
Tema |
Participantes que detectaron el problema, n (%) |
Errores señalados |
Sesgos señalados |
|
T01 |
Cambio climático |
17 (94,4) |
33 |
0 |
|
T02 |
Alimentación y salud |
17 (94,4) |
33 |
0 |
|
T03 |
Diversidad cultural del Ecuador |
17 (94,4) |
33 |
25 |
|
T04 |
Texto argumentativo |
17 (94,4) |
33 |
0 |
|
T05 |
Participación histórica de las mujeres |
16 (88,9) |
31 |
24 |
|
T06 |
Regiones naturales del Ecuador |
16 (88,9) |
31 |
24 |
|
T07 |
Ecosistemas |
16 (88,9) |
31 |
0 |
|
T08 |
Confiabilidad de las fuentes |
16 (88,9) |
31 |
0 |
|
Total |
— |
132 de 144 registros (91,7) |
256 |
73 |
Nota. Un participante podía señalar más de un error o sesgo en cada contenido. Por ello, las cantidades corresponden a señalamientos codificados y no a estudiantes únicos. Los porcentajes se calcularon respecto de los 18 participantes.
Los errores factuales más fácilmente reconocidos estuvieron relacionados con ubicaciones geográficas, fechas, contradicciones internas y afirmaciones incompatibles con los conocimientos trabajados previamente. En las entrevistas, E01 indicó: “Reconocí con facilidad los datos geográficos que no coincidían con lo estudiado”. De forma semejante, E02 manifestó que “las fechas incorrectas y las contradicciones fueron lo más evidente”.
La revisión de las producciones confirmó que los estudiantes podían detectar con mayor rapidez afirmaciones comprobables mediante conocimientos disciplinares o fuentes directas. No obstante, el reconocimiento inicial no siempre estuvo acompañado por una justificación suficiente. En 48 de los 144 registros, la evidencia aportada fue valorada como alta; en 84, como media; y en 12, como insuficiente. Estos últimos 12 casos requirieron acompañamiento docente para localizar o interpretar fuentes apropiadas.
Apariencia de veracidad de los contenidos
La primera categoría recurrente estuvo relacionada con la apariencia de veracidad de las respuestas. Los 18 participantes señalaron que la organización, fluidez y seguridad expresiva de los textos influyeron inicialmente en su valoración. E01 explicó: “La presentación ordenada me hizo confiar al inicio; luego entendí que la forma no garantiza que el contenido sea verdadero”. Por su parte, E02 indicó: “Al comienzo parecían correctos porque estaban bien escritos, pero después noté afirmaciones demasiado seguras”.
Las entrevistas mostraron que la calidad formal del texto funcionó como un primer indicador de confiabilidad, aunque este criterio se modificó después de la comprobación de los contenidos. Las notas de campo registraron una disminución de la seguridad inicial cuando los participantes encontraron contradicciones entre las respuestas de ChatGPT y las fuentes consultadas.
Reconocimiento de sesgos
La identificación de sesgos se presentó en 14 participantes. Los contenidos más relevantes para esta categoría fueron T03, relacionado con la diversidad cultural del Ecuador; T05, sobre la participación histórica de las mujeres; y T06, referido a las regiones naturales y culturales del país. En estos materiales se registraron 73 señalamientos asociados con homogeneización cultural, invisibilización de grupos, estereotipos de género y representaciones territoriales desequilibradas.
E01 señaló que el contenido sobre Ecuador “trataba a pueblos y regiones como si todos fueran iguales y dejaba fuera su diversidad”. E02 identificó el sesgo de género al observar que “el texto sobre las mujeres presentaba el liderazgo masculino como algo natural y reducía los aportes femeninos”.
Los sesgos implícitos y las referencias inexistentes constituyeron las dificultades más frecuentes. En las producciones escritas, 14 estudiantes señalaron como principal dificultad la comprobación de referencias aparentemente académicas, mientras que cuatro indicaron que les resultó más complejo reconocer sesgos implícitos. E01 explicó que “los sesgos fueron más difíciles porque algunas generalizaciones parecían normales al leerlas rápido”. Según E02, las referencias inexistentes resultaron difíciles de reconocer “porque tenían apariencia académica”.
Estrategias de verificación y criterios de confiabilidad
La verificación externa apareció en los testimonios de 16 participantes. Las estrategias comprendieron la consulta de libros escolares, la búsqueda en páginas institucionales, la comparación entre fuentes y la solicitud de orientación docente cuando existían discrepancias.
En las producciones escritas, 12 estudiantes registraron como estrategia principal la búsqueda institucional acompañada del contraste de información. Los seis restantes combinaron la comparación de fuentes con la consulta docente. E01 describió su procedimiento de la siguiente manera: “Consulté el libro, páginas institucionales y comparé al menos dos fuentes antes de corregir”. E02 expresó: “Busqué el tema con palabras clave, revisé quién publicaba y pedí ayuda cuando las fuentes no coincidían”.
Los criterios empleados para valorar la confiabilidad fueron la identificación de la institución responsable, la autoría, la fecha de publicación, la presencia de evidencias y la coincidencia entre fuentes. E02 manifestó: “Consideré la institución responsable, la fecha, el autor y la evidencia presentada”. Las notas de campo confirmaron que algunos estudiantes anotaron los enlaces consultados, mientras que otros registraron autoría y fecha antes de modificar sus respuestas.
La comparación de fuentes también produjo modificaciones en los juicios iniciales. E01 reconoció: “Cambié varias respuestas cuando encontré evidencia que contradecía lo que yo pensaba”. E02 añadió que el contraste le permitió advertir que su conocimiento previo también podía ser incompleto.
Actitud frente a la inteligencia artificial
La confianza cautelosa estuvo presente en 15 participantes. Los testimonios no mostraron un rechazo general a ChatGPT, sino una valoración condicionada por la posibilidad de verificar sus resultados. E01 declaró: “Confío con cautela: puede explicar bien y al mismo tiempo inventar datos o referencias”. E02 consideró que la herramienta era “útil para empezar, pero no suficiente para decidir que algo es verdadero”.
Los participantes expresaron mayor precaución ante contenidos relacionados con salud, historia, información científica y datos exactos. Asimismo, indicaron que volverían a utilizar la inteligencia artificial para obtener ideas, explicaciones iniciales o preguntas, aunque no como única fuente. E01 manifestó que la emplearía “para generar ideas y preguntas”, pero comprobaría los datos y las referencias antes de incorporarlos a una tarea. E02 señaló que la utilizaría “como apoyo, no como única fuente”.
Revisión del propio juicio y conciencia metacognitiva
La revisión del propio juicio se identificó en 12 participantes. Este patrón comprendió el reconocimiento de dudas, la aceptación de conocimientos insuficientes y la modificación de interpretaciones después de consultar evidencias. E01 afirmó: “Descubrí que debo detenerme, formular preguntas y reconocer cuando no tengo evidencia suficiente”. E02 indicó: “Aprendí que a veces confundo seguridad al escribir con confiabilidad”.
Las correcciones elaboradas siguieron principalmente una secuencia de tres acciones: identificación de la afirmación problemática, explicación del error y formulación de una alternativa respaldada por fuentes. E01 describió este procedimiento al señalar: “Escribí la afirmación problemática, expliqué el error y añadí una corrección respaldada por una fuente”. E02 destacó que procuró relacionar cada modificación con evidencia para evitar reemplazar una opinión por otra.
Aprendizaje colaborativo
El aprendizaje colaborativo surgió como categoría emergente en las notas de campo. En nueve participantes se registró explícitamente el contraste del razonamiento con un compañero sin reproducción directa de la respuesta. El diálogo permitió revisar interpretaciones iniciales, considerar señales no advertidas individualmente y decidir qué información debía comprobarse.
En los nueve casos restantes, la interacción predominante consistió en solicitar orientación docente para distinguir entre opinión, evidencia, error factual y contenido sesgado. La colaboración no sustituyó la respuesta individual, debido a que cada estudiante debía registrar y justificar sus propias decisiones.
Síntesis de categorías
Tabla 6: Frecuencia descriptiva de categorías y patrones identificados
|
Categoría |
Patrón principal |
Participantes, n |
Porcentaje |
|
Detección de errores |
Apariencia de veracidad |
18 |
100,0 |
|
Detección de errores |
Reconocimiento de datos y contradicciones |
15 |
83,3 |
|
Reconocimiento de sesgos |
Identificación de estereotipos y exclusiones |
14 |
77,8 |
|
Estrategias de verificación |
Consulta y comparación de fuentes |
16 |
88,9 |
|
Actitud frente a la IA |
Confianza cautelosa |
15 |
83,3 |
|
Pensamiento crítico |
Revisión del propio juicio |
12 |
66,7 |
|
Conciencia metacognitiva |
Reconocimiento de límites personales |
12 |
66,7 |
|
Aprendizaje colaborativo |
Contraste explícito con compañeros |
9 |
50,0 |
Nota. Las frecuencias poseen una función exclusivamente descriptiva. Las categorías no son mutuamente excluyentes; un participante podía aportar evidencia en varias de ellas.
La triangulación mostró correspondencia entre los testimonios, las producciones escritas y las notas de campo. La detección de errores factuales estuvo respaldada por señalamientos y correcciones en las fichas; la verificación externa coincidió con el uso registrado de libros y páginas institucionales; y la revisión del propio juicio se observó en las modificaciones realizadas después de contrastar información.
Tabla 7: Triangulación de los principales hallazgos
|
Hallazgo |
Entrevistas |
Producciones escritas |
Notas de campo |
|
La forma del texto generó confianza inicial |
Referencias a organización, fluidez y seguridad |
Revisión posterior de afirmaciones inicialmente aceptadas |
Disminución de la seguridad después del contraste |
|
Los errores factuales fueron más visibles |
Identificación de fechas, ubicaciones y contradicciones |
Señalamiento y corrección de datos verificables |
Detección rápida de errores concretos |
|
Los sesgos presentaron mayor dificultad |
Reconocimiento de generalizaciones y exclusiones |
Menor facilidad para justificar sesgos implícitos |
Mayor tiempo de análisis y solicitud de orientación |
|
La verificación se apoyó en fuentes externas |
Consulta de libros y páginas institucionales |
Registro de entre tres y cinco fuentes por estudiante |
Anotación de autoría, fecha y enlaces |
|
La confianza en ChatGPT fue condicionada |
Valoración de la herramienta como apoyo |
Correcciones respaldadas por fuentes externas |
Mayor cautela después de descubrir información falsa |
|
El análisis produjo revisión metacognitiva |
Reconocimiento de dudas y limitaciones |
Modificación fundamentada de respuestas |
Cambios de opinión después de contrastar evidencia |
Nota. La triangulación se realizó entre las 18 entrevistas, las 18 producciones escritas y las 18 notas de campo.
En conjunto, los resultados muestran que los estudiantes pudieron reconocer una proporción elevada de los contenidos problemáticos, particularmente cuando contenían errores factuales evidentes. La identificación de sesgos y referencias inexistentes presentó mayores dificultades. La verificación mediante fuentes externas, la confianza condicionada en la inteligencia artificial y la revisión del propio juicio constituyeron los principales patrones vinculados con el pensamiento crítico.
DISCUSIÓN
El objetivo de la investigación fue analizar la capacidad de estudiantes de Educación General Básica para detectar errores y sesgos en contenidos educativos producidos mediante inteligencia artificial generativa, considerando sus criterios de evaluación y estrategias de verificación. Los resultados muestran que los participantes identificaron una proporción elevada de los contenidos problemáticos; sin embargo, esta capacidad no fue uniforme. Los errores factuales, las contradicciones y los datos geográficos incorrectos fueron reconocidos con mayor facilidad, mientras que los sesgos implícitos y las referencias inexistentes demandaron procesos de análisis más complejos.
Un primer hallazgo relevante fue la influencia de la presentación formal de los textos en la confianza inicial. La totalidad de los participantes señaló que la organización, fluidez y seguridad discursiva de las respuestas favorecieron inicialmente su aceptación. Esta percepción coincide con Kasneci et al. (2023), quienes advierten que los modelos generativos pueden producir respuestas lingüísticamente convincentes aunque incluyan información incorrecta. De manera similar, Ji et al. (2023) explican que las alucinaciones de los modelos de lenguaje resultan especialmente problemáticas cuando la información falsa se integra en textos coherentes y plausibles. Los hallazgos sugieren que los estudiantes pueden confundir calidad expresiva con validez epistemológica cuando no disponen de criterios explícitos para diferenciar ambas dimensiones.
La apariencia de veracidad también ayuda a comprender por qué algunos estudiantes aceptaron inicialmente afirmaciones que luego corrigieron al consultar otras fuentes. El hallazgo converge con Lee et al. (2025), quienes identificaron que la confianza en los sistemas generativos puede reducir el esfuerzo percibido necesario para evaluar críticamente sus respuestas. En el presente estudio, la revisión no surgió de manera automática, sino después de que la actividad solicitara expresamente identificar problemas, justificar las decisiones y aportar evidencia. Por tanto, la disponibilidad de una herramienta generativa no garantiza el pensamiento crítico; este depende de las demandas cognitivas incorporadas al diseño de la actividad.
La detección de datos falsos y contradicciones fue más frecuente que el reconocimiento de sesgos. Esta diferencia puede explicarse porque un error factual suele contrastarse con una fuente o conocimiento disciplinar concreto, mientras que un sesgo requiere examinar los supuestos, las omisiones y las representaciones sociales presentes en el discurso. Weidinger et al. (2022) señalan que los riesgos de los modelos de lenguaje no se limitan a la inexactitud, sino que comprenden la reproducción de estereotipos, exclusiones y desigualdades procedentes de los datos y contextos utilizados en su desarrollo. En consecuencia, reconocer que una fecha o ubicación es incorrecta constituye una operación distinta de advertir que un texto naturaliza roles de género o invisibiliza la diversidad cultural.
Los contenidos sobre diversidad cultural, participación histórica de las mujeres y representación de las regiones ecuatorianas permitieron observar esta diferencia. Aunque 14 estudiantes identificaron estereotipos o exclusiones, algunos necesitaron más tiempo y orientación para explicar por qué una generalización resultaba problemática. Este resultado refuerza la necesidad de entender la alfabetización en inteligencia artificial como una competencia que trasciende el conocimiento técnico. Long y Magerko (2020) y Ng et al. (2021) sostienen que dicha alfabetización debe incluir capacidades para evaluar críticamente los resultados, comprender sus limitaciones y reconocer sus implicaciones sociales y éticas.
La dificultad para comprobar referencias inexistentes constituye otro hallazgo significativo. La mayoría de los estudiantes indicó que las referencias con nombres, fechas o títulos aparentemente académicos resultaban difíciles de cuestionar. Esta situación refleja una característica relevante de los modelos generativos: pueden producir información bibliográfica plausible sin que las fuentes mencionadas existan. UNESCO (2023) advierte que los contenidos generados deben someterse a validación humana y que los usuarios necesitan comprender que estos sistemas no funcionan como bases documentales verificadas. Desde el punto de vista educativo, enseñar a utilizar inteligencia artificial exige incorporar procedimientos para comprobar la existencia, autoría, fecha y correspondencia de las fuentes citadas.
Las estrategias de verificación constituyeron una dimensión central de la capacidad crítica observada. Dieciséis participantes recurrieron a fuentes externas y la mayoría combinó libros escolares, páginas institucionales y comparación entre documentos. Este comportamiento se corresponde con la alfabetización crítica en inteligencia artificial, pues los estudiantes no se limitaron a detectar una posible inconsistencia, sino que buscaron evidencias para confirmarla y formular una corrección. La relevancia de este proceso radica en que evita sustituir una afirmación generada por la IA por una opinión personal igualmente carente de respaldo.
Los criterios de confiabilidad mencionados —institución responsable, autoría, fecha, evidencia y coincidencia entre fuentes— muestran una transición desde indicadores superficiales hacia criterios documentales. No obstante, la calidad de la evidencia fue valorada como media en la mayoría de los registros y como insuficiente en 12 casos. Este resultado evidencia que reconocer la necesidad de verificar no equivale necesariamente a saber hacerlo con profundidad. La alfabetización informacional y la alfabetización en inteligencia artificial deben desarrollarse de manera articulada, debido a que la evaluación de una respuesta generativa requiere localizar, seleccionar e interpretar fuentes independientes.
La confianza cautelosa identificada en 15 estudiantes refleja una actitud más compleja que la aceptación o el rechazo absoluto de ChatGPT. Los participantes reconocieron su utilidad para iniciar una búsqueda, producir ideas o recibir explicaciones, pero rechazaron considerarlo una fuente suficiente para establecer la verdad de una afirmación. Esta posición coincide con Doty y Lipien (2024), quienes encontraron que estudiantes de secundaria valoraban las posibilidades educativas de ChatGPT y, simultáneamente, expresaban preocupación por la dependencia tecnológica y la pérdida de pensamiento crítico. Asimismo, Tlili et al. (2023) sostienen que el valor educativo de los chatbots depende de una integración que mantenga el juicio humano y la verificación de los resultados.
La confianza condicionada resulta especialmente importante frente al riesgo de dependencia. Zhai et al. (2024) concluyen que la aceptación no cuestionada de respuestas generadas puede afectar el razonamiento analítico y la toma de decisiones. Fan et al. (2025) denominan “pereza metacognitiva” a la transferencia de procesos de planificación, supervisión y evaluación hacia la inteligencia artificial. En contraste, los estudiantes de este estudio debieron detenerse, formular preguntas, buscar evidencias y modificar sus propias respuestas. El diseño de la actividad convirtió el contenido incorrecto en un estímulo para la evaluación, en lugar de permitir que la herramienta sustituyera el proceso cognitivo.
La revisión del propio juicio, identificada en 12 participantes, representa uno de los aportes más relevantes. Los estudiantes no solo corrigieron información generada por ChatGPT, sino que reconocieron que sus conocimientos previos también podían ser incompletos. Esta conciencia metacognitiva se manifestó cuando admitieron dudas, reconsideraron decisiones y modificaron interpretaciones a partir de nuevas evidencias. En este sentido, el pensamiento crítico no se expresó únicamente como capacidad para señalar errores externos, sino como disposición para revisar las propias creencias.
El aprendizaje colaborativo también contribuyó al proceso de revisión. En nueve participantes se observó contraste explícito con compañeros, mientras que los demás recurrieron principalmente a la orientación docente. El intercambio permitió identificar elementos no advertidos de manera individual, aunque la justificación final permaneció bajo responsabilidad de cada estudiante. Este resultado muestra que la detección de errores y sesgos puede fortalecerse mediante el diálogo, siempre que la colaboración no se limite a reproducir respuestas y exija explicar los criterios utilizados.
La mediación docente fue particularmente importante cuando las fuentes ofrecían información diferente o cuando los estudiantes no lograban distinguir entre una opinión y una afirmación respaldada por evidencia. Alfarwan (2025) señala que la investigación sobre inteligencia artificial generativa en contextos K–12 continúa siendo limitada y que su incorporación requiere estructuras pedagógicas adecuadas. De forma similar, Zhang y Tur (2024) destacan la necesidad de acompañamiento, orientación ética y alfabetización específica para integrar ChatGPT en la educación escolar. Los resultados del presente estudio respaldan esta posición, pues las capacidades críticas se hicieron visibles dentro de una secuencia guiada, con fuentes disponibles, consignas explícitas y supervisión docente.
En el contexto ecuatoriano, los hallazgos amplían una línea de investigación todavía emergente. Vallejo Rodríguez et al. (2025) identificaron que la incorporación de inteligencia artificial en la Educación Básica del país se encuentra acompañada por desafíos de infraestructura, formación docente e integración pedagógica. Altafuya Rojas y Suárez Tigse (2026) también evidenciaron la necesidad de fortalecer el uso crítico y responsable de herramientas generativas entre estudiantes ecuatorianos. El aporte del presente estudio consiste en desplazar el análisis desde la percepción general de utilidad hacia prácticas observables de evaluación: detectar, justificar, contrastar y corregir contenidos educativos.
Los resultados permiten sostener que la detección de errores y sesgos no debe evaluarse mediante una única respuesta correcta. Se trata de un proceso compuesto por varias operaciones: sospechar de una afirmación, explicar la causa de la duda, localizar evidencia pertinente, valorar la fuente y formular una corrección argumentada. Un estudiante puede reconocer que un contenido es problemático y, aun así, presentar dificultades para justificarlo. Esta distinción resulta relevante para diseñar actividades y criterios de evaluación que no reduzcan el pensamiento crítico a la identificación superficial de errores.
El estudio presenta algunas limitaciones. En primer lugar, se desarrolló con 18 estudiantes de una única institución fiscal, seleccionados intencionalmente, por lo que los hallazgos no pueden generalizarse estadísticamente a toda la población escolar. En segundo lugar, los contenidos fueron preparados deliberadamente con errores y sesgos, lo que aseguró equivalencia entre participantes, pero no reproduce completamente la interacción espontánea con una herramienta generativa. En tercer lugar, la explicación previa de los conceptos pudo aumentar la sensibilidad de los estudiantes frente a los problemas incluidos.
Otra limitación corresponde al carácter breve de la experiencia. El estudio permitió describir las estrategias desplegadas durante cuatro sesiones, pero no establecer si estas se mantendrían en situaciones futuras o sin supervisión docente. Tampoco se aplicó una medición previa y posterior que permitiera determinar cambios atribuibles a la intervención. Además, no se registró la versión específica del modelo de ChatGPT, aspecto que limita la reproducibilidad tecnológica debido a la actualización continua de estas herramientas.
Las frecuencias utilizadas tuvieron una finalidad descriptiva y no deben interpretarse como pruebas de diferencias entre grupos. Aunque participaron estudiantes con y sin experiencia previa en inteligencia artificial, el diseño cualitativo y el tamaño de la muestra no permiten establecer asociaciones concluyentes entre experiencia tecnológica y capacidad crítica. Del mismo modo, las citas y producciones representan respuestas situadas dentro de una actividad pedagógica específica.
Futuras investigaciones deberían desarrollar estudios longitudinales y comparativos en distintas instituciones, niveles educativos y contextos socioculturales. También sería pertinente evaluar la detección de errores sin advertir previamente a los estudiantes que los contenidos presentan problemas, comparar diferentes herramientas generativas y analizar la transferencia de las estrategias de verificación a tareas escolares auténticas. Asimismo, convendría diseñar instrumentos que distingan entre detección factual, reconocimiento de sesgos, calidad de la evidencia y capacidad de corrección argumentada.
En síntesis, los hallazgos muestran que los estudiantes pueden cuestionar contenidos producidos mediante inteligencia artificial cuando participan en actividades que exigen verificación, argumentación y revisión del propio juicio. La principal contribución del estudio radica en evidenciar que el pensamiento crítico frente a la inteligencia artificial no depende exclusivamente del acceso a la tecnología ni de la frecuencia de uso, sino de las condiciones pedagógicas que obligan a contrastar sus respuestas con conocimientos, fuentes y perspectivas diversas.
CONCLUSIÓN
Los estudiantes de octavo año de Educación General Básica demostraron capacidad para detectar errores y sesgos en contenidos educativos generados mediante inteligencia artificial. No obstante, esta capacidad presentó distintos niveles de complejidad: los errores factuales, las contradicciones y los datos geográficos incorrectos fueron reconocidos con mayor facilidad que los sesgos implícitos, las generalizaciones y las referencias inexistentes.
La fluidez, organización y seguridad discursiva de los contenidos generaron confianza inicial, incluso cuando contenían información problemática. Este hallazgo evidencia que la calidad formal de una respuesta no constituye un criterio suficiente para determinar su veracidad. La capacidad crítica se manifestó cuando los estudiantes superaron esa primera impresión, formularon dudas y contrastaron la información con fuentes externas.
La consulta de libros, páginas institucionales y documentos con autoría y fecha permitió fundamentar las correcciones. Sin embargo, algunos participantes reconocieron el problema sin justificarlo mediante evidencia suficiente. Por ello, la detección debe comprenderse como un proceso que integra identificación, explicación, verificación y corrección argumentada, y no únicamente como el señalamiento de una respuesta incorrecta.
La revisión del propio juicio y el reconocimiento de las limitaciones personales constituyeron expresiones relevantes del pensamiento crítico. Los participantes no solo cuestionaron las respuestas de ChatGPT, sino que también modificaron conocimientos e interpretaciones previas cuando encontraron evidencia contradictoria. El diálogo con compañeros y la orientación docente favorecieron este proceso sin sustituir la responsabilidad individual sobre las decisiones adoptadas.
El aporte científico del estudio consiste en mostrar, desde un contexto ecuatoriano de Educación Básica, cómo se concreta la evaluación crítica de contenidos generativos en prácticas observables. Los hallazgos permiten reconocer que la alfabetización en inteligencia artificial debe incorporar la detección de errores, el análisis de sesgos, la evaluación de fuentes y la reflexión metacognitiva.
En conclusión, la inteligencia artificial generativa puede emplearse como recurso educativo siempre que sus respuestas sean tratadas como contenidos susceptibles de revisión y no como fuentes incuestionables. Su incorporación pedagógica debe incluir actividades deliberadas de contraste, argumentación y verificación, acompañadas por mediación docente. Debido al carácter cualitativo, contextual y acotado del estudio, estas conclusiones no pretenden generalizarse estadísticamente, sino aportar criterios para futuras investigaciones y propuestas formativas sobre el uso crítico y responsable de la inteligencia artificial.
REFERENCIAS
Alfarwan, A. A. (2025). Generative AI use in K–12 education: A systematic review. Frontiers in Education, 10, 1647573. https://doi.org/10.3389/feduc.2025.1647573
Altafuya Rojas, C. P., & Suárez Tigse, F. A. (2026). Uso y percepción de la inteligencia artificial en estudiantes de bachillerato ecuatoriano. LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, 7(1). https://doi.org/10.56712/latam.v7i1.5493
Braun, V., & Clarke, V. (2021). Thematic analysis: A practical guide. SAGE.
Creswell, J. W., & Poth, C. N. (2018). Qualitative inquiry and research design: Choosing among five approaches (4th ed.). SAGE.
Doty, K., & Lipien, L. (2024). Student perceptions and attitudes about the usage of ChatGPT in online K–12 education and student preferences about learning to use artificial intelligence from teachers. American Journal of Educational Research, 12(9), 348–355. https://doi.org/10.12691/education-12-9-2
Fan, Y., Tang, L., Le, H., Shen, K., Tan, S., Zhao, Y., Shen, Y., Li, X., & Gašević, D. (2025). Beware of metacognitive laziness: Effects of generative artificial intelligence on learning motivation, processes, and performance. British Journal of Educational Technology, 56(2), 489–530. https://doi.org/10.1111/bjet.13544
Hennink, M., & Kaiser, B. N. (2022). Sample sizes for saturation in qualitative research: A systematic review of empirical tests. Social Science & Medicine, 292, 114523. https://doi.org/10.1016/j.socscimed.2021.114523
Ji, Z., Lee, N., Frieske, R., Yu, T., Su, D., Xu, Y., Ishii, E., Bang, Y. J., Madotto, A., & Fung, P. (2023). Survey of hallucination in natural language generation. ACM Computing Surveys, 55(12), Article 248. https://doi.org/10.1145/3571730
Kasneci, E., Sessler, K., Küchemann, S., Bannert, M., Dementieva, D., Fischer, F., Gasser, U., Groh, G., Günnemann, S., Hüllermeier, E., Krusche, S., Kutyniok, G., Michaeli, T., Nerdel, C., Pfeffer, J., Poquet, O., Sailer, M., Schmidt, A., Seidel, T., … Kasneci, G. (2023). ChatGPT for good? On opportunities and challenges of large language models for education. Learning and Individual Differences, 103, 102274. https://doi.org/10.1016/j.lindif.2023.102274
Klarin, J., Hoff, E., Larsson, A., & Daukantaitė, D. (2024). Adolescents’ use and perceived usefulness of generative AI for schoolwork: Exploring their relationships with executive functioning and academic achievement. Frontiers in Artificial Intelligence, 7, 1415782. https://doi.org/10.3389/frai.2024.1415782
Lee, H.-P., Sarkar, A., Tankelevitch, L., Drosos, I., Rintel, S., Banks, R., & Wilson, N. (2025). The impact of generative AI on critical thinking: Self-reported reductions in cognitive effort and confidence effects from a survey of knowledge workers. In Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems (Article 1121, pp. 1–22). Association for Computing Machinery. https://doi.org/10.1145/3706598.3713778
Long, D., & Magerko, B. (2020). What is AI literacy? Competencies and design considerations. In Proceedings of the 2020 CHI Conference on Human Factors in Computing Systems (pp. 1–16). Association for Computing Machinery. https://doi.org/10.1145/3313831.3376727
Ng, D. T. K., Leung, J. K. L., Chu, S. K. W., & Qiao, M. S. (2021). Conceptualizing AI literacy: An exploratory review. Computers and Education: Artificial Intelligence, 2, 100041. https://doi.org/10.1016/j.caeai.2021.100041
O’Brien, B. C., Harris, I. B., Beckman, T. J., Reed, D. A., & Cook, D. A. (2014). Standards for reporting qualitative research: A synthesis of recommendations. Academic Medicine, 89(9), 1245–1251. https://doi.org/10.1097/ACM.0000000000000388
Tlili, A., Shehata, B., Adarkwah, M. A., Bozkurt, A., Hickey, D. T., Huang, R., & Agyemang, B. (2023). What if the devil is my guardian angel: ChatGPT as a case study of using chatbots in education. Smart Learning Environments, 10, Article 15. https://doi.org/10.1186/s40561-023-00237-x
Tong, A., Sainsbury, P., & Craig, J. (2007). Consolidated criteria for reporting qualitative research (COREQ): A 32-item checklist for interviews and focus groups. International Journal for Quality in Health Care, 19(6), 349–357. https://doi.org/10.1093/intqhc/mzm042
UNESCO. (2023). Guidance for generative AI in education and research. https://unesdoc.unesco.org/ark:/48223/pf0000386693
Vallejo Rodríguez, F. W., Gómez Rivero, J. O., & Cruz López, W. O. (2025). Estado del arte de la inteligencia artificial en la Educación Básica del Ecuador: Una revisión sistemática. LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, 6(3), 1863–1882. https://doi.org/10.56712/latam.v6i3.4082
Weidinger, L., Uesato, J., Rauh, M., Griffin, C., Huang, P.-S., Mellor, J., Glaese, A., Cheng, M., Balle, B., Kasirzadeh, A., Biles, C., Brown, S., Kenton, Z., Hawkins, W., Stepleton, T., Birhane, A., Hendricks, L. A., Rimell, L., Isaac, W., … Gabriel, I. (2022). Taxonomy of risks posed by language models. In Proceedings of the 2022 ACM Conference on Fairness, Accountability, and Transparency (pp. 214–229). Association for Computing Machinery. https://doi.org/10.1145/3531146.3533088
Zhai, C., Wibowo, S., & Li, L. D. (2024). The effects of over-reliance on AI dialogue systems on students’ cognitive abilities: A systematic review. Smart Learning Environments, 11, Article 28. https://doi.org/10.1186/s40561-024-00316-7
Zhang, P., & Tur, G. (2024). A systematic review of ChatGPT use in K–12 education. European Journal of Education, 59, e12599. https://doi.org/10.1111/ejed.12599