Inteligencia artificial generativa y pensamiento crítico: detección estudiantil de errores y sesgos en contenidos educativos

 

Generative Artificial Intelligence and Critical Thinking: Students’ Detection of Errors and Biases in Educational Content

 

Bryan Oswaldo Valenzuela Espinoza1, Rocio Alexandra Malla Malla2, Briggitte Gisela Ochoa Cojitambo3, Diana María Guamán Moreno4 y Karla Paola Arízaga López5

¹Unidad educativa particular Santo Domingo de Guzmán Gualaceo, bryan.valenzuela@stodomingogualaceo.edu.ec, https://orcid.org/0009-0005-0504-1877, Ecuador

2Unidad educativa Dr. José María Velasco Ibarra, rocio.malla@educacion.gob.ec, https://orcid.org/0009-0004-7650-6902, Ecuador

3Unidad educativa Isabel de Castilla, briggitte.ochoa@docentes.educacion.edu.ec, https://orcid.org/0009-0001-1463 -5192, Ecuador

4Unidad Educativa Abdón Calderon Garaicoa, dianam.guaman@educacion.gob.ec, https://orcid.org/0000-0002-5446-8093, Ecuador

5Universidad Técnica de Machala, karlitaarizaga@gmail.com, https://orcid.org/0009-0003-6949-7086, Ecuador

 

Información del Artículo

 

RESUMEN

 

Trazabilidad:

Recibido 11-07-2026

Revisado 27-07-2026

Aceptado 15-09-2026

 

 

 

La expansión de la inteligencia artificial generativa en los entornos escolares plantea la necesidad de formar estudiantes capaces de evaluar la veracidad, confiabilidad e imparcialidad de sus respuestas. El objetivo de esta investigación fue analizar la capacidad de estudiantes de Educación Básica para detectar errores y sesgos en contenidos educativos producidos mediante inteligencia artificial generativa, considerando sus criterios de evaluación y estrategias de verificación. Se desarrolló un estudio cualitativo de caso con 18 estudiantes de octavo año de una institución educativa fiscal de Cuenca, Ecuador. Los participantes analizaron ocho contenidos generados mediante ChatGPT que incorporaban deliberadamente errores factuales, contradicciones, referencias inexistentes y sesgos de género, culturales, étnicos, geográficos, socioeconómicos y lingüísticos. La información se recopiló mediante entrevistas semiestructuradas, producciones escritas y notas de campo, y se examinó mediante análisis temático mixto y triangulación. Los estudiantes identificaron problemas en 132 de las 144 evaluaciones realizadas. Los errores factuales y las contradicciones fueron reconocidos con mayor facilidad que los sesgos implícitos y las referencias inexistentes. La organización y fluidez de los textos generaron confianza inicial; no obstante, la consulta de libros y fuentes institucionales favoreció la revisión de las respuestas. También se identificaron confianza cautelosa, conciencia metacognitiva y contraste colaborativo. Se concluye que la capacidad crítica frente a la inteligencia artificial no depende únicamente de su utilización, sino de actividades pedagógicas que exijan cuestionar, verificar, argumentar y corregir sus contenidos mediante evidencias.

Palabras Clave:

Alfabetización en inteligencia artificial

Contenidos educativos

Detección de errores

Inteligencia artificial generativa

Pensamiento crítico

 

Keywords:

AI literacy

Educational content

Error detection

Generative artificial intelligence

Critical thinking

 

ABSTRACT

The expansion of generative artificial intelligence in school environments has created a need to prepare students to evaluate the accuracy, reliability, and impartiality of AI-generated responses. This study aimed to analyze Basic Education students’ ability to detect errors and biases in educational content produced by generative artificial intelligence, considering their evaluation criteria and verification strategies. A qualitative case study was conducted with 18 eighth-grade students from a public educational institution in Cuenca, Ecuador. Participants analyzed eight pieces of educational content generated using ChatGPT that deliberately incorporated factual errors, contradictions, nonexistent references, and gender, cultural, ethnic, geographical, socioeconomic, and linguistic biases. Data were collected through semi-structured interviews, written student work, and field notes and were examined using mixed thematic analysis and source triangulation. Students identified problems in 132 of the 144 evaluations performed. Factual errors and contradictions were recognized more readily than implicit biases and fabricated references. The organization and fluency of the texts initially increased students’ trust; however, consulting textbooks and institutional sources prompted them to reconsider several responses. Cautious trust, metacognitive awareness, and collaborative comparison also emerged as relevant patterns. The study concludes that critical engagement with artificial intelligence does not depend solely on using the technology. It requires pedagogical activities that prompt students to question, verify, substantiate, and correct AI-generated content through evidence. Teacher mediation and explicit source-evaluation criteria are therefore essential for promoting responsible and critical use of generative artificial intelligence in Basic Education.

 

 

INTRODUCCIÓN

 

La inteligencia artificial generativa se ha incorporado con rapidez a las prácticas educativas cotidianas. Herramientas capaces de producir textos, explicaciones, ejercicios, resúmenes e imágenes ofrecen nuevas posibilidades para personalizar el aprendizaje, acceder a información y recibir retroalimentación inmediata. Sin embargo, su funcionamiento probabilístico impide asumir que los contenidos generados son necesariamente correctos, pertinentes o imparciales. Estos sistemas pueden elaborar respuestas lingüísticamente convincentes que contienen datos falsos, referencias inexistentes, razonamientos inconsistentes o representaciones sesgadas, lo que plantea desafíos para su utilización educativa responsable (Kasneci et al., 2023; UNESCO, 2023).

La aparente coherencia de las respuestas generadas constituye una dificultad particular para los estudiantes. Los modelos de lenguaje producen sus resultados mediante patrones estadísticos aprendidos de grandes conjuntos de datos, sin verificar la verdad de cada afirmación ni comprender el contenido en el sentido humano del término. Por esta razón, pueden presentar información incorrecta con un nivel elevado de seguridad discursiva, fenómeno denominado comúnmente “alucinación” de la inteligencia artificial (Ji et al., 2023). Asimismo, los datos empleados para entrenar estos sistemas pueden reproducir prejuicios culturales, lingüísticos, sociales o de género presentes en las fuentes originales, de manera que sus resultados no son neutrales ni están exentos de consecuencias educativas (Weidinger et al., 2022).

El problema no radica únicamente en que la inteligencia artificial pueda equivocarse, sino en la posibilidad de que los estudiantes acepten sus respuestas sin analizarlas. La confianza excesiva en sistemas conversacionales puede reducir la comprobación de fuentes, favorecer el uso de atajos cognitivos y debilitar la participación activa en la construcción del conocimiento. Una revisión sistemática realizada por Zhai et al. (2024) advierte que la dependencia de los sistemas de diálogo basados en inteligencia artificial puede afectar procesos como la toma de decisiones, el razonamiento analítico y el pensamiento crítico. De manera complementaria, Fan et al. (2025) identificaron el riesgo de “pereza metacognitiva” cuando los estudiantes transfieren a la tecnología tareas de planificación, supervisión y evaluación que deberían formar parte de su propio proceso de aprendizaje.

No obstante, la relación entre inteligencia artificial y pensamiento crítico no debe interpretarse exclusivamente desde una perspectiva negativa. La tecnología también puede utilizarse como objeto de análisis, contraste y cuestionamiento. Una respuesta incorrecta puede convertirse en un recurso didáctico cuando el estudiante debe localizar el error, explicar su origen, consultar fuentes confiables y formular una corrección argumentada. El efecto formativo depende, por tanto, de la actividad cognitiva que acompaña al uso de la herramienta. La evidencia disponible sugiere que la inteligencia artificial puede apoyar el aprendizaje cuando su utilización exige evaluar, comparar y reelaborar la información; en cambio, puede empobrecerlo cuando reemplaza el esfuerzo intelectual necesario para comprender y resolver una tarea (Lee et al., 2025).

Desde esta perspectiva, el pensamiento crítico comprende la capacidad de interpretar información, examinar argumentos, valorar evidencias, reconocer supuestos y formular juicios fundamentados. En entornos mediados por inteligencia artificial, estas operaciones adquieren una dimensión específica: el estudiante necesita distinguir entre fluidez verbal y exactitud, verificar la procedencia de la información, identificar contradicciones y reconocer posibles perspectivas excluidas. La detección de errores y sesgos constituye, por consiguiente, una manifestación observable del pensamiento crítico, porque demanda algo más que conocer el funcionamiento técnico de la herramienta: exige interrogar su autoridad y evaluar las implicaciones de sus respuestas.

Esta capacidad se relaciona directamente con la alfabetización en inteligencia artificial. Long y Magerko (2020) explican que dicha alfabetización implica un conjunto de competencias que permiten comprender, evaluar y utilizar críticamente sistemas de inteligencia artificial. Ng et al. (2021) agregan que esta formación integra dimensiones cognitivas, prácticas y éticas, por lo que no debería limitarse al manejo instrumental de aplicaciones. Un estudiante alfabetizado en inteligencia artificial necesita comprender que los resultados generados pueden variar según la instrucción introducida, que requieren verificación externa y que su aparente objetividad puede ocultar decisiones humanas, omisiones y patrones sesgados.

La formación de estas competencias resulta especialmente relevante en Educación Básica. Los estudiantes de este nivel acceden a herramientas generativas mientras todavía desarrollan conocimientos disciplinares y criterios para valorar la confiabilidad de las fuentes. Cuando el conocimiento previo es insuficiente, resulta más difícil advertir que una explicación contiene un error, porque la respuesta puede parecer válida por su vocabulario, estructura y seguridad expresiva. La revisión desarrollada por Alfarwan (2025) muestra que la investigación empírica sobre inteligencia artificial generativa en educación escolar continúa siendo menor que la realizada en educación superior y se concentra principalmente en el bachillerato y en áreas relacionadas con ciencia, tecnología, ingeniería y matemáticas. De manera similar, Zhang y Tur (2024) identificaron una base todavía limitada de estudios sobre ChatGPT en contextos K–12, lo que evidencia la necesidad de examinar sus usos y efectos en poblaciones escolares concretas.

Las investigaciones disponibles muestran, además, que los estudiantes manifiestan simultáneamente interés y preocupación frente a estas tecnologías. Doty y Lipien (2024) encontraron que estudiantes de secundaria reconocían la utilidad educativa de ChatGPT, pero también expresaban inquietudes por la pérdida de pensamiento crítico y la dependencia tecnológica. Klarin et al. (2024), por su parte, observaron que la utilización y la percepción de utilidad de la inteligencia artificial generativa se relacionan con características individuales, como las funciones ejecutivas y el rendimiento académico. Estos antecedentes sugieren que la capacidad de evaluar contenidos generados no puede deducirse únicamente de la frecuencia de uso: utilizar una herramienta habitualmente no significa comprender sus limitaciones ni disponer de criterios suficientes para juzgar la calidad de sus respuestas.

En el contexto ecuatoriano, la incorporación de la inteligencia artificial en las prácticas escolares avanza en medio de diferencias de acceso, formación y acompañamiento pedagógico. Vallejo Rodríguez et al. (2025) identificaron un crecimiento del interés académico por la inteligencia artificial en la Educación Básica del Ecuador, acompañado de desafíos relacionados con la preparación docente, la infraestructura y la integración pedagógica. Asimismo, Altafuya Rojas y Suárez Tigse (2026) evidenciaron que los estudiantes ecuatorianos de bachillerato utilizan herramientas generativas y reconocen su utilidad, aunque persisten necesidades formativas para orientar un empleo crítico y responsable. Estos antecedentes muestran que la discusión nacional ha comenzado a abordar el uso y la percepción de la inteligencia artificial, pero todavía se conoce poco acerca de los criterios concretos mediante los cuales los estudiantes juzgan la veracidad, consistencia e imparcialidad de sus contenidos.

En consecuencia, el vacío científico no consiste solamente en establecer si los estudiantes utilizan inteligencia artificial generativa, sino en comprender qué hacen cuando reciben una respuesta problemática. Sigue siendo necesario conocer cómo identifican un dato falso, qué señales despiertan sus sospechas, cuáles fuentes emplean para verificarlo, cómo interpretan un contenido sesgado y qué dificultades enfrentan al justificar sus decisiones. La mayor parte de los estudios ha privilegiado encuestas, mediciones de aceptación, revisiones documentales o análisis del rendimiento, mientras que las experiencias y razonamientos expresados directamente por estudiantes de Educación Básica han recibido menor atención. Las entrevistas resultan pertinentes para aproximarse a este problema porque permiten reconstruir los criterios, dudas, estrategias de comprobación y significados que no pueden comprenderse únicamente mediante puntuaciones cerradas.

La importancia del estudio se sustenta en sus implicaciones pedagógicas y éticas. Comprender cómo los estudiantes evalúan los contenidos generados puede orientar el diseño de actividades de verificación, comparación de fuentes, análisis de argumentos y reconocimiento de sesgos. También puede aportar criterios para que los docentes integren estas herramientas sin convertirlas en autoridades incuestionables. La orientación de la UNESCO sobre inteligencia artificial generativa sostiene que su incorporación educativa debe preservar la agencia humana, promover la formación crítica y garantizar un uso ético y seguro (UNESCO, 2023). En este sentido, enseñar a cuestionar las respuestas de la inteligencia artificial es tan importante como enseñar a formular instrucciones para obtenerlas.

Por lo expuesto, el objetivo de la investigación es analizar la capacidad de los estudiantes para detectar errores y sesgos en contenidos educativos producidos mediante inteligencia artificial generativa, a partir de sus experiencias, criterios de evaluación y estrategias de verificación. El estudio se desarrollará mediante un enfoque cualitativo basado en entrevistas, con la finalidad de comprender cómo los participantes interpretan, cuestionan y comprueban las respuestas generadas. Después de esta introducción, el artículo presenta los materiales y métodos, expone los resultados obtenidos, discute los hallazgos en relación con la literatura científica y, finalmente, formula las conclusiones e implicaciones educativas correspondientes.

 

MATERIALES Y MÉTODOS

 

Enfoque y diseño de investigación

La investigación se desarrolló desde un enfoque cualitativo, bajo un paradigma interpretativo, debido a que se buscó comprender los criterios, razonamientos y estrategias empleados por los estudiantes para detectar errores y sesgos en contenidos educativos producidos mediante inteligencia artificial generativa. Este enfoque permitió examinar no solo cuáles elementos fueron identificados, sino también cómo los participantes justificaron sus decisiones, valoraron la confiabilidad de las respuestas y reflexionaron sobre sus propias limitaciones al interactuar con la herramienta.

Se adoptó un diseño de estudio de caso cualitativo, delimitado por una institución, un nivel educativo y una experiencia pedagógica específica. El caso estuvo constituido por estudiantes de octavo año de Educación General Básica que participaron en actividades de análisis crítico de contenidos generados mediante ChatGPT. La selección de este diseño respondió al interés por estudiar el fenómeno dentro de su contexto educativo, considerando las experiencias y significados construidos por los participantes (Creswell & Poth, 2018).

La investigación se efectuó entre el 4 de mayo y el 19 de junio de 2026 en una institución educativa fiscal ubicada en Cuenca, provincia del Azuay, Ecuador. Para proteger su identidad, se empleó la denominación “Institución Educativa A”. Todas las actividades se desarrollaron presencialmente. La institución disponía de conexión a internet, laboratorio de informática, computadoras compartidas y tabletas institucionales.

 

Participantes y muestreo

Inicialmente fueron convocados 20 estudiantes de octavo año de Educación General Básica. La muestra final estuvo integrada por 18 participantes, con edades comprendidas entre 12 y 13 años. La distribución por sexo fue paritaria: nueve mujeres y nueve hombres. Trece estudiantes habían utilizado previamente alguna herramienta de inteligencia artificial generativa, mientras que cinco no contaban con experiencia directa.

Se empleó un muestreo intencional orientado a incorporar diversidad en cuanto al rendimiento académico, la participación en clase y la experiencia previa con herramientas digitales. Esta selección no tuvo como finalidad alcanzar representatividad estadística, sino obtener perspectivas heterogéneas que permitieran comprender las distintas formas de interacción, evaluación y cuestionamiento de los contenidos generados.

Los criterios de inclusión fueron: estar matriculado en octavo año de Educación General Básica; disponer de autorización del representante legal; expresar voluntariamente el asentimiento; asistir a las actividades programadas; participar en la entrevista individual; y entregar la producción escrita elaborada durante las sesiones. Dos estudiantes no completaron el proceso: uno no asistió a las entrevistas y otro se retiró voluntariamente. La información de ambos fue excluida del análisis.

La suficiencia del número de participantes se determinó mediante saturación temática. Después de la entrevista 16 no se identificaron aportes sustancialmente diferentes respecto de las categorías centrales; las entrevistas 17 y 18 se emplearon para confirmar la recurrencia y estabilidad de los patrones interpretativos. Este criterio concuerda con la comprensión de la saturación como el momento en que la recopilación adicional de información deja de aportar dimensiones relevantes para el fenómeno estudiado (Hennink & Kaiser, 2022).

 

Tabla 1: Características de los participantes

 

Característica

Descripción

Estudiantes convocados

20

Participantes finales

18

Estudiantes que no completaron el estudio

2

Curso

Octavo año de Educación General Básica

Edad

12–13 años

Mujeres

9

Hombres

9

Con experiencia previa en inteligencia artificial generativa

13

Sin experiencia directa

5

Tipo de muestreo

Intencional

Criterio de suficiencia

Saturación temática

Nota. Los dos estudiantes que no completaron el proceso fueron excluidos del análisis. La información se presenta de manera agregada para proteger la identidad de los participantes.

 

 

Herramienta de inteligencia artificial y materiales educativos

Se utilizó la versión web gratuita de ChatGPT disponible durante el periodo de aplicación. No se registró un modelo específico, por lo que los resultados deben interpretarse en relación con la funcionalidad general de la plataforma y no atribuirse a una versión determinada del modelo. Los estudiantes interactuaron directamente con la herramienta durante una actividad supervisada. También se utilizaron materiales impresos generados previamente por el equipo investigador.

Para evitar el empleo de cuentas personales, se habilitó una cuenta educativa destinada exclusivamente a la actividad. Se prohibió introducir nombres, fotografías, direcciones, información familiar o cualquier otro dato que permitiera identificar a los participantes. La interacción con ChatGPT se efectuó bajo supervisión docente permanente.

El material de análisis estuvo compuesto por ocho contenidos educativos: cuatro textos explicativos, dos respuestas argumentativas y dos síntesis históricas. Cada contenido presentó una extensión aproximada de 250 a 350 palabras. Los materiales abordaron temas de Lengua y Literatura, Ciencias Naturales y Estudios Sociales: características de los textos argumentativos; cambio climático y ecosistemas; alimentación y salud; diversidad cultural del Ecuador; participación histórica de mujeres y pueblos indígenas; y regiones naturales y organización territorial del país.

Los errores y sesgos fueron incorporados deliberadamente por los investigadores para garantizar que todos los participantes analizaran materiales equivalentes. Esta decisión permitió controlar la presencia de los elementos que debían ser evaluados y comparar las estrategias utilizadas para reconocerlos. Antes de su aplicación, los materiales fueron revisados por tres docentes especialistas: uno de Lengua y Literatura, uno de Ciencias Naturales y uno de Estudios Sociales.

Entre los errores incorporados se incluyeron datos falsos o imprecisos, fechas y nombres incorrectos, explicaciones científicas equivocadas, contradicciones internas, referencias inexistentes, generalizaciones sin evidencia y confusiones entre hechos y opiniones. Los sesgos correspondieron a representaciones relacionadas con género, cultura, pertenencia étnica, ubicación geográfica, condición socioeconómica y diversidad lingüística.

Todos los participantes analizaron los mismos ocho contenidos. Para comprobar la información tuvieron acceso a libros escolares, enciclopedias digitales, páginas institucionales y sitios web seleccionados previamente por los docentes. La disponibilidad de estas fuentes permitió observar si los estudiantes contrastaban las respuestas de ChatGPT y qué criterios empleaban para valorar la confiabilidad de la información.

 

Técnicas e instrumentos de recopilación de información

La técnica principal fue la entrevista individual semiestructurada. Esta se complementó con las producciones escritas elaboradas por los estudiantes y con las notas de campo registradas durante las actividades. La combinación de estas fuentes permitió contrastar lo expresado por los participantes con las acciones realizadas al identificar, justificar y corregir los contenidos.

La guía de entrevista estuvo integrada por 12 preguntas abiertas. Su estructura permitió mantener un conjunto común de temas y, simultáneamente, formular preguntas de profundización sobre ejemplos, decisiones, dificultades y estrategias de verificación. Las entrevistas fueron realizadas presencialmente por el investigador principal en una sala privada de la institución, fuera del horario regular de clases. Cada encuentro tuvo una duración de entre 20 y 30 minutos, con un promedio aproximado de 24 minutos.

Con la autorización correspondiente, las entrevistas fueron grabadas en audio y transcritas literalmente. Durante su desarrollo se registraron notas de campo sobre silencios, dudas, seguridad al responder, cambios de opinión, formas de consultar las fuentes, solicitudes de ayuda y reacciones ante los errores y sesgos.

La guía fue examinada por tres expertos: un especialista en investigación educativa, un docente con experiencia en pensamiento crítico y un especialista en tecnología educativa e inteligencia artificial. Los criterios de valoración fueron claridad, pertinencia, coherencia, suficiencia y correspondencia entre las preguntas, el objetivo y las categorías de análisis. El proceso produjo un coeficiente global de validez de contenido de 0,91. Posteriormente, se efectuó una entrevista piloto con dos estudiantes pertenecientes a otro paralelo. Sus respuestas permitieron revisar la claridad y secuencia de las preguntas, pero no fueron incorporadas al corpus definitivo.

 

Guía de entrevista semiestructurada

 

Tabla 2: Preguntas de la entrevista semiestructurada

 

N.º

Pregunta

Categoría principal

1

Cuando recibiste los contenidos generados por ChatGPT, ¿qué hiciste primero para decidir si la información era correcta?

Estrategias de verificación

2

¿Qué características de una respuesta hicieron que sospecharas que podía contener un error?

Detección de errores

3

Cuéntame un error que hayas identificado. ¿Cómo comprobaste que realmente era incorrecto?

Detección de errores

4

¿Qué errores te resultaron más difíciles de reconocer y por qué?

Detección de errores

5

¿Cómo decidiste qué fuentes podían utilizarse para comprobar o corregir la información?

Criterios de confiabilidad

6

¿Qué haces cuando dos fuentes ofrecen información diferente sobre el mismo tema?

Pensamiento crítico

7

¿Qué expresiones o ideas te hicieron pensar que un contenido podía presentar un estereotipo, una generalización o un sesgo?

Reconocimiento de sesgos

8

Describe un sesgo que hayas identificado. ¿A qué persona o grupo podía afectar y de qué manera?

Reconocimiento de sesgos

9

¿Cambió alguna de tus respuestas después de conversar con un compañero? Explica qué ocurrió.

Aprendizaje colaborativo

10

¿Confías de la misma manera en una respuesta de ChatGPT y en la información de un libro o una página institucional? ¿Por qué?

Actitud frente a la IA

11

¿En qué momento necesitaste ayuda para evaluar o corregir los contenidos y qué tipo de ayuda solicitaste?

Conciencia metacognitiva

12

Después de esta experiencia, ¿qué pasos seguirías antes de utilizar un contenido generado por inteligencia artificial en una tarea escolar?

Pensamiento crítico

Nota. Las preguntas adicionales se formularon en función de las respuestas de cada participante. Estas preguntas buscaron ampliar ejemplos, aclarar contradicciones y profundizar en los criterios empleados para verificar la información.

 

Procedimiento

El trabajo de campo se organizó en cuatro sesiones presenciales de 90 minutos. Antes de iniciar las actividades se verificó la disponibilidad de los consentimientos y asentimientos, se asignaron códigos a los participantes y se recordaron las normas de uso seguro de la inteligencia artificial.

En la primera sesión se explicó, mediante ejemplos adecuados al nivel educativo, el funcionamiento general de la inteligencia artificial generativa. Se abordaron los conceptos de alucinación, error factual, desinformación, estereotipo, generalización y sesgo algorítmico. Posteriormente, se desarrolló un ejercicio de familiarización con un texto diferente de los ocho contenidos incluidos en el análisis.

En la segunda sesión, los estudiantes examinaron individualmente cuatro contenidos y registraron los errores encontrados. Cada señalamiento debía estar acompañado por una explicación que indicara por qué la información se consideraba falsa, contradictoria o imprecisa.

Durante la tercera sesión analizaron los cuatro contenidos restantes. La actividad se concentró en la identificación de sesgos y en la verificación de la información mediante fuentes educativas. Después del análisis individual, los estudiantes compararon sus observaciones en parejas. El intercambio tuvo la finalidad de permitir la revisión de las decisiones iniciales, sin reemplazar la producción individual.

En la cuarta sesión, los participantes corrigieron los fragmentos problemáticos y registraron las fuentes utilizadas para fundamentar las modificaciones. Las entrevistas comenzaron después de las actividades y continuaron mediante encuentros individuales fuera del horario habitual de clases, debido a que su duración total excedía el tiempo de una sola sesión. El investigador realizó las preguntas sin comunicar a los estudiantes si sus respuestas eran correctas o incorrectas.

 

Tabla 3: Organización de las sesiones de trabajo

 

Sesión

Duración

Actividades

1

90 minutos

Introducción a la IA generativa; explicación de errores, alucinaciones y sesgos; ejercicio de familiarización

2

90 minutos

Análisis individual de cuatro contenidos; identificación y registro de errores

3

90 minutos

Análisis de cuatro contenidos adicionales; reconocimiento de sesgos; verificación con fuentes; contraste en parejas

4

90 minutos

Corrección fundamentada de los contenidos; registro de fuentes e inicio de las entrevistas

Entrevistas

20–30 minutos por participante

Entrevistas individuales realizadas fuera del horario regular de clases

Nota. Los estudiantes dispusieron de 90 minutos para analizar cada bloque de cuatro contenidos. La persona docente proporcionó orientaciones procedimentales y supervisó el uso seguro de ChatGPT, pero no señaló directamente los errores ni los sesgos.

 

Categorías de análisis

Las categorías iniciales se establecieron antes de las entrevistas a partir del objetivo de investigación y de la revisión teórica. Se utilizó una estructura flexible que permitió incorporar códigos y categorías emergentes cuando los datos aportaron dimensiones no previstas. Esta combinación respondió a una lógica deductiva e inductiva propia del análisis temático reflexivo (Braun & Clarke, 2021).

 

Tabla 4: Categorías iniciales de análisis

 

Categoría

Definición operativa

Aspectos examinados

Detección de errores

Capacidad para reconocer información incorrecta o inconsistente en contenidos generados mediante IA

Datos falsos, contradicciones, imprecisiones, fechas o nombres incorrectos y referencias inexistentes

Reconocimiento de sesgos

Capacidad para identificar representaciones parciales o injustificadamente generalizadas

Estereotipos, exclusiones, generalizaciones y representaciones desequilibradas

Estrategias de verificación

Procedimientos utilizados para comprobar la validez de la información

Consulta de fuentes, comparación de respuestas, búsqueda de evidencias y solicitud de ayuda

Criterios de confiabilidad

Características consideradas para aceptar o rechazar una fuente o afirmación

Autoridad, evidencia, coherencia, actualidad y coincidencia entre fuentes

Actitud frente a la IA

Posición adoptada frente a la utilidad y credibilidad de la herramienta

Confianza, duda, dependencia, utilidad percibida y disposición para cuestionar

Pensamiento crítico

Procesos empleados para examinar y reformular la información

Análisis, evaluación, argumentación, formulación de juicios y corrección fundamentada

Nota. Las categorías funcionaron como referentes iniciales y no como una estructura cerrada. Durante la codificación se admitió la incorporación de categorías emergentes sustentadas en las entrevistas, producciones escritas y notas de campo.

 

Análisis de la información

Se aplicó análisis temático mixto, combinando codificación deductiva e inductiva. El proceso siguió seis momentos: familiarización con la información; codificación inicial; agrupación de códigos; construcción de temas; revisión y delimitación temática; y elaboración interpretativa (Braun & Clarke, 2021).

En primer lugar, las transcripciones fueron leídas junto con las notas de campo y las producciones escritas. Posteriormente, dos investigadores codificaron los fragmentos relacionados con los criterios, estrategias, dificultades, actitudes y argumentos de los participantes. La codificación se efectuó manualmente mediante una matriz de Excel.

La matriz incluyó las columnas: participante, pregunta, fragmento textual, categoría, subcategoría, código, definición del código, interpretación, fuente de triangulación y observación analítica. Los códigos elaborados por ambos investigadores fueron comparados. Las discrepancias se resolvieron mediante discusión, revisión de las transcripciones y contraste con las producciones escritas.

Las frecuencias de aparición de los códigos se registraron únicamente como apoyo descriptivo para reconocer patrones recurrentes. No se utilizaron para realizar inferencias estadísticas ni para transformar el estudio cualitativo en un diseño cuantitativo. Las interpretaciones se respaldaron mediante citas textuales identificadas con los códigos E01–E18.

 

Criterios de rigor científico

El rigor se sustentó en los criterios de credibilidad, dependencia, confirmabilidad y transferibilidad. La credibilidad se fortaleció mediante la triangulación de entrevistas, producciones escritas y notas de campo, así como a través de la revisión de algunas interpretaciones con los participantes. La dependencia se atendió mediante el registro de las decisiones analíticas y la revisión de la codificación por un segundo investigador.

La confirmabilidad se apoyó en la conservación de las transcripciones, los códigos y las evidencias utilizadas para sustentar cada interpretación. La transferibilidad se favoreció mediante la descripción del contexto, las características de los participantes, los materiales y el procedimiento. Además, se incorporaron citas textuales anonimizadas para mantener una conexión verificable entre las interpretaciones y los testimonios. La presentación metodológica consideró principios de transparencia recomendados para estudios cualitativos basados en entrevistas (O’Brien et al., 2014; Tong et al., 2007).

 

Consideraciones éticas

Antes de iniciar el estudio se obtuvo autorización escrita de la institución. Los representantes legales firmaron el consentimiento informado y los estudiantes expresaron su asentimiento. Se comunicó que la participación era voluntaria y que podían retirarse en cualquier momento, sin sanciones ni consecuencias académicas. La actividad no estuvo asociada con calificaciones.

Para preservar el anonimato, se emplearon los códigos E01–E18 y se eliminaron nombres, paralelos específicos y otros datos identificables. El consentimiento contempló el empleo académico de citas textuales anonimizadas. Los audios y transcripciones se almacenaron en una carpeta cifrada y protegida mediante contraseña, accesible únicamente para los investigadores.

La protección de los menores durante el uso de ChatGPT incluyó supervisión docente permanente, utilización de una cuenta preparada para la actividad, prohibición de introducir datos personales, acceso limitado a contenidos educativos y revisión previa de los materiales. También se proporcionó orientación sobre los riesgos asociados con información falsa, referencias inexistentes y resultados sesgados.

 

RESULTADOS

 

El análisis integró 18 entrevistas individuales, 18 producciones escritas, 144 registros de evaluación correspondientes a ocho contenidos educativos y 18 notas de campo. Las entrevistas generaron 457 minutos de grabación, con una duración individual de entre 20 y 30 minutos. La triangulación permitió contrastar lo expresado por los participantes con los errores y sesgos señalados, las correcciones propuestas y las conductas observadas durante las actividades.

 

Detección de errores y sesgos

Los participantes identificaron problemas en 132 de las 144 evaluaciones realizadas, equivalentes al 91,7 % de los registros. Los contenidos T01–T04 fueron cuestionados por 17 estudiantes cada uno, mientras que T05–T08 fueron identificados como problemáticos por 16 participantes. El registro detallado reunió 256 señalamientos de errores y 73 de sesgos.

 

Tabla 5: Detección de errores y sesgos según el contenido analizado

 

Contenido

Tema

Participantes que detectaron el problema, n (%)

Errores señalados

Sesgos señalados

T01

Cambio climático

17 (94,4)

33

0

T02

Alimentación y salud

17 (94,4)

33

0

T03

Diversidad cultural del Ecuador

17 (94,4)

33

25

T04

Texto argumentativo

17 (94,4)

33

0

T05

Participación histórica de las mujeres

16 (88,9)

31

24

T06

Regiones naturales del Ecuador

16 (88,9)

31

24

T07

Ecosistemas

16 (88,9)

31

0

T08

Confiabilidad de las fuentes

16 (88,9)

31

0

Total

132 de 144 registros (91,7)

256

73

Nota. Un participante podía señalar más de un error o sesgo en cada contenido. Por ello, las cantidades corresponden a señalamientos codificados y no a estudiantes únicos. Los porcentajes se calcularon respecto de los 18 participantes.

 

Los errores factuales más fácilmente reconocidos estuvieron relacionados con ubicaciones geográficas, fechas, contradicciones internas y afirmaciones incompatibles con los conocimientos trabajados previamente. En las entrevistas, E01 indicó: “Reconocí con facilidad los datos geográficos que no coincidían con lo estudiado”. De forma semejante, E02 manifestó que “las fechas incorrectas y las contradicciones fueron lo más evidente”.

La revisión de las producciones confirmó que los estudiantes podían detectar con mayor rapidez afirmaciones comprobables mediante conocimientos disciplinares o fuentes directas. No obstante, el reconocimiento inicial no siempre estuvo acompañado por una justificación suficiente. En 48 de los 144 registros, la evidencia aportada fue valorada como alta; en 84, como media; y en 12, como insuficiente. Estos últimos 12 casos requirieron acompañamiento docente para localizar o interpretar fuentes apropiadas.

 

Apariencia de veracidad de los contenidos

La primera categoría recurrente estuvo relacionada con la apariencia de veracidad de las respuestas. Los 18 participantes señalaron que la organización, fluidez y seguridad expresiva de los textos influyeron inicialmente en su valoración. E01 explicó: “La presentación ordenada me hizo confiar al inicio; luego entendí que la forma no garantiza que el contenido sea verdadero”. Por su parte, E02 indicó: “Al comienzo parecían correctos porque estaban bien escritos, pero después noté afirmaciones demasiado seguras”.

Las entrevistas mostraron que la calidad formal del texto funcionó como un primer indicador de confiabilidad, aunque este criterio se modificó después de la comprobación de los contenidos. Las notas de campo registraron una disminución de la seguridad inicial cuando los participantes encontraron contradicciones entre las respuestas de ChatGPT y las fuentes consultadas.

 

Reconocimiento de sesgos

La identificación de sesgos se presentó en 14 participantes. Los contenidos más relevantes para esta categoría fueron T03, relacionado con la diversidad cultural del Ecuador; T05, sobre la participación histórica de las mujeres; y T06, referido a las regiones naturales y culturales del país. En estos materiales se registraron 73 señalamientos asociados con homogeneización cultural, invisibilización de grupos, estereotipos de género y representaciones territoriales desequilibradas.

E01 señaló que el contenido sobre Ecuador “trataba a pueblos y regiones como si todos fueran iguales y dejaba fuera su diversidad”. E02 identificó el sesgo de género al observar que “el texto sobre las mujeres presentaba el liderazgo masculino como algo natural y reducía los aportes femeninos”.

Los sesgos implícitos y las referencias inexistentes constituyeron las dificultades más frecuentes. En las producciones escritas, 14 estudiantes señalaron como principal dificultad la comprobación de referencias aparentemente académicas, mientras que cuatro indicaron que les resultó más complejo reconocer sesgos implícitos. E01 explicó que “los sesgos fueron más difíciles porque algunas generalizaciones parecían normales al leerlas rápido”. Según E02, las referencias inexistentes resultaron difíciles de reconocer “porque tenían apariencia académica”.

 

Estrategias de verificación y criterios de confiabilidad

La verificación externa apareció en los testimonios de 16 participantes. Las estrategias comprendieron la consulta de libros escolares, la búsqueda en páginas institucionales, la comparación entre fuentes y la solicitud de orientación docente cuando existían discrepancias.

En las producciones escritas, 12 estudiantes registraron como estrategia principal la búsqueda institucional acompañada del contraste de información. Los seis restantes combinaron la comparación de fuentes con la consulta docente. E01 describió su procedimiento de la siguiente manera: “Consulté el libro, páginas institucionales y comparé al menos dos fuentes antes de corregir”. E02 expresó: “Busqué el tema con palabras clave, revisé quién publicaba y pedí ayuda cuando las fuentes no coincidían”.

Los criterios empleados para valorar la confiabilidad fueron la identificación de la institución responsable, la autoría, la fecha de publicación, la presencia de evidencias y la coincidencia entre fuentes. E02 manifestó: “Consideré la institución responsable, la fecha, el autor y la evidencia presentada”. Las notas de campo confirmaron que algunos estudiantes anotaron los enlaces consultados, mientras que otros registraron autoría y fecha antes de modificar sus respuestas.

La comparación de fuentes también produjo modificaciones en los juicios iniciales. E01 reconoció: “Cambié varias respuestas cuando encontré evidencia que contradecía lo que yo pensaba”. E02 añadió que el contraste le permitió advertir que su conocimiento previo también podía ser incompleto.

 

Actitud frente a la inteligencia artificial

La confianza cautelosa estuvo presente en 15 participantes. Los testimonios no mostraron un rechazo general a ChatGPT, sino una valoración condicionada por la posibilidad de verificar sus resultados. E01 declaró: “Confío con cautela: puede explicar bien y al mismo tiempo inventar datos o referencias”. E02 consideró que la herramienta era “útil para empezar, pero no suficiente para decidir que algo es verdadero”.

Los participantes expresaron mayor precaución ante contenidos relacionados con salud, historia, información científica y datos exactos. Asimismo, indicaron que volverían a utilizar la inteligencia artificial para obtener ideas, explicaciones iniciales o preguntas, aunque no como única fuente. E01 manifestó que la emplearía “para generar ideas y preguntas”, pero comprobaría los datos y las referencias antes de incorporarlos a una tarea. E02 señaló que la utilizaría “como apoyo, no como única fuente”.

 

Revisión del propio juicio y conciencia metacognitiva

La revisión del propio juicio se identificó en 12 participantes. Este patrón comprendió el reconocimiento de dudas, la aceptación de conocimientos insuficientes y la modificación de interpretaciones después de consultar evidencias. E01 afirmó: “Descubrí que debo detenerme, formular preguntas y reconocer cuando no tengo evidencia suficiente”. E02 indicó: “Aprendí que a veces confundo seguridad al escribir con confiabilidad”.

Las correcciones elaboradas siguieron principalmente una secuencia de tres acciones: identificación de la afirmación problemática, explicación del error y formulación de una alternativa respaldada por fuentes. E01 describió este procedimiento al señalar: “Escribí la afirmación problemática, expliqué el error y añadí una corrección respaldada por una fuente”. E02 destacó que procuró relacionar cada modificación con evidencia para evitar reemplazar una opinión por otra.

 

Aprendizaje colaborativo

El aprendizaje colaborativo surgió como categoría emergente en las notas de campo. En nueve participantes se registró explícitamente el contraste del razonamiento con un compañero sin reproducción directa de la respuesta. El diálogo permitió revisar interpretaciones iniciales, considerar señales no advertidas individualmente y decidir qué información debía comprobarse.

En los nueve casos restantes, la interacción predominante consistió en solicitar orientación docente para distinguir entre opinión, evidencia, error factual y contenido sesgado. La colaboración no sustituyó la respuesta individual, debido a que cada estudiante debía registrar y justificar sus propias decisiones.

 

Síntesis de categorías

 

Tabla 6: Frecuencia descriptiva de categorías y patrones identificados

 

Categoría

Patrón principal

Participantes, n

Porcentaje

Detección de errores

Apariencia de veracidad

18

100,0

Detección de errores

Reconocimiento de datos y contradicciones

15

83,3

Reconocimiento de sesgos

Identificación de estereotipos y exclusiones

14

77,8

Estrategias de verificación

Consulta y comparación de fuentes

16

88,9

Actitud frente a la IA

Confianza cautelosa

15

83,3

Pensamiento crítico

Revisión del propio juicio

12

66,7

Conciencia metacognitiva

Reconocimiento de límites personales

12

66,7

Aprendizaje colaborativo

Contraste explícito con compañeros

9

50,0

Nota. Las frecuencias poseen una función exclusivamente descriptiva. Las categorías no son mutuamente excluyentes; un participante podía aportar evidencia en varias de ellas.

 

La triangulación mostró correspondencia entre los testimonios, las producciones escritas y las notas de campo. La detección de errores factuales estuvo respaldada por señalamientos y correcciones en las fichas; la verificación externa coincidió con el uso registrado de libros y páginas institucionales; y la revisión del propio juicio se observó en las modificaciones realizadas después de contrastar información.

 

Tabla 7: Triangulación de los principales hallazgos

 

Hallazgo

Entrevistas

Producciones escritas

Notas de campo

La forma del texto generó confianza inicial

Referencias a organización, fluidez y seguridad

Revisión posterior de afirmaciones inicialmente aceptadas

Disminución de la seguridad después del contraste

Los errores factuales fueron más visibles

Identificación de fechas, ubicaciones y contradicciones

Señalamiento y corrección de datos verificables

Detección rápida de errores concretos

Los sesgos presentaron mayor dificultad

Reconocimiento de generalizaciones y exclusiones

Menor facilidad para justificar sesgos implícitos

Mayor tiempo de análisis y solicitud de orientación

La verificación se apoyó en fuentes externas

Consulta de libros y páginas institucionales

Registro de entre tres y cinco fuentes por estudiante

Anotación de autoría, fecha y enlaces

La confianza en ChatGPT fue condicionada

Valoración de la herramienta como apoyo

Correcciones respaldadas por fuentes externas

Mayor cautela después de descubrir información falsa

El análisis produjo revisión metacognitiva

Reconocimiento de dudas y limitaciones

Modificación fundamentada de respuestas

Cambios de opinión después de contrastar evidencia

Nota. La triangulación se realizó entre las 18 entrevistas, las 18 producciones escritas y las 18 notas de campo.

 

En conjunto, los resultados muestran que los estudiantes pudieron reconocer una proporción elevada de los contenidos problemáticos, particularmente cuando contenían errores factuales evidentes. La identificación de sesgos y referencias inexistentes presentó mayores dificultades. La verificación mediante fuentes externas, la confianza condicionada en la inteligencia artificial y la revisión del propio juicio constituyeron los principales patrones vinculados con el pensamiento crítico.

 

DISCUSIÓN

 

El objetivo de la investigación fue analizar la capacidad de estudiantes de Educación General Básica para detectar errores y sesgos en contenidos educativos producidos mediante inteligencia artificial generativa, considerando sus criterios de evaluación y estrategias de verificación. Los resultados muestran que los participantes identificaron una proporción elevada de los contenidos problemáticos; sin embargo, esta capacidad no fue uniforme. Los errores factuales, las contradicciones y los datos geográficos incorrectos fueron reconocidos con mayor facilidad, mientras que los sesgos implícitos y las referencias inexistentes demandaron procesos de análisis más complejos.

Un primer hallazgo relevante fue la influencia de la presentación formal de los textos en la confianza inicial. La totalidad de los participantes señaló que la organización, fluidez y seguridad discursiva de las respuestas favorecieron inicialmente su aceptación. Esta percepción coincide con Kasneci et al. (2023), quienes advierten que los modelos generativos pueden producir respuestas lingüísticamente convincentes aunque incluyan información incorrecta. De manera similar, Ji et al. (2023) explican que las alucinaciones de los modelos de lenguaje resultan especialmente problemáticas cuando la información falsa se integra en textos coherentes y plausibles. Los hallazgos sugieren que los estudiantes pueden confundir calidad expresiva con validez epistemológica cuando no disponen de criterios explícitos para diferenciar ambas dimensiones.

La apariencia de veracidad también ayuda a comprender por qué algunos estudiantes aceptaron inicialmente afirmaciones que luego corrigieron al consultar otras fuentes. El hallazgo converge con Lee et al. (2025), quienes identificaron que la confianza en los sistemas generativos puede reducir el esfuerzo percibido necesario para evaluar críticamente sus respuestas. En el presente estudio, la revisión no surgió de manera automática, sino después de que la actividad solicitara expresamente identificar problemas, justificar las decisiones y aportar evidencia. Por tanto, la disponibilidad de una herramienta generativa no garantiza el pensamiento crítico; este depende de las demandas cognitivas incorporadas al diseño de la actividad.

La detección de datos falsos y contradicciones fue más frecuente que el reconocimiento de sesgos. Esta diferencia puede explicarse porque un error factual suele contrastarse con una fuente o conocimiento disciplinar concreto, mientras que un sesgo requiere examinar los supuestos, las omisiones y las representaciones sociales presentes en el discurso. Weidinger et al. (2022) señalan que los riesgos de los modelos de lenguaje no se limitan a la inexactitud, sino que comprenden la reproducción de estereotipos, exclusiones y desigualdades procedentes de los datos y contextos utilizados en su desarrollo. En consecuencia, reconocer que una fecha o ubicación es incorrecta constituye una operación distinta de advertir que un texto naturaliza roles de género o invisibiliza la diversidad cultural.

Los contenidos sobre diversidad cultural, participación histórica de las mujeres y representación de las regiones ecuatorianas permitieron observar esta diferencia. Aunque 14 estudiantes identificaron estereotipos o exclusiones, algunos necesitaron más tiempo y orientación para explicar por qué una generalización resultaba problemática. Este resultado refuerza la necesidad de entender la alfabetización en inteligencia artificial como una competencia que trasciende el conocimiento técnico. Long y Magerko (2020) y Ng et al. (2021) sostienen que dicha alfabetización debe incluir capacidades para evaluar críticamente los resultados, comprender sus limitaciones y reconocer sus implicaciones sociales y éticas.

La dificultad para comprobar referencias inexistentes constituye otro hallazgo significativo. La mayoría de los estudiantes indicó que las referencias con nombres, fechas o títulos aparentemente académicos resultaban difíciles de cuestionar. Esta situación refleja una característica relevante de los modelos generativos: pueden producir información bibliográfica plausible sin que las fuentes mencionadas existan. UNESCO (2023) advierte que los contenidos generados deben someterse a validación humana y que los usuarios necesitan comprender que estos sistemas no funcionan como bases documentales verificadas. Desde el punto de vista educativo, enseñar a utilizar inteligencia artificial exige incorporar procedimientos para comprobar la existencia, autoría, fecha y correspondencia de las fuentes citadas.

Las estrategias de verificación constituyeron una dimensión central de la capacidad crítica observada. Dieciséis participantes recurrieron a fuentes externas y la mayoría combinó libros escolares, páginas institucionales y comparación entre documentos. Este comportamiento se corresponde con la alfabetización crítica en inteligencia artificial, pues los estudiantes no se limitaron a detectar una posible inconsistencia, sino que buscaron evidencias para confirmarla y formular una corrección. La relevancia de este proceso radica en que evita sustituir una afirmación generada por la IA por una opinión personal igualmente carente de respaldo.

Los criterios de confiabilidad mencionados —institución responsable, autoría, fecha, evidencia y coincidencia entre fuentes— muestran una transición desde indicadores superficiales hacia criterios documentales. No obstante, la calidad de la evidencia fue valorada como media en la mayoría de los registros y como insuficiente en 12 casos. Este resultado evidencia que reconocer la necesidad de verificar no equivale necesariamente a saber hacerlo con profundidad. La alfabetización informacional y la alfabetización en inteligencia artificial deben desarrollarse de manera articulada, debido a que la evaluación de una respuesta generativa requiere localizar, seleccionar e interpretar fuentes independientes.

La confianza cautelosa identificada en 15 estudiantes refleja una actitud más compleja que la aceptación o el rechazo absoluto de ChatGPT. Los participantes reconocieron su utilidad para iniciar una búsqueda, producir ideas o recibir explicaciones, pero rechazaron considerarlo una fuente suficiente para establecer la verdad de una afirmación. Esta posición coincide con Doty y Lipien (2024), quienes encontraron que estudiantes de secundaria valoraban las posibilidades educativas de ChatGPT y, simultáneamente, expresaban preocupación por la dependencia tecnológica y la pérdida de pensamiento crítico. Asimismo, Tlili et al. (2023) sostienen que el valor educativo de los chatbots depende de una integración que mantenga el juicio humano y la verificación de los resultados.

La confianza condicionada resulta especialmente importante frente al riesgo de dependencia. Zhai et al. (2024) concluyen que la aceptación no cuestionada de respuestas generadas puede afectar el razonamiento analítico y la toma de decisiones. Fan et al. (2025) denominan “pereza metacognitiva” a la transferencia de procesos de planificación, supervisión y evaluación hacia la inteligencia artificial. En contraste, los estudiantes de este estudio debieron detenerse, formular preguntas, buscar evidencias y modificar sus propias respuestas. El diseño de la actividad convirtió el contenido incorrecto en un estímulo para la evaluación, en lugar de permitir que la herramienta sustituyera el proceso cognitivo.

La revisión del propio juicio, identificada en 12 participantes, representa uno de los aportes más relevantes. Los estudiantes no solo corrigieron información generada por ChatGPT, sino que reconocieron que sus conocimientos previos también podían ser incompletos. Esta conciencia metacognitiva se manifestó cuando admitieron dudas, reconsideraron decisiones y modificaron interpretaciones a partir de nuevas evidencias. En este sentido, el pensamiento crítico no se expresó únicamente como capacidad para señalar errores externos, sino como disposición para revisar las propias creencias.

El aprendizaje colaborativo también contribuyó al proceso de revisión. En nueve participantes se observó contraste explícito con compañeros, mientras que los demás recurrieron principalmente a la orientación docente. El intercambio permitió identificar elementos no advertidos de manera individual, aunque la justificación final permaneció bajo responsabilidad de cada estudiante. Este resultado muestra que la detección de errores y sesgos puede fortalecerse mediante el diálogo, siempre que la colaboración no se limite a reproducir respuestas y exija explicar los criterios utilizados.

La mediación docente fue particularmente importante cuando las fuentes ofrecían información diferente o cuando los estudiantes no lograban distinguir entre una opinión y una afirmación respaldada por evidencia. Alfarwan (2025) señala que la investigación sobre inteligencia artificial generativa en contextos K–12 continúa siendo limitada y que su incorporación requiere estructuras pedagógicas adecuadas. De forma similar, Zhang y Tur (2024) destacan la necesidad de acompañamiento, orientación ética y alfabetización específica para integrar ChatGPT en la educación escolar. Los resultados del presente estudio respaldan esta posición, pues las capacidades críticas se hicieron visibles dentro de una secuencia guiada, con fuentes disponibles, consignas explícitas y supervisión docente.

En el contexto ecuatoriano, los hallazgos amplían una línea de investigación todavía emergente. Vallejo Rodríguez et al. (2025) identificaron que la incorporación de inteligencia artificial en la Educación Básica del país se encuentra acompañada por desafíos de infraestructura, formación docente e integración pedagógica. Altafuya Rojas y Suárez Tigse (2026) también evidenciaron la necesidad de fortalecer el uso crítico y responsable de herramientas generativas entre estudiantes ecuatorianos. El aporte del presente estudio consiste en desplazar el análisis desde la percepción general de utilidad hacia prácticas observables de evaluación: detectar, justificar, contrastar y corregir contenidos educativos.

Los resultados permiten sostener que la detección de errores y sesgos no debe evaluarse mediante una única respuesta correcta. Se trata de un proceso compuesto por varias operaciones: sospechar de una afirmación, explicar la causa de la duda, localizar evidencia pertinente, valorar la fuente y formular una corrección argumentada. Un estudiante puede reconocer que un contenido es problemático y, aun así, presentar dificultades para justificarlo. Esta distinción resulta relevante para diseñar actividades y criterios de evaluación que no reduzcan el pensamiento crítico a la identificación superficial de errores.

El estudio presenta algunas limitaciones. En primer lugar, se desarrolló con 18 estudiantes de una única institución fiscal, seleccionados intencionalmente, por lo que los hallazgos no pueden generalizarse estadísticamente a toda la población escolar. En segundo lugar, los contenidos fueron preparados deliberadamente con errores y sesgos, lo que aseguró equivalencia entre participantes, pero no reproduce completamente la interacción espontánea con una herramienta generativa. En tercer lugar, la explicación previa de los conceptos pudo aumentar la sensibilidad de los estudiantes frente a los problemas incluidos.

Otra limitación corresponde al carácter breve de la experiencia. El estudio permitió describir las estrategias desplegadas durante cuatro sesiones, pero no establecer si estas se mantendrían en situaciones futuras o sin supervisión docente. Tampoco se aplicó una medición previa y posterior que permitiera determinar cambios atribuibles a la intervención. Además, no se registró la versión específica del modelo de ChatGPT, aspecto que limita la reproducibilidad tecnológica debido a la actualización continua de estas herramientas.

Las frecuencias utilizadas tuvieron una finalidad descriptiva y no deben interpretarse como pruebas de diferencias entre grupos. Aunque participaron estudiantes con y sin experiencia previa en inteligencia artificial, el diseño cualitativo y el tamaño de la muestra no permiten establecer asociaciones concluyentes entre experiencia tecnológica y capacidad crítica. Del mismo modo, las citas y producciones representan respuestas situadas dentro de una actividad pedagógica específica.

Futuras investigaciones deberían desarrollar estudios longitudinales y comparativos en distintas instituciones, niveles educativos y contextos socioculturales. También sería pertinente evaluar la detección de errores sin advertir previamente a los estudiantes que los contenidos presentan problemas, comparar diferentes herramientas generativas y analizar la transferencia de las estrategias de verificación a tareas escolares auténticas. Asimismo, convendría diseñar instrumentos que distingan entre detección factual, reconocimiento de sesgos, calidad de la evidencia y capacidad de corrección argumentada.

En síntesis, los hallazgos muestran que los estudiantes pueden cuestionar contenidos producidos mediante inteligencia artificial cuando participan en actividades que exigen verificación, argumentación y revisión del propio juicio. La principal contribución del estudio radica en evidenciar que el pensamiento crítico frente a la inteligencia artificial no depende exclusivamente del acceso a la tecnología ni de la frecuencia de uso, sino de las condiciones pedagógicas que obligan a contrastar sus respuestas con conocimientos, fuentes y perspectivas diversas.

 

CONCLUSIÓN

 

Los estudiantes de octavo año de Educación General Básica demostraron capacidad para detectar errores y sesgos en contenidos educativos generados mediante inteligencia artificial. No obstante, esta capacidad presentó distintos niveles de complejidad: los errores factuales, las contradicciones y los datos geográficos incorrectos fueron reconocidos con mayor facilidad que los sesgos implícitos, las generalizaciones y las referencias inexistentes.

La fluidez, organización y seguridad discursiva de los contenidos generaron confianza inicial, incluso cuando contenían información problemática. Este hallazgo evidencia que la calidad formal de una respuesta no constituye un criterio suficiente para determinar su veracidad. La capacidad crítica se manifestó cuando los estudiantes superaron esa primera impresión, formularon dudas y contrastaron la información con fuentes externas.

La consulta de libros, páginas institucionales y documentos con autoría y fecha permitió fundamentar las correcciones. Sin embargo, algunos participantes reconocieron el problema sin justificarlo mediante evidencia suficiente. Por ello, la detección debe comprenderse como un proceso que integra identificación, explicación, verificación y corrección argumentada, y no únicamente como el señalamiento de una respuesta incorrecta.

La revisión del propio juicio y el reconocimiento de las limitaciones personales constituyeron expresiones relevantes del pensamiento crítico. Los participantes no solo cuestionaron las respuestas de ChatGPT, sino que también modificaron conocimientos e interpretaciones previas cuando encontraron evidencia contradictoria. El diálogo con compañeros y la orientación docente favorecieron este proceso sin sustituir la responsabilidad individual sobre las decisiones adoptadas.

El aporte científico del estudio consiste en mostrar, desde un contexto ecuatoriano de Educación Básica, cómo se concreta la evaluación crítica de contenidos generativos en prácticas observables. Los hallazgos permiten reconocer que la alfabetización en inteligencia artificial debe incorporar la detección de errores, el análisis de sesgos, la evaluación de fuentes y la reflexión metacognitiva.

En conclusión, la inteligencia artificial generativa puede emplearse como recurso educativo siempre que sus respuestas sean tratadas como contenidos susceptibles de revisión y no como fuentes incuestionables. Su incorporación pedagógica debe incluir actividades deliberadas de contraste, argumentación y verificación, acompañadas por mediación docente. Debido al carácter cualitativo, contextual y acotado del estudio, estas conclusiones no pretenden generalizarse estadísticamente, sino aportar criterios para futuras investigaciones y propuestas formativas sobre el uso crítico y responsable de la inteligencia artificial.

 

REFERENCIAS

 

Alfarwan, A. A. (2025). Generative AI use in K–12 education: A systematic review. Frontiers in Education, 10, 1647573. https://doi.org/10.3389/feduc.2025.1647573

Altafuya Rojas, C. P., & Suárez Tigse, F. A. (2026). Uso y percepción de la inteligencia artificial en estudiantes de bachillerato ecuatoriano. LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, 7(1). https://doi.org/10.56712/latam.v7i1.5493

Braun, V., & Clarke, V. (2021). Thematic analysis: A practical guide. SAGE.

Creswell, J. W., & Poth, C. N. (2018). Qualitative inquiry and research design: Choosing among five approaches (4th ed.). SAGE.

Doty, K., & Lipien, L. (2024). Student perceptions and attitudes about the usage of ChatGPT in online K–12 education and student preferences about learning to use artificial intelligence from teachers. American Journal of Educational Research, 12(9), 348–355. https://doi.org/10.12691/education-12-9-2

Fan, Y., Tang, L., Le, H., Shen, K., Tan, S., Zhao, Y., Shen, Y., Li, X., & Gašević, D. (2025). Beware of metacognitive laziness: Effects of generative artificial intelligence on learning motivation, processes, and performance. British Journal of Educational Technology, 56(2), 489–530. https://doi.org/10.1111/bjet.13544

Hennink, M., & Kaiser, B. N. (2022). Sample sizes for saturation in qualitative research: A systematic review of empirical tests. Social Science & Medicine, 292, 114523. https://doi.org/10.1016/j.socscimed.2021.114523

Ji, Z., Lee, N., Frieske, R., Yu, T., Su, D., Xu, Y., Ishii, E., Bang, Y. J., Madotto, A., & Fung, P. (2023). Survey of hallucination in natural language generation. ACM Computing Surveys, 55(12), Article 248. https://doi.org/10.1145/3571730

Kasneci, E., Sessler, K., Küchemann, S., Bannert, M., Dementieva, D., Fischer, F., Gasser, U., Groh, G., Günnemann, S., Hüllermeier, E., Krusche, S., Kutyniok, G., Michaeli, T., Nerdel, C., Pfeffer, J., Poquet, O., Sailer, M., Schmidt, A., Seidel, T., … Kasneci, G. (2023). ChatGPT for good? On opportunities and challenges of large language models for education. Learning and Individual Differences, 103, 102274. https://doi.org/10.1016/j.lindif.2023.102274

Klarin, J., Hoff, E., Larsson, A., & Daukantaitė, D. (2024). Adolescents’ use and perceived usefulness of generative AI for schoolwork: Exploring their relationships with executive functioning and academic achievement. Frontiers in Artificial Intelligence, 7, 1415782. https://doi.org/10.3389/frai.2024.1415782

Lee, H.-P., Sarkar, A., Tankelevitch, L., Drosos, I., Rintel, S., Banks, R., & Wilson, N. (2025). The impact of generative AI on critical thinking: Self-reported reductions in cognitive effort and confidence effects from a survey of knowledge workers. In Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems (Article 1121, pp. 1–22). Association for Computing Machinery. https://doi.org/10.1145/3706598.3713778

Long, D., & Magerko, B. (2020). What is AI literacy? Competencies and design considerations. In Proceedings of the 2020 CHI Conference on Human Factors in Computing Systems (pp. 1–16). Association for Computing Machinery. https://doi.org/10.1145/3313831.3376727

Ng, D. T. K., Leung, J. K. L., Chu, S. K. W., & Qiao, M. S. (2021). Conceptualizing AI literacy: An exploratory review. Computers and Education: Artificial Intelligence, 2, 100041. https://doi.org/10.1016/j.caeai.2021.100041

O’Brien, B. C., Harris, I. B., Beckman, T. J., Reed, D. A., & Cook, D. A. (2014). Standards for reporting qualitative research: A synthesis of recommendations. Academic Medicine, 89(9), 1245–1251. https://doi.org/10.1097/ACM.0000000000000388

Tlili, A., Shehata, B., Adarkwah, M. A., Bozkurt, A., Hickey, D. T., Huang, R., & Agyemang, B. (2023). What if the devil is my guardian angel: ChatGPT as a case study of using chatbots in education. Smart Learning Environments, 10, Article 15. https://doi.org/10.1186/s40561-023-00237-x

Tong, A., Sainsbury, P., & Craig, J. (2007). Consolidated criteria for reporting qualitative research (COREQ): A 32-item checklist for interviews and focus groups. International Journal for Quality in Health Care, 19(6), 349–357. https://doi.org/10.1093/intqhc/mzm042

UNESCO. (2023). Guidance for generative AI in education and research. https://unesdoc.unesco.org/ark:/48223/pf0000386693

Vallejo Rodríguez, F. W., Gómez Rivero, J. O., & Cruz López, W. O. (2025). Estado del arte de la inteligencia artificial en la Educación Básica del Ecuador: Una revisión sistemática. LATAM Revista Latinoamericana de Ciencias Sociales y Humanidades, 6(3), 1863–1882. https://doi.org/10.56712/latam.v6i3.4082

Weidinger, L., Uesato, J., Rauh, M., Griffin, C., Huang, P.-S., Mellor, J., Glaese, A., Cheng, M., Balle, B., Kasirzadeh, A., Biles, C., Brown, S., Kenton, Z., Hawkins, W., Stepleton, T., Birhane, A., Hendricks, L. A., Rimell, L., Isaac, W., … Gabriel, I. (2022). Taxonomy of risks posed by language models. In Proceedings of the 2022 ACM Conference on Fairness, Accountability, and Transparency (pp. 214–229). Association for Computing Machinery. https://doi.org/10.1145/3531146.3533088

Zhai, C., Wibowo, S., & Li, L. D. (2024). The effects of over-reliance on AI dialogue systems on students’ cognitive abilities: A systematic review. Smart Learning Environments, 11, Article 28. https://doi.org/10.1186/s40561-024-00316-7

Zhang, P., & Tur, G. (2024). A systematic review of ChatGPT use in K–12 education. European Journal of Education, 59, e12599. https://doi.org/10.1111/ejed.12599