Turnitin me marcó todo el capítulo de metodología
La pregunta que vale la pena hacer no es por qué el sistema piensa que hiciste trampa en el capítulo tres, sino por qué el resaltado llegó como un bloque continuo y qué representa exactamente ese porcentaje.
Equipo de HumanPen
· 13 min de lectura
Respuesta rápida
Porque la puntuación no llega a tus oraciones una por una. Según la descripción publicada de Turnitin, un envío se divide en segmentos superpuestos, cada uno recibe una puntuación y cada oración que cumple los criterios hereda la puntuación de los segmentos en los que aparece. Si alimentas al sistema con un tramo de escritura que mantiene el mismo registro, las mismas estructuras oracionales y el mismo vocabulario durante dos mil palabras, los segmentos vecinos tienen poco sobre lo que discrepar. El resaltado tiende entonces a aparecer como una franja, no como puntos dispersos. La sección de métodos y materiales está escrita precisamente así, por diseño, y el propio relato de Turnitin sobre dónde se acumulan sus falsos positivos menciona dos propiedades que el género debe tener por convención. Esto no significa que el número sea incorrecto. Significa que una pared de rojo en un capítulo no son cuarenta veredictos independientes sobre cuarenta oraciones: leerlo como si lo fuera te enviará a corregir lo que no toca.
Por qué aparece como un bloque
Lo que la gente describe es específico y siempre tiene la misma forma: la revisión bibliográfica está limpia, la discusión también, pero al abrir el capítulo de métodos el resaltado comienza en la primera oración bajo el título y no se detiene hasta que termina el capítulo. Esto se parece menos a un modelo detectando pasajes sospechosos y más a uno detectando un capítulo sospechoso, y por eso es tan inquietante de ver.
Turnitin publica cómo se calcula una puntuación, y vale la pena leer las dos oraciones centrales de esa descripción en lugar del resumen:
"Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score." (Cada oración que cumple los criterios dentro de estos segmentos hereda la puntuación del segmento. Dado que los segmentos se superponen, algunas oraciones pueden tener múltiples puntuaciones, que luego se combinan en una sola).
Es decir, la unidad que se clasifica es una ventana de texto, no una oración. Una oración se puntúa por el texto que la rodea. Lo que se desprende de esto —nuestra interpretación, no algo que Turnitin publique— es que cuando las oraciones consecutivas comparten ventanas y esas ventanas se parecen, las puntuaciones tienen poco motivo para divergir, y el resaltado derivado de ellas sale continuo. Una franja es el resultado esperado de un tramo uniforme, no un recuento de hallazgos independientes.
Esto tiene una consecuencia práctica: la primera oración resaltada en tu capítulo de métodos no es necesariamente donde empezó nada, porque un segmento que cruza el título puede contener el último párrafo de lo que venía antes. La gente pierde tiempo real mirando la primera oración marcada intentando descifrar qué tiene de malo específicamente. Según la descripción publicada, puede que no tenga nada de malo específicamente.
También significa que la aritmética que la gente busca para esto no existe. No puedes dividir una franja entre sus oraciones y obtener un coste por oración, ni puedes restar una oración y predecir qué pasa. Desmenuzamos eso frente a las tres versiones más difundidas en si reescribo una oración marcada, ¿baja la puntuación.
El límite honesto de todo esto: Turnitin ha publicado la forma del proceso, pero no la función de combinación, la agregación ni la longitud del segmento. Todo lo anterior es lo que la descripción publicada implica sobre la distribución. Nada de esto permite predecir un número.
¿Cuánto de tu capítulo de métodos está siendo realmente evaluado?
Lo segundo que hay que establecer es el denominador, porque dos capítulos de métodos que contienen la misma información pueden presentarle al modelo cantidades de texto completamente distintas. Turnitin solo analiza lo que llama texto que cumple los criterios:
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." The sentence immediately after it is the one that matters here: "This percentage is not necessarily the percentage of the entire submission." (Este texto que cumple los criterios incluye solo oraciones en prosa, lo que significa que solo analizamos bloques de texto escritos en oraciones gramaticales estándar y no incluimos otros tipos de escritura como listas, viñetas —estructuras cortas que no son oraciones— u otras estructuras que no sean oracionales. Aquí la oración que viene justo después es la que importa: «Este porcentaje no es necesariamente el porcentaje de todo el envío»).
Ahora mira cómo tu disciplina escribe realmente esta sección. Un protocolo de laboratorio llega como pasos numerados, una tabla de reactivos, una lista de instrumentos y un bloque de ajustes. Un capítulo de metodología de psicología o educación llega como párrafos continuos: participantes, materiales, procedimiento, análisis, cada uno como una secuencia de oraciones completas. Son dos envíos distintos a efectos del análisis, y el segundo es el que vuelve manchado de rojo.
| Cómo está organizada la sección | Qué entra como texto que cumple los criterios | De qué trata entonces el porcentaje |
|---|---|---|
| Pasos numerados, tablas de parámetros, listas de equipamiento, ecuaciones | Muy poco, porque la mayoría no son oraciones gramaticales estándar | Principalmente la prosa en otras partes del archivo, no esta sección |
| Párrafos continuos describiendo participantes, materiales y procedimiento | Prácticamente todo | Una muestra compuesta casi enteramente por prosa procedimental convencional |
| Prosa extensa dentro de una celda de tabla | Se procesa. Una nota de versión del 9 de agosto de 2023 announced the model could handle long-form prose text in tables, and added that existing submissions have to be resubmitted before they are reprocessed (anunció que el modelo podía manejar texto en prosa extenso en tablas, y añadió que los envíos existentes deben reenviarse antes de reprocesarse) | Lo mismo que los párrafos ordinarios, lo que sorprende a quienes movieron texto a una tabla por otras razones |
Hay una consecuencia contraintuitiva en la fila central. Quedar excluido del texto que cumple los criterios no es un descuento: elimina los pasos numerados y las tablas de valores —que nunca iban a parecer prosa generada— y deja atrás la parte de tu escritura más convencional. Cuanto más estrecha es la muestra que cumple los criterios, más completamente el número es una declaración sobre tus párrafos procedimentales específicamente.
Una exclusión va en la otra dirección y vale la pena conocerla porque elimina una alarma falsa común: la misma nota de versión de 2023 registra que el resaltado dentro de una bibliografía era un error, que las bibliografías ahora se excluyen cuando se procesa el informe de escritura con IA, y que los envíos con secciones de referencias resaltadas deben reenviarse para reprocesarse. Si estás mirando un informe antiguo con la lista de referencias encendida, es esto.
La brecha entre el número y la cantidad de resaltado en la página se desprende de todo esto, y Turnitin lo dice directamente sin dejarlo a inferencia. Cómo leer un informe de escritura con IA de Turnitin trabaja esa brecha; ¿puede Turnitin revisar una tesis completa cubre qué ocurre en los límites de longitud, donde viven los envíos a nivel de capítulo.
El género responde a la propia lista del proveedor
Turnitin publica un relato de qué suelen tener en común sus falsos positivos. Textualmente:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (A veces los falsos positivos —marcar incorrectamente texto escrito por humanos como generado por IA— pueden incluir contenido sin mucha variación estructural, texto que literalmente se repite, o texto que ha sido parafraseado sin desarrollar ideas nuevas).
La oración que viene después no va dirigida a ti en absoluto:
"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Si nuestro indicador muestra una mayor cantidad de escritura con IA en este tipo de texto, le aconsejamos que lo tenga en cuenta al observar el porcentaje indicado).
Dos de los tres elementos de esa lista describen cosas que una sección de métodos debe hacer. La variación estructural es lo que una lista de verificación de informes pasa su tiempo eliminando: el mismo marco para cada medición, el mismo orden de subsecciones, la misma construcción para cada instrumento, de modo que dos procedimientos descritos de forma idéntica puedan compararse. La repetición literal es cómo señalas que dos condiciones realmente se manejaron igual. Esta es la única sección de una tesis donde escribir la misma forma oracional once veces es correcto, y también es la sección donde hacerlo tiene un coste elevado de deshacer. Qué puedes y no puedes reformular con seguridad allí es un problema separado con sus propias reglas, en qué puedes parafrasear en métodos y resultados, y la pregunta más amplia de si ajustar tu escritura en absoluto está en deberías cambiar cómo escribes.
Si revisaste la sección por sí sola, mediste otra cosa
Gran parte del pánico en esta situación viene de una auto-revisión en lugar de un informe institucional: el capítulo se pega en alguna herramienta o se envía por separado a una tarea de borrador, y vuelve con un número que nadie quiere ver.
Turnitin describe que los envíos cortos se comportan de forma cualitativamente distinta, no solo en grado:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." And the sentence that follows: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (En documentos más cortos donde solo hay unos pocos cientos de palabras, la predicción será mayormente 'todo o nada' porque estamos prediciendo sobre un solo segmento sin oportunidad de superposición. Y la oración que sigue: «Esto significa que cierto texto que es una mezcla de contenido generado por IA y original podría marcarse como totalmente generado por IA»).
Un capítulo de métodos enviado por sí solo es candidato para esa zona, más aún de lo que sugiere su recuento de palabras, porque los pasos numerados y las tablas salen primero del denominador. También hay un piso debajo: un informe de escritura con IA necesita al menos 300 palabras de prosa en formato extenso, así que una sección de métodos corta por sí sola puede no producir ningún informe en lugar de uno bajo. Y por debajo del umbral de visualización no hay nada que leer: resultados por encima del 0% y por debajo del 20% se muestran como un asterisco sin número ni resaltados, lo que significa que una mejora real y ninguna mejora se ven idénticas desde donde estás.
Lo que una sección roja no resuelve
Es tentador tomar el mecanismo anterior y tratarlo como un hallazgo a tu favor. No lo es. Todo en esta página explica qué mide el número. Nada de esto es evidencia sobre quién escribió tu capítulo, y corta en ambos sentidos: una franja en tu sección de métodos no es prueba de nada, y tampoco lo es una explicación de por qué ocurren las franjas.
"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." The next sentence is where the weight sits: "It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." (Nuestro modelo de detección de escritura con IA puede no ser siempre preciso —puede identificar erróneamente texto escrito por humanos, generado por IA y parafraseado por IA—, por lo que no debe usarse como única base para acciones adversas contra un estudiante. La oración siguiente es donde reside el peso: «Se requiere un escrutinio adicional y juicio humano junto con la aplicación por parte de una organización de sus políticas académicas específicas para determinar si ha ocurrido mala conducta académica»).
- Una franja es una distribución, no un recuento. Te dice que las puntuaciones del modelo fueron uniformes en ese tramo. No te dice cuán confiable fue ninguna de ellas.
- El porcentaje es sobre prosa que cumple los criterios, así que no es comparable entre dos capítulos organizados de forma distinta, y sumar porcentajes de capítulos produce un número que no se refiere a nada.
- El informe es generado por un sistema que su propio proveedor dice puede identificar texto erróneamente, lo cual es razón para que una persona mire, no para descartar el resultado.
- Nada de esto es verificable por ti en la mayoría de configuraciones. El indicador y el informe no son visibles para los estudiantes, aunque un instructor puede descargar el informe como PDF y compartirlo.
No lleves este artículo a una reunión como un argumento. Explicarle un clasificador a alguien que ya leyó las mismas páginas de ayuda tiende a parecer preparación en lugar de respuesta, y mueve la conversación a un terreno donde estás discutiendo sobre un modelo en lugar de sobre tu trabajo. Lo que realmente tiene peso es la procedencia: borradores, protocolo, archivo de análisis, las fechas. Marcado, pero lo escribiste tú cubre qué evidencia vale la pena reunir, la conversación después de una marca de IA cubre cómo es proceduralmente la reunión, y historial de versiones como evidencia cubre dónde vive el registro si no has pensado en ello antes.
Si la sección va a revisarse de todos modos
A veces la decisión ya está tomada, por un supervisor o por ti, y la pregunta se vuelve cómo hacerlo sin romper nada. La sección de métodos es el peor capítulo de una tesis para reformular a la ligera. Orden, cronología, dosis, equipamiento, ajustes, reglas de decisión, población de análisis y exclusiones son el contenido, y una oración fluida que deja caer uno de ellos en silencio es un defecto real donde una oración rígida no lo era.
El coste que la gente subestima no es la reescritura. Es la reverificación. Cada párrafo que se toca es un párrafo que ahora tienes que leer contra el protocolo, el código de análisis y las tablas. Un plan que toca un capítulo entero ha creado un trabajo de corrección del tamaño de un capítulo, y por eso el alcance del cambio importa más que el método usado para hacerlo.
Esa es la parte alrededor de la cual está construido HumanPen. Importa el informe de escritura con IA de Turnitin o iThenticate para ese envío y los pasajes que marca se convierten en el alcance: solo se reescribe ese texto, todo lo demás queda congelado, y la propia descripción del sitio sobre la regla del párrafo es que "a paragraph is the smallest unit the engine rewrites: if your selection covers only part of one, it is expanded to the full paragraph and shown that way for you to confirm" (un párrafo es la unidad más pequeña que el motor reescribe: si tu selección cubre solo parte de uno, se expande al párrafo completo y se muestra así para que lo confirmes). Fórmulas, figuras y estructuras de tabla no son parte de la reescritura de texto, lo cual importa más en esta sección que en cualquier otra parte del documento. La facturación cuenta las palabras realmente reescritas en lugar del archivo que subiste. Los resultados elegibles pueden seguir bajando la IA gratis.
Lo que nada de esto es, es una predicción. El modelo de Turnitin cambia, las reglas de visualización han cambiado antes, y no tenemos forma de decirte qué dirá tu próximo informe. Las afirmaciones anteriores son sobre qué palabras se tocan y cuáles se cobran, que son las dos cosas que realmente podemos controlar.
Preguntas frecuentes
¿Por qué está resaltada toda mi sección de metodología si escribí cada palabra? Porque la unidad de clasificación es un segmento superpuesto, no una oración, y las oraciones heredan y combinan las puntuaciones de los segmentos que las contienen. Un tramo largo escrito en un registro uniforme le da a los segmentos adyacentes poco para diferenciar, así que el resultado tiende a ser continuo. Eso es una descripción de cómo se forma una franja, no una declaración de que tu franja en particular es un falso positivo.
¿Un bloque sólido de resaltado significa que cada oración fue juzgada como IA? No, y la descripción publicada es la razón. Una oración lleva una puntuación que heredó de los segmentos en los que aparece, posiblemente más de uno, combinada. Leer una franja como una lista de veredictos individuales es el error que lleva a planes de edición oración por oración.
Mi sección de métodos es mayormente pasos numerados y una tabla de parámetros. ¿Por qué el porcentaje sigue siendo alto? Puede que eso no esté en el análisis en absoluto. Turnitin analiza texto que cumple los criterios, es decir, prosa escrita en oraciones gramaticales estándar, y afirma que el porcentaje no es necesariamente el porcentaje de todo el envío. Excluir los pasos y tablas deja los párrafos convencionales detrás como la muestra que el número describe.
¿Debería añadir variedad a mi sección de métodos para que parezca menos repetitiva? Esa es una pregunta sobre los estándares de informe de tu disciplina antes que sobre un detector, y la repetición en una sección de métodos normalmente está haciendo un trabajo. El propio consejo del proveedor sobre texto con estas propiedades está dirigido a quien lee el informe, no a quien lo escribió.
Pasé el capítulo por un verificador por separado y obtuve un número muy alto. ¿Ese es el número que ve mi supervisor? No necesariamente, porque es un envío distinto. Turnitin dice que las predicciones sobre documentos de unos pocos cientos de palabras salen mayormente como todo o nada, ya que hay un solo segmento sin superposición, y que contenido mixto en esa situación puede marcarse como totalmente generado por IA. Un capítulo también es un denominador distinto a un archivo completo.
¿Puedo citar la lista de falsos positivos del proveedor como defensa? Es una declaración publicada sobre los modos de error de la herramienta y va dirigida a quien lee el porcentaje, así que es justo saber que existe. No es evidencia sobre tu documento, y llevar un mecanismo a una conversación sobre mala conducta como argumento tiende a trabajar en tu contra. Lleva los borradores y el protocolo.