¿Detecta Turnitin lo que copias y pegas?
La pregunta mezcla dos informes distintos. Separamos qué busca realmente cada uno, por qué un texto humano copiado dispara la coincidencia pero no la marca de IA, y qué conviene revisar si te preocupan las dos puntuaciones.
Equipo de HumanPen
· 9 min de lectura
La respuesta breve
Turnitin funciona con dos sistemas independientes. El Similarity Report detecta el copiar y pegar. Compara el texto que envías con una base de datos de contenido publicado, trabajos de otros estudiantes y fuentes web, y marca las cadenas de texto que coinciden. Si copiaste de una fuente que está en la base de datos, el Similarity Report lo mostrará. El AI Writing Report no detecta el copiar y pegar. Analiza patrones de probabilidad de las palabras en la prosa para estimar si un texto fue generado por IA. Un texto humano copiado de un libro o de un artículo no activa el detector de IA, porque la escritura humana tiene patrones de probabilidad distintos de los del texto generado por IA.
Estas dos puntuaciones no se influyen entre sí. Vamos a ver cómo funciona cada sistema y qué significa eso si pegaste texto de algún sitio.
Cómo atrapa el Similarity Report el texto copiado
El Similarity Report es el que hace lo que la mayoría quiere decir cuando pregunta si Turnitin detecta lo que copias y pegas. Toma el documento que envías y lo compara con la colección de contenido de Turnitin. Esa colección incluye obras publicadas, páginas web y otros trabajos de estudiantes que ya se han enviado a Turnitin antes, y contra qué se compara tu manuscrito lo explica con más detalle. Cuando el sistema encuentra en tu documento una cadena de texto que coincide con una cadena de la base de datos, resalta la coincidencia y la cuenta en el porcentaje de similitud.
El mecanismo es la coincidencia de cadenas de texto. Si pegaste un párrafo de un sitio web, una frase de un libro digitalizado e indexado o una sección del trabajo de un amigo que ya se había enviado, el Similarity Report encontrará la coincidencia siempre que la fuente esté en la base de datos. El informe te muestra exactamente qué cadenas coincidieron y de qué fuente salieron.
Las preguntas frecuentes sobre las capacidades de detección de escritura con IA de Turnitin exponen esa separación directamente:
«The Similarity score and the AI writing detection percentage are completely independent and do not influence each other.» (La puntuación de similitud y el porcentaje de detección de escritura con IA son completamente independientes y no se influyen mutuamente.)
La frase siguiente de esa misma página es:
«The Similarity score indicates the percentage of matching-text found in the submitted document when compared to Turnitin's comprehensive collection of content for similarity checking.» (La puntuación de similitud indica el porcentaje de texto coincidente encontrado en el documento enviado al compararlo con la amplia colección de contenido de Turnitin para la comprobación de similitud.)
Esa segunda frase describe exactamente lo que hace el Similarity Report. Encuentra texto coincidente. No evalúa si ese texto lo escribió una persona o una IA. No le importa quién lo escribió. Le importa si la misma cadena existe en algún lugar de la base de datos. Por eso también el texto citado y entre comillas sigue apareciendo en el Similarity Report aunque hayas hecho todo bien.
Cómo funciona el AI Writing Report y por qué no detecta el copiar y pegar
El AI Writing Report funciona con un principio completamente distinto. No compara tu texto con una base de datos de cadenas. Lo pasa por un modelo que asigna puntuaciones de probabilidad a segmentos de prosa. Las preguntas frecuentes describen el mecanismo así:
«When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.» (Cuando se envía un trabajo a Turnitin, las oraciones del envío se extraen y se dividen en secciones superpuestas para el análisis de predicción. Cada sección es clasificada por el modelo de detección de IA y recibe un valor entre 0 y 1, que indica la probabilidad de que el texto sea probablemente humano o generado por IA. Cada oración calificable dentro de esas secciones hereda la puntuación de la sección. Como las secciones se superponen, algunas oraciones pueden tener varias puntuaciones, que después se unifican en una sola. Esas puntuaciones por oración se agregan y se usan para calcular la puntuación general de escritura con IA del documento.)
La frase clave es «the probability of the text being likely human or AI-generated.» (la probabilidad de que el texto sea probablemente humano o generado por IA). El modelo observa cómo se eligen y se ordenan las palabras. El texto generado por IA tiende a producir palabras muy predecibles dado el contexto anterior, porque los modelos de lenguaje eligen los tokens siguientes más probables. La escritura humana tiende a ser menos predecible en sus elecciones de palabras. Esa diferencia en los patrones de probabilidad es lo que el modelo lee.
Por eso el texto humano copiado no activa el detector de IA. Si pegas en tu trabajo un párrafo de un libro publicado, ese párrafo lo escribió una persona. Sus patrones de probabilidad de palabras se parecen a la escritura humana, no al texto generado por IA. El modelo lo clasifica como humano. El AI Writing Report no lo marca.
Lo contrario también es cierto. Si generas un párrafo con una herramienta de IA y lo pegas en tu trabajo, el AI Writing Report puede marcarlo, porque los patrones de probabilidad de ese párrafo se parecen a una salida de IA. Pero el Similarity Report no lo marcará, porque esa cadena exacta probablemente no existe en la base de datos de contenido publicado de Turnitin. La IA generó texto nuevo. No copió de una fuente existente.
Esta es la distinción de fondo. El Similarity Report atrapa el texto que ya existe en otra parte. El AI Writing Report atrapa el texto que se lee como si lo hubiera escrito una máquina. Copiar y pegar es un problema de similitud. La generación con IA es un problema de probabilidad. Qué entra en esa probabilidad es otra pregunta, y si Turnitin usa la perplejidad y la variabilidad del estilo es la forma en que la mayoría la plantea.
Qué lee realmente el modelo de IA y qué se salta
Hay una segunda capa en el funcionamiento del AI Writing Report, y importa en los casos de copiar y pegar. El modelo no analiza todo lo que hay en tu documento. Las preguntas frecuentes dicen:
«The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures).» (El modelo no detecta de forma fiable el texto generado por IA en forma de texto que no es prosa o de código, y tampoco detecta la escritura breve o poco convencional, como las viñetas, es decir, estructuras cortas que no llegan a ser oraciones.)
La frase siguiente es:
«This means that a document containing several different writing types would result in a disparity between the percentage and the highlights.» (Esto significa que un documento que contiene varios tipos de escritura distintos daría lugar a una discrepancia entre el porcentaje y los fragmentos resaltados.)
Las preguntas frecuentes también precisan qué es lo que sí se analiza:
«This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures.» (Este texto calificable incluye únicamente oraciones en prosa, es decir, que solo analizamos bloques de texto escritos con oraciones gramaticalmente correctas y que no incluyen otros tipos de escritura como listas, viñetas, es decir, estructuras cortas que no llegan a ser oraciones, u otras estructuras que no son oraciones.)
La frase siguiente es:
«This percentage is not necessarily the percentage of the entire submission.» (Este porcentaje no es necesariamente el porcentaje de todo el envío.)
En la práctica, significa esto. Si copiaste y pegaste una lista con viñetas, una tabla de datos o un bloque de código, puede que el modelo de IA ni lo lea. Filtra el contenido que no es prosa antes de ejecutar su análisis. El Similarity Report, en cambio, lo lee todo. Detecta una lista pegada o un bloque de código pegado con la misma facilidad que un párrafo pegado, porque busca coincidencias de cadenas en todo el documento.
Así que, cuando pegas contenido que no es prosa desde una fuente, el resultado es asimétrico. El Similarity Report lo detecta. El AI Writing Report no, porque nunca lo ve.
Por qué el texto humano copiado aparece en un informe y en el otro no
Si juntas los dos mecanismos, se explica el escenario más común sobre el que preguntan los estudiantes. Encontraste un párrafo en un sitio web o en un libro. Lo pegaste en tu trabajo. Te preocupan tanto la puntuación de similitud como la de IA. Esto es lo que ocurre.
El Similarity Report marcará el párrafo pegado, siempre que la fuente esté en la base de datos. La cadena coincide. El porcentaje sube. Se identifica la fuente. El informe está haciendo su trabajo.
El AI Writing Report no marcará el párrafo pegado, siempre que el texto original lo escribiera una persona. El modelo lee el párrafo como prosa, asigna puntuaciones de probabilidad a sus segmentos y comprueba que las elecciones de palabras parecen humanas. El párrafo se clasifica como escrito por una persona. Ninguna marca de IA.
Esto es así incluso si el texto pegado es largo. Al modelo de IA no le importa de dónde salió el texto. Le importa a qué suena. Un párrafo copiado de un artículo académico de los años 1990 tiene los patrones de probabilidad de palabras de la prosa académica humana de los años 1990. Así no se ve el texto generado por IA.
Las preguntas frecuentes dejan clara la independencia. Turnitin dice: «The Similarity score and the AI writing detection percentage are completely independent and do not influence each other.» (La puntuación de similitud y el porcentaje de detección de escritura con IA son completamente independientes y no se influyen mutuamente.) Una puntuación de similitud alta por texto pegado no empuja hacia arriba la puntuación de IA. Una puntuación de IA alta por texto generado no empuja hacia arriba la puntuación de similitud. Las calculan sistemas distintos que buscan cosas distintas, y por eso las dos puntuaciones no deberían leerse como si fueran lo mismo.
Qué significa esto si te preocupan las dos puntuaciones
Si pegaste texto de algún sitio y tienes los dos informes delante, así es como conviene leerlos.
Si el texto pegado aparece en el Similarity Report, es lo esperado. El sistema encontró la coincidencia. Tienes que parafrasear el texto con tus propias palabras, ponerlo entre comillas con su cita o eliminarlo. Las comillas con cita son el único caso en que el texto pegado es legítimo. Turnitin seguirá mostrando la coincidencia, pero tu profesor podrá ver que está correctamente atribuido.
Si el texto pegado lo escribió una persona y estás revisando el AI Writing Report, no deberías ver ninguna marca en él. Si la ves y el texto viene realmente de una fuente humana, la marca es un falso positivo. El modelo de IA estima probabilidades, no certezas. Puede equivocarse. Pero la explicación más común es que lo marcado no es el texto pegado. Lee el texto que está resaltado de verdad. Puede ser tuyo, junto al fragmento pegado, y no el fragmento pegado en sí.
Si generaste texto con una herramienta de IA y lo pegaste, la situación se invierte. El Similarity Report probablemente no lo marcará, porque la cadena es nueva. El AI Writing Report sí puede marcarlo, porque los patrones de probabilidad son los que el modelo está entrenado para reconocer.
Qué hacer
El resumen para quien se pregunta si Turnitin detecta lo que copias y pegas:
- El Similarity Report detecta el copiar y pegar. Compara cadenas de texto con una base de datos. Si la fuente está en la base de datos, el texto pegado aparecerá como coincidencia.
- El AI Writing Report no detecta el copiar y pegar. Analiza patrones de probabilidad de las palabras en la prosa. El texto humano copiado se lee como humano y no se marca.
- Las dos puntuaciones son independientes. Una puntuación de similitud alta no provoca una puntuación de IA alta, y viceversa.
- Si pegaste contenido que no es prosa, como listas, código o tablas, el Similarity Report puede detectarlo, pero el modelo de IA puede que ni lo analice, porque solo lee oraciones en prosa.
- Si pegaste texto generado por IA, el AI Writing Report puede marcarlo aunque el Similarity Report no lo haga, porque la cadena es nueva pero los patrones de probabilidad sí son reconocibles.
La distinción deja de ser sutil en cuanto sabes qué busca cada sistema. La similitud busca cadenas que ya existen. La detección de IA busca patrones de probabilidad en la prosa. Copiar y pegar es un problema de cadenas. La generación con IA es un problema de patrones.
Seguir leyendo