¿Por qué parafrasear hace que suba tu puntuación de IA de Turnitin?

Bajar el porcentaje de similitud y bajar la detección de IA tiran en direcciones opuestas. Las palabras que elige una herramienta de reescritura para evitar coincidencias son justo las mismas expresiones de alta frecuencia que usan los generadores de IA, y el detector lee esa distribución.

Equipo de HumanPen

· 10 min de lectura

La respuesta breve

Las herramientas de paráfrasis están diseñadas para bajar tu porcentaje de similitud, y lo consiguen intercambiando tus palabras por otras equivalentes. Esas expresiones sustitutas suelen ser de alta frecuencia, el tipo de lenguaje que los generadores de IA también usan por defecto. El detector de Turnitin lee patrones de probabilidad léxica, y cuando tu texto reescrito se acerca más a esa distribución, el porcentaje de IA sube. Esto no es un error. Es el mecanismo funcionando tal como está diseñado, pero apuntando a un blanco distinto del que tú tenías en mente.

El porcentaje de similitud y el de IA son, en palabras de Turnitin, "completely independent and do not influence each other" ("completamente independientes y no se influyen entre sí"). Miden cosas distintas, los calculan procesos diferentes, y nada de lo que hagas con uno garantiza ayuda para el otro. Cuando tiran en direcciones opuestas, la herramienta de paráfrasis que usaste para arreglar el primero puede meterte en el segundo.

Dos puntuaciones, dos blancos, un documento

Turnitin lo dice claro en sus preguntas frecuentes sobre detección: "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other" ("El porcentaje de similitud y el de detección de escritura con IA son completamente independientes y no se influyen entre sí"). El porcentaje de similitud te dice cuánto de tu texto coincide con otro texto en la base de datos. El porcentaje de IA te dice cuánto de tu texto parece escrito por una máquina. No son dos formas de ver la misma propiedad.

Una herramienta de paráfrasis está diseñada para el primer blanco. Toma una frase que coincide con algo en la base de datos y la reescribe para que ya no coincida. Eso baja tu porcentaje de similitud. Pero lo consigue sustituyendo tus elecciones léxicas originales por alternativas, y esas alternativas vienen de las expresiones más comunes y probables para cada significado. Tu frase original podía ser peculiar. La versión sustituta es, por diseño, lo contrario de peculiar.

El porcentaje de IA, en cambio, se calcula de otra cosa totalmente. Rastreamos cómo funciona ese cálculo en qué miden los detectores de IA, y la versión breve es que el detector divide tu texto en segmentos solapados, asigna una puntuación de probabilidad a cada uno y agrupa todo en un número a nivel de documento. Las palabras que eligió la herramienta de paráfrasis son ahora las palabras que se puntúan. Si esas palabras se acumulan en la zona de alta probabilidad, el número sube.

Lo que el detector lee realmente

Mucha gente dice que el detector de Turnitin mide "perplexity" y "burstiness" (perplejidad y variabilidad). No es del todo exacto. Las preguntas frecuentes de Turnitin dicen: "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions" ("Nuestro modelo no está programado explícitamente para evaluar señales concretas como 'burstiness', 'perplexity' u otras métricas individuales a las que a veces se hace referencia en debates públicos"). La frase siguiente en el mismo párrafo dice: "Instead, it learns statistical patterns from our training data" ("En cambio, aprende patrones estadísticos de nuestros datos de entrenamiento").

Pero esas mismas preguntas frecuentes, en otra sección, dicen esto: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers" ("Nuestros clasificadores están entrenados para detectar estas diferencias en probabilidad léxica y son expertos en las secuencias particulares de probabilidad de palabras de los escritores humanos"). O sea que el modelo no calcula una puntuación de perplejidad y la llama así. Está, en sus propias palabras, leyendo probabilidad léxica. La distinción importa porque la primera cita, citada sola, suena como si el detector ignorase por completo la probabilidad léxica. No la ignora. Por qué los detectores no se ponen de acuerdo explica cómo distintas herramientas llegan a números diferentes para el mismo texto, y el modelado de probabilidad léxica está en el centro de eso.

Para la paráfrasis, esto significa algo muy directo. Tu frase original tenía un perfil de probabilidad léxica moldeado por tu vocabulario, tus hábitos, lo concreto que leíste antes de escribirla. La versión parafraseada tiene un perfil moldeado por lo que la herramienta seleccionó, y la herramienta selecciona desde el centro de la distribución, no desde los bordes. El detector, que está entrenado en probabilidad léxica, ve la frase reescrita como más cercana a su modelo de salida de máquina. No porque hayas usado IA, sino porque la huella estadística de una frase parafraseada se parece más a una.

El perfil exacto que Turnitin llama falso positivo

Aquí es donde se pone incómodo. Las preguntas frecuentes de Turnitin listan los tipos de texto que tienden a producir falsos positivos, y la descripción lee como una ficha técnica de lo que produce una herramienta de paráfrasis:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas" ("A veces los falsos positivos (marcar incorrectamente texto escrito por humanos como generado por IA) pueden incluir contenido sin mucha variación estructural, texto que literalmente se repite, o texto que ha sido parafraseado sin desarrollar ideas nuevas").

La frase justo después de esa es la que más importa: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated" ("Si nuestro indicador muestra una cantidad mayor de escritura con IA en ese tipo de texto, le aconsejamos que tenga eso en cuenta al mirar el porcentaje indicado"). Turnitin está diciendo a los instructores que resten valor a porcentajes altos de IA en texto que coincida con esta descripción.

Una herramienta de paráfrasis, por diseño, no desarrolla ideas nuevas. Toma tus ideas existentes y las vuelve a redactar. También tiende a reducir la variación estructural, porque suaviza el estilo en todo el documento en lugar de introducir nuevas formas de frase. La herramienta no intenta hacer tu texto más variado. Intenta hacer que coincida menos. Esos dos objetivos no se alinean, y el segundo empuja el texto justo hacia el perfil que Turnitin dice que es propenso a falsos positivos.

Profundizamos más en qué hace que la escritura pulida active detectores, y el mecanismo ahí es el mismo que está en juego aquí. Suavizar es una señal estadística.

La dirección hacia la que está inclinado el detector

Turnitin declara que prefiere que se le escape texto de IA antes que marcar falsamente escritura humana. Las preguntas frecuentes dicen: "In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written" ("Para mantener esta tasa baja del 1% de falsos positivos, existe la posibilidad de que nos escape algo de texto escrito con IA en un documento. Nos resulta aceptable porque no queremos señalar incorrectamente texto escrito por humanos como escrito por IA").

Esa inclinación es real, y es la razón por la que un documento escrito enteramente por humanos tiene baja probabilidad de ser marcado. Pero no protege el texto parafraseado de la forma en que la gente asume. La tasa de falsos positivos del 1% se aplica a texto que no coincide con el perfil de falso positivo. Texto que sí coincide con el perfil, el tipo que Turnitin mismo describe en la cita de arriba, no es el texto contra el que se midió la cifra del 1%. El detector está inclinado hacia la cautela en general, pero las características que activan la inclinación son las mismas que una herramienta de paráfrasis instala.

Si tu texto fue parafraseado por una herramienta impulsada por IA, hay una vía separada. Turnitin dice que "can also identify instances where AI-generated text may have been modified by AI paraphraser or bypasser (also called humanizers) tools to evade detection" ("también puede identificar casos en los que texto generado por IA puede haber sido modificado por herramientas de paráfrasis de IA o evasoras (también llamadas humanizadoras) para eludir la detección"). Eso no es un falso positivo. Es un positivo verdadero sobre una señal distinta, y el detector tiene una capacidad nombrada para ello. Parafraseado con IA y aún así marcado recorre lo que pasa cuando la herramienta que usaste era ella misma un modelo de IA haciendo la reescritura.

No todas las herramientas de paráfrasis hacen lo mismo

Hay una diferencia significativa entre un corrector gramatical que arregla tu ortografía y una herramienta generativa que reescribe tus frases. Turnitin traza esta línea explícitamente. Sobre Grammarly, las preguntas frecuentes dicen: "Based on tests we conducted on human-written documents with no AI-generated content in them, in most cases, changes made by Grammarly (free & premium) and/or other grammar-checking tools were not flagged as AI-written by our detector" ("Según pruebas que realizamos en documentos escritos por humanos sin contenido generado por IA, en la mayoría de los casos, los cambios hechos por Grammarly (gratis y premium) y/u otras herramientas de corrección gramatical no fueron marcados como escritos por IA por nuestro detector"). El calificativo clave es "in most cases" ("en la mayoría de los casos"). La exención no es absoluta.

Y las preguntas frecuentes continúan: "Please note that this excludes content generated by Grammarly's generative AI-powered features, including draft generation, paraphrasing, summarizing, and other features. Content produced using these features will likely be flagged as AI-generated by our detector" ("Tenga en cuenta que esto excluye contenido generado por las funciones de IA generativa de Grammarly, incluidas la generación de borradores, la paráfrasis, el resumen y otras funciones. El contenido producido usando estas funciones probablemente sea marcado como generado por IA por nuestro detector"). Arreglos de ortografía y puntuación son una categoría. Paráfrasis y reescritura son otra. La segunda categoría es donde sube la puntuación de IA.

Turnitin no publica una lista de qué herramientas de paráfrasis y evasión ha entrenado y probado. Las preguntas frecuentes dicen: "However, to safeguard the integrity of our solution and its effectiveness in maintaining academic honesty, we're unable to disclose the names of these tools" ("Sin embargo, para salvaguardar la integridad de nuestra solución y su eficacia para mantener la honestidad académica, no podemos revelar los nombres de estas herramientas"). Así que nadie fuera de Turnitin puede decirte qué herramientas concretas se detectan y cuáles no, y cualquier afirmación de que una herramienta con nombre "vence" al detector es una afirmación que nadie puede verificar contra las propias pruebas de Turnitin. No hacemos esa afirmación, y no recomendamos confiar en quien la haga.

Lo que realmente baja el porcentaje de IA

El porcentaje de IA baja cuando el perfil de probabilidad léxica de tu texto se aleja de la distribución que el detector asocia con salida de máquina. Eso pasa cuando introduces vocabulario, estructuras de frase e ideas que un generador no habría alcanzado por sí solo. Parafrasear sin añadir ideas nuevas hace lo contrario. Mueve el perfil hacia el centro.

Si ya pasaste tu texto por una herramienta de paráfrasis y la puntuación de IA subió, el camino a seguir no es otro pase de paráfrasis. Otro pase sustituye un conjunto de palabras de alta frecuencia por otro conjunto de palabras de alta frecuencia. El perfil no se mueve. Necesitas reescribir los pasajes marcados con tus propias elecciones léxicas, tus propias formas de frase, e idealmente tu análisis adicional o ejemplos propios. Eso es lo que desplaza la distribución de probabilidad que lee el detector.

La versión práctica de esto, con el informe delante de ti, está en cómo leer un informe de escritura con IA de Turnitin. El informe te muestra qué segmentos están marcados, y esos son los segmentos donde tus elecciones léxicas necesitan dejar de ser el promedio y empezar a ser las tuyas.

Dónde está la línea

HumanPen es un reescritor de documentos, y la elección de diseño relevante aquí es qué se reescribe y qué no. Puedes subir el documento junto con su informe de escritura con IA, y solo se reescriben los pasajes que el informe marcó. El resto del documento se queda como lo escribiste.

La razón por la que esto importa para este artículo es que un pase de paráfrasis de documento completo es el peor escenario posible para el mecanismo descrito arriba. Reescribe todo, incluidos pasajes que no estaban marcados, y lo hace moviéndolos todos hacia el centro de alta frecuencia. Una reescritura delimitada toca solo los segmentos que el detector ya marcó, y lo hace con el objetivo de desplazar su perfil de probabilidad léxica en lugar de suavizarlos más.

La facturación cuenta solo las palabras realmente reescritas. Si un informe posterior aún marca pasajes, esos pueden volverse a ejecutar sin cargo. No te decimos qué dirá el siguiente informe, porque nadie puede. Pero el mecanismo es el mecanismo, y una reescritura delimitada trabaja con él en lugar de contra él.

Preguntas frecuentes

¿Parafrasear siempre sube la puntuación de IA? No siempre, pero lo bastante a menudo como para que el patrón tenga nombre. Turnitin lista "text that has been paraphrased without developing new ideas" ("texto que ha sido parafraseado sin desarrollar ideas nuevas") entre los perfiles propensos a falsos positivos. Lo que activa ese perfil es si se añadió análisis nuevo, no qué operaciones de edición produjeron las frases. Texto que se mantiene dentro de las mismas ideas conserva un perfil de probabilidad léxica que el detector ha sido entrenado para asociar con salida de IA. Si tu puntuación concreta sube depende de cómo se veía tu texto original y con qué lo sustituyó la herramienta.

Usé Grammarly para arreglar la ortografía. ¿Eso subirá mi puntuación de IA? Turnitin dice que en la mayoría de los casos, los cambios hechos por Grammarly y otras herramientas de corrección gramatical "were not flagged as AI-written by our detector" ("no fueron marcados como escritos por IA por nuestro detector"). El calificativo "in most cases" ("en la mayoría de los casos") está haciendo trabajo en esa frase. Si usaste las funciones generativas de Grammarly como paráfrasis, resumen o generación de borradores, las preguntas frecuentes dicen que ese contenido "will likely be flagged as AI-generated" ("probablemente sea marcado como generado por IA").

¿Por qué mi porcentaje de similitud baja pero mi puntuación de IA sube? Porque miden cosas distintas. Turnitin dice que las dos puntuaciones son "completely independent and do not influence each other" ("completamente independientes y no se influyen entre sí"). Parafrasear baja la similitud eliminando texto coincidente. Las palabras sustitutas pueden subir la puntuación de IA porque tienden a ser expresiones de alta frecuencia, y el detector lee patrones de probabilidad léxica que se solapan con los del texto generado por IA.

¿Puedo simplemente ejecutar la herramienta de paráfrasis otra vez para arreglar la puntuación de IA? Ejecutarla otra vez sustituye un conjunto de palabras comunes por otro conjunto de palabras comunes. El perfil de probabilidad léxica no se mueve en una dirección útil. Lo que desplaza el perfil es reescribir los pasajes marcados con tu propio vocabulario, tus propias estructuras de frase y tus propias ideas adicionales.

¿Turnitin detecta qué herramienta de paráfrasis usé? Turnitin dice que ha sido "trained and tested to detect leading paraphraser and bypasser tools" ("entrenado y probado para detectar las principales herramientas de paráfrasis y evasión") pero no revela cuáles. Las preguntas frecuentes dicen que compartir una lista "would make it easier for students to evade our system" ("haría más fácil que los estudiantes eludan nuestro sistema"). Nadie fuera de Turnitin puede verificar si una herramienta concreta está en esa lista.