Por qué las instrucciones en el prompt no pueden bajar tu puntuación de IA de forma fiable

Buscar "instrucciones para bajar la tasa de IA" parte de la premisa de que el prompt adecuado puede cambiar las estadísticas que lee el detector. Pero un prompt lo procesa un modelo de IA que genera texto con sus propios patrones de probabilidad de palabras. La FAQ de Turnitin dice que puede detectar texto modificado por herramientas de parafraseo y evasión ("AI paraphraser or bypasser tools"). Este mecanismo explica por qué los prompts por sí solos no son una solución fiable.

Equipo de HumanPen

· 4 min de lectura

Respuesta breve

Un prompt es una instrucción en texto que procesa un modelo de IA. Cuando le pides a una IA que "reescribir esto para que suene más humano" o que "añada burstiness y perplexity", el modelo genera texto nuevo a partir de esa instrucción. Ese texto nuevo sigue teniendo patrones de probabilidad de palabras, y eso es exactamente lo que lee el clasificador de Turnitin. El detector no ve tu prompt. Solo ve el resultado. Que la puntuación baje depende de si el perfil de probabilidad de palabras del texto difiere lo suficiente de lo que el modelo aprendió a asociar con texto generado por IA, y no puedes controlar eso escribiendo una instrucción mejor. El modelo decide qué palabras usar, y precisamente esas elecciones son las que el detector está entrenado para reconocer.

Lo que ve el detector

La FAQ de Turnitin describe el proceso:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." ("Cuando se envía un trabajo a Turnitin, se extraen oraciones del envío y se segmentan en secciones superpuestas para el análisis de predicción. Cada segmento es clasificado por el modelo de detección de IA y recibe un valor entre 0 y 1, que indica la probabilidad de que el texto sea humano o generado por IA. Cada oración que cumple los criterios dentro de estos segmentos hereda la puntuación del segmento. Como los segmentos se superponen, algunas oraciones pueden tener varias puntuaciones, que luego se combinan en una sola. Estas puntuaciones de oración se agregan y se usan para calcular la puntuación general de escritura con IA del documento.")

El detector lee características estadísticas de las secuencias de palabras en tu texto. No ve el prompt que usaste. No sabe si el texto fue generado, reescrito o editado por un humano. Solo ve las secuencias finales de palabras y las clasifica.

Por qué "ajustar burstiness" no es una palanca real

Un tipo común de instrucción le pide a la IA que "aumente burstiness" o "varíe perplexity". La FAQ de Turnitin dice:

"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." ("Nuestro modelo no está programado explícitamente para evaluar señales específicas como 'burstiness', 'perplexity' u otras métricas individuales a las que a veces se hace referencia en debates públicos.")

La siguiente oración: "Instead, it learns statistical patterns from our training data." ("En cambio, aprende patrones estadísticos de nuestros datos de entrenamiento.")

Y en la misma página: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." ("Nuestros clasificadores están entrenados para detectar estas diferencias en la probabilidad de palabras y son expertos en las secuencias particulares de probabilidad de palabras de los escritores humanos.")

El modelo no calcula una métrica llamada burstiness para compararla con un umbral. Así que pedirle a una IA que "aumente burstiness" es pedirle que ajuste algo que el detector puede que ni siquiera esté midiendo como tú crees. Lo que el detector mide son patrones de probabilidad de palabras aprendidos de datos de entrenamiento. Que una IA que genera texto con "más burstiness" desplace esos patrones en una dirección favorable es algo que no puedes verificar simplemente leyendo el texto. ¿Usa Turnitin perplexity y burstiness? es la versión más detallada de esa pregunta.

Una IA reescribiendo texto de IA produce texto detectable

Hay un problema aún más de fondo. Si usas una IA para reescribir texto que fue marcado como generado por IA, estás produciendo texto modificado por una herramienta de IA. La FAQ de Turnitin dice:

"Furthermore, it can also identify instances where AI-generated text may have been modified by AI paraphraser or bypasser (also called humanizers) tools to evade detection." ("Además, también puede identificar casos en los que texto generado por IA puede haber sido modificado por herramientas de parafraseo o evasión de IA (también llamadas 'humanizadores') para evadir la detección.")

El detector no solo busca texto generado crudo por IA. También busca texto que ha pasado por una herramienta de parafraseo o evasión. Cuando escribes un prompt pidiéndole a una IA que reescriba el output de otra IA, el resultado es funcionalmente un output de parafraseador. El detector está entrenado para identificar ese tipo de texto. Ese desenlace tiene su propio artículo: Parafraseé texto de IA con otra IA y Turnitin lo marcó igual.

Cuando la reescritura sale mal

La FAQ de Turnitin también enumera texto propenso a falsos positivos:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." ("A veces, los falsos positivos (marcar incorrectamente texto escrito por humanos como generado por IA) pueden incluir contenido sin mucha variación estructural, texto que literalmente se repite, o texto que ha sido parafraseado sin desarrollar ideas nuevas.")

La siguiente oración: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." ("Si nuestro indicador muestra una cantidad mayor de escritura con IA en ese tipo de texto, te aconsejamos que lo tengas en cuenta al observar el porcentaje indicado.")

El tercer punto es el que hay que notar. "Parafraseado sin desarrollar ideas nuevas" describe lo que pasa cuando una IA reescribe texto barajando palabras sin añadir sustancia. El detector ve estructura uniforme y patrones de palabras que se parecen al parafraseo generado por máquina. Así que una reescritura con IA que solo cambia el lenguaje superficial mientras preserva la misma estructura puede acercar el texto al perfil de falso positivo, no alejarlo. Los cambios que sí cambian las estadísticas muestra cómo se ve la alternativa hecha a mano.

Qué es lo que realmente cambia la puntuación

Para resumir lo que hemos cubierto:

  • Un prompt lo procesa un modelo de IA, que produce texto con sus propios patrones de probabilidad de palabras. El detector ve el output, no la instrucción.
  • El modelo no calcula burstiness o perplexity como métricas con nombre, así que pedirle a una IA que las "ajuste" puede que no afecte lo que lee el detector.
  • Turnitin detecta activamente texto modificado por herramientas de parafraseo y evasión, que es justamente lo que produce una IA reescribiendo texto de otra IA.
  • Una reescritura que solo baraja palabras sin añadir sustancia puede acercar el texto al perfil de falso positivo.
  • Lo que cambia la puntuación es cambiar el perfil de probabilidad de palabras de los pasajes marcados, no escribir un prompt mejor.

Si tienes un informe de Turnitin que muestra qué pasajes fueron marcados, súbelo y trabaja específicamente en esos pasajes. Los pasajes elegibles pueden volver a procesarse sin cargo.

Seguir leyendo