Copyleaks frente a Turnitin: por qué los detectores de IA no se ponen de acuerdo

Es muy común que los estudiantes pasen su trabajo por varios detectores de IA y obtengan resultados totalmente distintos. Turnitin puede marcar un 20% mientras que Copyleaks llega al 80%. La razón es sencilla: modelos diferentes, datos de entrenamiento distintos y umbrales de clasificación que no coinciden. Entender por qué los detectores discrepan te ayuda a interpretar cada puntuación en su contexto.

Equipo de HumanPen

· 4 min de lectura

Respuesta rápida

Los detectores de IA ofrecen puntuaciones distintas porque son modelos diferentes, entrenados con datos distintos y con umbrales de clasificación propios. Copyleaks y Turnitin son productos separados, desarrollados por equipos independientes. Cada uno tiene su propio modelo, su propio corpus de entrenamiento y su propia forma de combinar las predicciones a nivel de segmento para obtener una puntuación del documento. Cuando Copyleaks dice 80% y Turnitin dice 20% sobre el mismo texto, ninguno tiene necesariamente razón o está equivocado. Están midiendo patrones estadísticos diferentes y aplicando límites de decisión distintos. La puntuación que realmente te importa es la de la herramienta que usa tu institución. Si tu universidad usa Turnitin, tu puntuación en Copyleaks puede ser informativa, pero no es la definitiva.

Cómo funciona el detector de Turnitin

El FAQ de Turnitin describe su proceso así:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Cuando se envía un trabajo a Turnitin, se extraen las frases del envío y se dividen en secciones superpuestas para su análisis predictivo. Cada segmento es clasificado por el modelo de detección de IA y recibe un valor entre 0 y 1, que indica la probabilidad de que el texto sea humano o generado por IA. Cada frase válida dentro de estos segmentos hereda la puntuación del segmento. Como los segmentos se superponen, algunas frases pueden tener varias puntuaciones, que luego se combinan en una sola. Estas puntuaciones por frase se agregan y se usan para calcular la puntuación global de IA del documento.)

Turnitin también publica un objetivo específico de falsos positivos: "We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Nos esforzamos por maximizar la eficacia de nuestro detector mientras mantenemos nuestra tasa de falsos positivos, es decir, identificar incorrectamente texto totalmente escrito por humanos como generado por IA, por debajo del 1% para documentos con más de un 20% de escritura con IA.) Este objetivo determina la agresividad con la que el modelo clasifica el texto en los límites. Un modelo ajustado para minimizar falsos positivos clasificará más segmentos inciertos como humanos, lo que puede producir puntuaciones de IA más bajas en textos mixtos.

Por qué Copyleaks y Turnitin discrepan

Copyleaks usa su propio modelo de detección de IA, con sus propios datos de entrenamiento y sus propios umbrales de clasificación. Los detalles del modelo de Copyleaks no son públicos de la misma forma que lo es el FAQ de Turnitin, así que no podemos hacer una comparación directa de sus mecanismos. Pero la razón estructural de la discrepancia es clara: dos modelos diferentes entrenados con datos distintos clasificarán el mismo texto de forma diferente. Una frase que el modelo de Turnitin clasifica con una probabilidad de IA de 0,3 puede recibir un 0,7 del modelo de Copyleaks. Cuando esas diferencias a nivel de segmento se agregan en todo el documento, los porcentajes finales pueden divergir significativamente. Por qué el mismo texto obtiene puntuaciones distintas en cada detector explica esto con más detalle.

También hay una diferencia de umbral. Turnitin no muestra puntuaciones entre el 1% y el 19%, mostrando solo un asterisco. El FAQ lo explica así: "To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range." (Para evitar posibles casos de falsos positivos, no se asigna ninguna puntuación ni resaltado para puntuaciones de detección de IA en el rango del 1% al 19%.) Si Copyleaks muestra un 15% para el mismo texto que Turnitin muestra como un asterisco, la discrepancia se debe en parte a una decisión de visualización, no solo a una diferencia de clasificación. Consulta qué significa el asterisco (*%) en una puntuación de IA de Turnitin.

Los documentos cortos amplifican la discrepancia

El FAQ de Turnitin señala que los documentos cortos producen predicciones menos fiables:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (En documentos más cortos, con solo unos pocos cientos de palabras, la predicción será mayoritariamente "todo o nada", porque estamos prediciendo sobre un único segmento sin oportunidad de superposición.)

La frase siguiente: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Esto significa que cierto texto que es una mezcla de contenido generado por IA y contenido original podría marcarse como totalmente generado por IA.)

En un documento corto, un detector puede clasificar todo el texto como IA (obteniendo 100%) mientras que otro lo clasifica como humano (obteniendo 0%). El comportamiento de todo o nada hace que pequeñas diferencias en cómo cada modelo maneja un único segmento puedan producir divergencias dramáticas en la puntuación final. Si estás comparando puntuaciones entre detectores, la longitud del documento importa. Un resumen de 300 palabras puede obtener puntuaciones radicalmente distintas en diferentes herramientas, mientras que un trabajo de 3.000 palabras puede mostrar resultados más cercanos.

Qué puntuación importa

La puntuación que importa es la de la herramienta que usa tu institución. Si tu universidad usa Turnitin, tu puntuación de IA de Turnitin es la que afecta a tu situación académica. Una puntuación de Copyleaks del 5% no te ayuda si tu puntuación de Turnitin es del 80%. Una puntuación de Copyleaks del 80% no te perjudica si tu institución no usa Copyleaks. Pasar tu trabajo por varios detectores puede darte una idea general de si tu texto tiene patrones similares a los de la IA, pero no puede decirte qué dirá el detector de tu institución. La única forma de saber tu puntuación real es ver el informe de la herramienta que usa tu institución, y solo los instructores y administradores pueden ver el indicador de IA de Turnitin. Que tu universidad lo use o no depende de lo que hayan comprado.

Qué significa esto para ti

Para resumir lo que hemos visto:

  • Los distintos detectores de IA usan modelos diferentes con datos de entrenamiento y umbrales distintos. La discrepancia es de esperar, no es una sorpresa.
  • Turnitin publica su objetivo de falsos positivos (menos del 1% para documentos con más de un 20% de IA) y su mecanismo (clasificación de segmentos superpuestos).
  • Turnitin suprime las puntuaciones entre el 1% y el 19%, mostrándolas como asteriscos, lo que puede amplificar la discrepancia aparente con otras herramientas.
  • Los documentos cortos producen predicciones de todo o nada, lo que puede causar divergencias dramáticas entre detectores.
  • La puntuación que importa es la de la herramienta que usa realmente tu institución.

Si tienes un informe de Turnitin que muestra qué pasajes han sido marcados, importa el informe y trabaja en esos pasajes específicos. Los pasajes elegibles pueden volver a ejecutarse sin cargo.

Seguir leyendo