Cuánto texto necesita un detector de IA: lo que publican cinco proveedores

Pegar en un comprobador gratuito el párrafo que acabas de reescribir es lo más natural del mundo, y es justo el caso sobre el que cada uno de estos proveedores avisa en su propia documentación. Cinco de ellos publican una longitud mínima. Uno de ellos publicó dos experimentos en los que su propio personal escribió a mano un pasaje corto y la herramienta lo declaró IA.

Equipo de HumanPen

· 10 min de lectura

¿Cuánto texto necesita un detector de IA para que su número signifique algo?

Todos los detectores de esta lista publican un mínimo, y un solo párrafo queda por debajo de la mayoría. Estas son las cifras de los propios proveedores, tomadas de su documentación y comprobadas el 18 de septiembre de 2026:

HerramientaLo que publica
Copyleaks – mínimo estricto«For the AI Detector to get an accurate reading, it requires a minimum of 350 characters» (para que el AI Detector obtenga una lectura precisa, necesita un mínimo de 350 caracteres) (caracteres, no palabras)
Copyleaks – muestra recomendada«we suggest testing text containing an average of 350 words» (sugerimos analizar textos que contengan una media de 350 palabras)
Winston AI«Minimum 300 characters. Texts under 600 characters may produce unreliable results and should be avoided.» (Mínimo 300 caracteres. Los textos de menos de 600 caracteres pueden dar resultados poco fiables y deberían evitarse.)
Originality.aiEn la web, un mínimo de 100 palabras; en la API no hay mínimo, pero «accuracy is decreased for texts below 100 words» (la precisión se reduce en los textos de menos de 100 palabras)
ZeroGPT«At least 150–200 words; longer text (500–1,000+) improves stability.» (Al menos 150–200 palabras; un texto más largo (500–1.000 o más) mejora la estabilidad.)
TurnitinNinguna puntuación de IA por debajo de 300 palabras de prosa

Dos de esos mínimos están expresados en caracteres y el resto en palabras, y por eso es tan fácil confundirlos. La conversión es rápida: en la prosa inglesa una palabra ocupa unos seis caracteres si se cuenta el espacio que va detrás – en los 5.357 párrafos publicados en este sitio la mediana es 6,0. Una vez convertidos, todos los mínimos de la tabla se vuelven recuentos de palabras: el mínimo de 300 caracteres de Winston son unas 50 palabras y su advertencia de evitar los textos de menos de 600 caracteres, unas 100; el mínimo de 350 caracteres de Copyleaks son unas 58, y la muestra que recomienda es de 350 palabras; el de Originality es 100; ZeroGPT pide al menos de 150 a 200 y dice que de 500 a 1.000 o más es todavía más estable; el de Turnitin es 300. Compara tu propio pasaje con esas cifras. Para dar una escala, contamos los mismos 5.357 párrafos contra los mismos mínimos: el 54 % alcanza los 300 caracteres de Winston, el 39 % alcanza los 350 de Copyleaks, el 6 % alcanza las 100 palabras de Originality, el 0,5 % alcanza las 150 de ZeroGPT y ninguno alcanza la muestra de 350 palabras que sugiere Copyleaks. El párrafo mediano tiene 51 palabras y 312 caracteres: supera uno de los siete mínimos de la tabla, los 300 caracteres de Winston, y se queda por debajo de los otros seis.

Conviene separar dos cosas que se suelen mezclar. Un mínimo es el punto por debajo del cual el proveedor deja de respaldar su propia cifra – no, en todos los casos, el punto por debajo del cual no vuelve nada. Algunas de estas herramientas devuelven igualmente un porcentaje: Originality.ai dice que los análisis en su API «have no word count minimum» (no tienen un mínimo de palabras) y justo después te dice que la precisión baja por debajo de 100 palabras. Otras sencillamente se niegan, y Turnitin es una de ellas. Así que un número en pantalla no es, por sí solo, prueba de que la herramienta considerara la muestra lo bastante grande.

Por qué el párrafo que acabas de reescribir es el caso más difícil

Arreglas el pasaje marcado, lo pegas en un comprobador, lees el número y decides si has terminado. El centro de ayuda de Originality.ai coloca este movimiento exacto cerca de lo alto de su lista de causas de falsos positivos:

You are more likely to receive false positives by only scanning part of the entire piece of content: a single paragraph, the intro, the conclusion, half of the paper... etc. (Es más probable que recibas falsos positivos si analizas solo una parte del texto completo: un solo párrafo, la introducción, la conclusión, la mitad del trabajo... etc.)

La frase siguiente dice qué hacer en su lugar: «We can fix a lot of false positives by scanning the entire piece of content instead of a snippet. This just gives our tool more context and more content to go off of.» (Podemos corregir muchos falsos positivos analizando el texto completo en lugar de un fragmento. Eso le da a nuestra herramienta más contexto y más contenido del que partir.)

En la misma página aparecen dos experimentos que el proveedor hizo sobre sí mismo, algo más raro y más útil que el consejo:

  • Una introducción de blog de 50 palabras, escrita a mano por la persona que redactó el artículo de ayuda, volvió con un 79 % de IA.
  • Una conclusión de 107 palabras, también escrita a mano, volvió con un 69 % de IA. La explicación de la página es que una conclusión es muy formulaica además de breve: «You summarize everything before, give the reader more options and places to click, and finish up with any final calls to action.» (Resumes todo lo anterior, das al lector más opciones y más sitios donde hacer clic y terminas con las llamadas a la acción finales.)

Las dos cifras salieron de texto escrito por personas. Ninguna de las dos es una prueba sobre tu forma de escribir. Son una prueba de lo que un extracto corto y estructuralmente predecible le hace a una puntuación, y la introducción y la conclusión de un ensayo son, por diseño, las dos cosas a la vez: cortas y estructuralmente predecibles.

Los extractos cortos también cambian lo que vale el formato de tu texto. La página de limitaciones de Copyleaks dice que su detector lee miles de patrones, «not just words or formatting» (no solo palabras o formato), y después añade la parte que importa en una muestra corta: «Numbering, bullets, and outline-style headers are only one small part of the overall signal, but in very short texts they can have a larger relative impact to overall AI detection scores.» (La numeración, las viñetas y los encabezados estilo esquema son solo una pequeña parte de la señal global, pero en textos muy cortos pueden tener un impacto relativo mayor sobre las puntuaciones de detección de IA.) Un párrafo de metodología con tres pasos numerados tiene exactamente esa forma.

Hay una segunda razón por la que el párrafo reescrito es la peor muestra posible, y no tiene nada que ver con la longitud: es la parte de tu documento que acaba de editarse con más intensidad. La página de Originality es directa sobre lo que el uso de herramientas hace con su puntuación: «if a tool interacted with your content in any way, it will raise the AI score» (si una herramienta interactuó de cualquier forma con tu contenido, elevará la puntuación de IA), y menciona los correctores gramaticales junto a los chatbots. Sea lo que sea lo que pienses de eso como política, significa que el párrafo en el que has estado trabajando es el que más señales de edición lleva encima, y le estás pidiendo a la herramienta que lo juzgue en solitario.

Un número por frase pesa menos que el número del documento

La mayoría de los detectores colorean hoy frases individuales, lo que invita a leer el informe frase por frase. Dos proveedores dicen directamente que esas lecturas más pequeñas pesan menos que la global.

La documentación de la API de Winston AI, al describir el conjunto de puntuaciones por frase que devuelve, añade: «Please note that assessments on smaller samples are less accurate than the general score.» (Ten en cuenta que las valoraciones sobre muestras más pequeñas son menos precisas que la puntuación general.)

La guía de GPTZero sobre su resaltado de frases va más lejos, y responde a una pregunta que nos hacen constantemente: por qué editar las frases resaltadas no movió la puntuación:

Some sentences in an otherwise AI or human document might not show up as highlighted. They may still have an effect on your score, but they aren't more likely than other parts of your document. (Algunas frases de un documento que por lo demás es de IA o humano pueden no aparecer resaltadas. Pueden seguir influyendo en tu puntuación, pero no más que otras partes de tu documento.)

Y luego, con la razón incluida: «You may find that adjusting an entire document changes your score more than just adjusting the sentences. This is because our detector holistically analyzes the document, and its prediction can depend on a pattern that affects the bulk of the text.» (Puede que ajustar un documento completo cambie tu puntuación más que ajustar solo las frases. Esto se debe a que nuestro detector analiza el documento de forma holística y su predicción puede depender de un patrón que afecta a la mayor parte del texto.)

Eso es el proveedor diciendo que los resaltados no son un mapa completo de lo que produjo el número. Qué miden realmente los detectores de IA explica cómo se producen estas puntuaciones y por qué la explicación habitual está anticuada; la conclusión práctica aquí es más estrecha. Si tratas las frases resaltadas como la lista completa de lo que hay que atender, estás trabajando con un mapa parcial, según la descripción del propio proveedor.

El mismo texto, la misma herramienta, una respuesta distinta

La longitud no es lo único que mueve una lectura. Copyleaks permite a una institución elegir uno de tres niveles de sensibilidad y publica lo que cada uno hace con sus propias tasas de error:

AjusteCómo lo describe CopyleaksFalsos positivosFalsos negativos
Extra Safe«Designed to minimize false positives by using additional AI detection based filters.» (Diseñado para minimizar los falsos positivos mediante filtros adicionales basados en la detección de IA.)0,010 %0,5765 %
Balanced (predeterminado)«Ideal for detecting AI content while minimizing false positives.» (Ideal para detectar contenido de IA minimizando los falsos positivos.)0,0295 %0,174 %
Extra Sensitive«Our most sensitive model, designed to flag AI text that was put through a 'humanizer' or text spinner.» (Nuestro modelo más sensible, diseñado para marcar texto de IA pasado por un 'humanizer' o un reformulador de texto.)0,1973 %0,063 %

Lee la primera y la última fila juntas. Pasar del ajuste más conservador al más sensible multiplica por unas veinte la tasa de falsos positivos publicada, y es un interruptor en la pantalla de otra persona. No puedes ver en qué posición está, y nada del informe que te entreguen te lo dirá.

Así que cuando tu propia comprobación y la de tu universidad no coinciden, hay al menos tres explicaciones corrientes antes de que nadie llegue a «una de las dos está rota»: una herramienta distinta, un ajuste distinto en la misma herramienta y una cantidad distinta de texto. Por qué dos detectores de IA dan puntuaciones distintas repasa el resto.

La lectura que cuenta se hace sobre el archivo completo

Sea lo que sea lo que ejecutes en casa, el número con consecuencias lo produce la herramienta de tu institución, sobre el archivo que entregas y con sus ajustes. Turnitin no produce ninguna puntuación de IA para una entrega de menos de 300 palabras de prosa, y en documentos justo por encima de esa línea describe su propia predicción como cercana al todo o nada – lo que eso hace en los trabajos cortos es tema aparte.

Las entregas Clarity más recientes de Turnitin publican un rango de trabajo en el mismo sentido: «For Turnitin Clarity to work optimally, we recommend a minimum word count of 300 words and a maximum of approximately 2,500 words» (para que Turnitin Clarity funcione de forma óptima, recomendamos un mínimo de 300 palabras y un máximo de aproximadamente 2.500 palabras) y, cuando la detección de escritura por IA está activada, «submissions must be between 300 and 30,000 words.» (las entregas deben tener entre 300 y 30.000 palabras).

Que puedas hacer tu propia comprobación depende de lo que tu institución tenga activado y de qué pantallas puedas alcanzar, que es una pregunta distinta con su propia respuesta: cómo revisar tu trabajo antes de entregarlo.

Qué hacer en su lugar

  1. Analiza el documento completo, no el pasaje. Es el único cambio que coincide con el consejo de todos los proveedores: sin herramienta nueva, sin cuenta nueva, sin ajuste nuevo, solo la misma comprobación sobre más texto. En las herramientas que cobran por longitud sí cuesta más – la documentación de la API de Winston dice «Each word that is processed by the API consumes one credit» (cada palabra que procesa la API consume un crédito) –, y aun así es la lectura que sus propias páginas te dicen que tomes.
  2. Compara lo comparable. Una comparación de antes y después solo significa algo si la herramienta, los ajustes y la cantidad de texto son los mismos en ambos lados. Cambiar el tamaño de la muestra entre las dos lecturas cambia la lectura por sí solo.
  3. Cuenta con que el número se mueva sin que toques el texto. Los modelos se versionan. La documentación de la API de Winston lista veintidós versiones seleccionables, de la 2.0 a la 4.18, y por defecto usa la más reciente. Una puntuación de hace tres semanas y una de hoy pueden no venir del mismo modelo.
  4. No trates un número de tu propia comprobación como un veredicto, en ninguna dirección. Una lectura baja en casa no es una autorización, porque la herramienta de tu universidad es otra herramienta. Una lectura alta en un extracto de 60 palabras tampoco es un hallazgo: 60 palabras superan uno de los siete mínimos de arriba y ninguno de los demás.
  5. Guarda el informe que te dieron de verdad. Si ya ha habido una marca, el documento que importa es el que produjo tu institución, no una lectura que generaste después. Volver a comprobar después de reescribir cubre lo que esa comparación puede y no puede mostrar.

Preguntas frecuentes

¿Hay un número de palabras a partir del cual los detectores se vuelven fiables? Ninguno de estos proveedores afirma un punto en el que su resultado se vuelva seguro. Lo que publican es un mínimo por debajo del cual dicen que no es fiable, y una dirección: cuanto más largo, más estable. Copyleaks lo formula así: «the accuracy of our detection increases as the text length increases» (la precisión de nuestra detección aumenta a medida que aumenta la longitud del texto); la formulación de ZeroGPT es que un texto más largo «improves stability» (mejora la estabilidad).

Mi párrafo de 150 palabras volvió con un 80 %. ¿Significa eso que es un 80 % IA? No, y conviene aclarar la confusión porque está incorporada al modo en que se nombran estas puntuaciones. El centro de ayuda de Originality.ai lo dice sin rodeos: «an AI score of 90% doesn't mean that AI produced 90% of the content. It means that our tool is 90% confident that AI was used in some part to produce the content» (una puntuación de IA del 90 % no significa que la IA produjera el 90 % del contenido. Significa que nuestra herramienta tiene un 90 % de confianza en que se usó IA en alguna parte para producir el contenido). Una cifra de confianza y una cifra de proporción del documento se ven idénticas en pantalla y significan cosas distintas. El porcentaje de Turnitin es además una tercera variante: una proporción del texto calificable.

¿Puedo simplemente unir unos párrafos para superar el mínimo? ZeroGPT sugiere exactamente eso: «consider merging sections before checking.» (considera fusionar secciones antes de comprobar.) Eso te saca por encima de un umbral de longitud, pero la lectura describe entonces el bloque fusionado, no el párrafo que te preocupaba. Si tu pregunta va sobre un pasaje, ninguna disposición del texto la responde limpiamente, que es la respuesta honesta más que la satisfactoria.

¿Estos mínimos también se aplican al informe de Turnitin de mi universidad? Los mínimos de arriba pertenecen al detector propio de cada proveedor. Turnitin tiene los suyos: ninguna puntuación por debajo de 300 palabras de prosa, y solo las frases de prosa cuentan para el porcentaje. Las listas, las tablas y las viñetas quedan fuera de lo que mide, y por eso los resaltados y el número pueden parecer desacompasados.

Fuentes

Seguir leyendo