Mixed y AI-Polished en GPTZero: qué significan las dos etiquetas
GPTZero te muestra tres porcentajes y esconde un clic más abajo cinco clasificaciones con nombre. AI Polished es una de las dos que cuelgan de Mixed. GPTZero la define en un panel de la pantalla de resultados y la explica en un artículo de junio de 2025 que vive en su sitio de noticias, no en su centro de ayuda. Aquí tienes el conjunto completo, con las palabras de GPTZero, y qué cuenta en realidad el número que va junto a cada una.
Equipo de HumanPen
· 14 min de lectura
La respuesta corta
GPTZero imprime tres porcentajes, encabezados por «Chance this entire text is...» (la probabilidad de que todo este texto sea…): AI, Mixed y Human. Ese número es la confianza del modelo en que la clase es la correcta, no la parte de tu ensayo que cae dentro de ella. GPTZero lo dice en la propia pantalla de resultados, en una línea bajo los chips. Haz clic en cualquier chip y se abre en sublecturas con nombre, cinco en total entre los tres, y «AI polished» es una de las dos que hay bajo Mixed. GPTZero la define como «Human-written text that was refined or edited by an AI tool» (texto escrito por una persona y refinado o editado con una herramienta de IA), y añade que con esta etiqueta «the core ideas and structure are the student's own work, but AI was used as an editing assistant» (las ideas centrales y la estructura son trabajo propio del estudiante, pero la IA se usó como asistente de edición). Así que «100% mixed» es el modelo diciendo que está muy seguro de que el documento pertenece a la clase mixed. A cuál de las dos lecturas bajo Mixed se apoyó es un número distinto, a un clic de distancia.
Qué cuenta el número que va junto a la etiqueta
Empieza por la pantalla que tienes delante, porque GPTZero responde a esto en ella misma. Despliega el chip Mixed y esta línea aparece justo debajo de las lecturas:
This result isn't the percentage of mixed text, it's the model's confidence in the classification of the entire text as mixed. (Este resultado no es el porcentaje de texto mixto: es la confianza del modelo en la clasificación de todo el texto como mixed.)
La misma frase espera bajo los otros dos chips, con el nombre de la clase cambiado: «isn't the percentage of AI text» (no es el porcentaje de texto de IA) bajo AI, «isn't the percentage of human text» (no es el porcentaje de texto humano) bajo Human.
Por qué importa la distinción lo explica Alex Adam, responsable del equipo de machine learning de GPTZero, en un artículo fechado el 12 de enero de 2024:
categorizing predictions this way enables the confidence of the detector to be disentangled from the percentage of sentences that are AI-generated. Without this distinction, an AI probability of 50% could mean that the detector is 50% confident in its prediction (essentially a coin flip), or that 50% of the text is AI-generated. (Clasificar las predicciones de esta manera permite separar la confianza del detector del porcentaje de frases generadas por IA. Sin esta distinción, una probabilidad de IA del 50% podría significar que el detector confía al 50% en su predicción (básicamente, lanzar una moneda) o que el 50% del texto está generado por IA.)
Dos lecturas del mismo «50%», y para ti significan cosas opuestas. La salida de tres clases existe para mantenerlas separadas.
La documentación coincide desde otras tres direcciones. Una entrada del 9 de enero de 2024 en las notas de versión de GPTZero dice que las predicciones se «tuned to better represent the probability that the model is correct» (ajustaron para representar mejor la probabilidad de que el modelo acierte), y ofrece el ejemplo desarrollado de que una puntuación de IA del 90% significa «there is a 90% chance that the text is entirely written by an AI» (hay un 90% de probabilidades de que el texto esté escrito enteramente por una IA). La página de ayuda de la API describe la probabilidad de una clase como «the chance that the detector is correct in its classification» (la probabilidad de que el detector acierte en su clasificación) y añade que 90% significa acertar «90% of the time on similar documents» (el 90% de las veces en documentos similares). Fíjate en documentos similares, en plural, no en el tuyo. Y la página de tecnología lo incluye entre las aportaciones de investigación de GPTZero con la redacción más seca posible: el detector se plantea como «a trinary classification problem, separating prediction confidence from the proportion of LLM text.» (un problema de clasificación ternaria que separa la confianza de la predicción de la proporción de texto de LLM).
Hay una página de GPTZero que lo formula justo al revés. El bloque de FAQ de la página de inicio dice que GPTZero «will suggest what percentage of your text is likely to be AI-generated» (sugerirá qué porcentaje de tu texto probablemente esté generado por IA). Eso aparece dentro de una respuesta de tres pasos sobre cómo hacerlo, no describe un campo de resultado con nombre, así que bien puede ser texto de marketing poco riguroso y no una contradicción. En cualquier caso la regla práctica es la misma: «GPTZero dijo 30%» no identifica de qué magnitud está hablando nadie, así que di de qué pantalla y de qué campo salió. Por qué el mismo texto puntúa distinto en cada detector lo pone al lado de las unidades de Turnitin, Originality.ai y Winston AI, que es donde vive la versión de este problema entre proveedores.
Tres chips arriba, cinco clases con nombre debajo
Esta es la parte en la que la gente tropieza, y es la razón por la que una frase como «written by a human and polished with AI» (escrito por una persona y pulido con IA) parece salir de la nada. La fila de arriba son tres chips. Cada uno se abre.
| Chip | Se abre en | La línea de GPTZero debajo |
|---|---|---|
| AI | «chance AI Generated», «chance AI Paraphrased» | «isn't the percentage of AI text» (no es el porcentaje de texto de IA) |
| Mixed | «chance AI-Human Mix», «chance AI polished» | «isn't the percentage of mixed text» (no es el porcentaje de texto mixto) |
| Human | «Human written» | «isn't the percentage of human text» (no es el porcentaje de texto humano) |
Cinco lecturas con nombre en total. «AI polished» no es un cuarto cubo junto a Mixed. Es una de las dos cosas que Mixed puede significar. Ese solo dato responde a la mayor parte de la confusión, porque un resultado mixed se lee muy distinto una vez sabes que la otra lectura que hay debajo se llama AI-Human Mix.
Haz clic en el pequeño icono de información junto a cualquiera de esas lecturas y se abre un panel encabezado por «Understanding AI Classifications» (cómo entender las clasificaciones de IA), con una pestaña para cada una de las cinco. Las definiciones de GPTZero, literalmente:
AI Generated — Text written directly by an AI language model with no meaningful human editing. AI Paraphrased — AI-generated text that was rewritten — either by a tool or by hand — to disguise its origin. AI-Human Mix — Human-written text combined with AI-generated text in the same document. AI Polished — Human-written text that was refined or edited by an AI tool. Human — Text written entirely by a human with no AI involvement. (AI Generated: texto escrito directamente por un modelo de lenguaje de IA sin edición humana significativa. AI Paraphrased: texto generado por IA que se reescribió —con una herramienta o a mano— para disimular su origen. AI-Human Mix: texto escrito por una persona combinado con texto generado por IA en el mismo documento. AI Polished: texto escrito por una persona y refinado o editado con una herramienta de IA. Human: texto escrito enteramente por una persona sin intervención de IA.)
La pestaña AI Polished lleva un segundo párrafo, y es el que conviene tener delante:
The text was originally written by a human, then run through an AI tool to improve grammar, rephrase sentences, or enhance clarity. The core ideas and structure are the student's own work, but AI was used as an editing assistant. (El texto fue escrito originalmente por una persona y después pasado por una herramienta de IA para mejorar la gramática, reformular frases o ganar claridad. Las ideas centrales y la estructura son trabajo propio del estudiante, pero la IA se usó como asistente de edición.)
Fíjate desde dónde arranca cada definición. Polished arranca de la escritura humana. Paraphrased arranca de la salida de la IA. No son dos grados de lo mismo: son dos historias de origen opuestas, y cuelgan de chips distintos.
Dos detalles menores. Primero, GPTZero escribe esta etiqueta de tres formas en tres sitios: «AI polished» en el chip, «AI Polished» en el panel y «Polished by AI» en los botones de ejemplo de su página de inicio. Segundo, el escaneo gratuito tiene un mínimo: con 0 caracteres el cuadro dice «Enter at least 250 characters to scan» (introduce al menos 250 caracteres para escanear), y cambia a «Great! You've entered enough text to scan» (¡genial!, ya has introducido suficiente texto para escanear) cuando lo superas.
De dónde sale «AI Polished» y dónde lo explica GPTZero
La clase es más joven que las otras cuatro. Llega en una nota de versión fechada el 3 de junio de 2025, archivada bajo «Added» (añadido), como una sola línea:
Ability to detect "polished" texts that are lightly edited by AI (capacidad para detectar textos «polished» editados ligeramente por IA)
Nueve meses después, una línea más, 11 de marzo de 2026: «Improved performance on the AI polished class.» (mejor rendimiento en la clase AI polished.) Esas dos entradas son todo lo que aparece en las notas de versión.
La explicación más larga llegó dos días después de aquella primera entrada, en el artículo de GPTZero que presenta la clase AI Polished, de Emily Napier, fechado el 5 de junio de 2025. Dice con todas las letras dónde se sitúa la etiqueta:
To improve transparency, we've decided to distinguish between documents that combine "chunks" of AI and human text and documents rewritten or polished by AI. We now identify these documents under the "Mixed" class with an accompanying tag of "AI Polished". (Para mejorar la transparencia, hemos decidido distinguir entre los documentos que combinan «chunks» de texto de IA y humano y los documentos reescritos o pulidos por IA. Ahora identificamos estos documentos dentro de la clase «Mixed», con una etiqueta adjunta de «AI Polished».)
Eso es la tabla de arriba, con las palabras de GPTZero y una fecha encima: dos clases de documento mixto, y una de ellas recibe la etiqueta AI Polished.
Si vas a buscar el artículo, busca dos redacciones. Su titular y su cuerpo usan «AI Polished», la redacción del panel. Dos de los pies de figura usan en cambio «Lightly edited by AI», que no es ninguna de las tres de arriba sino la redacción de la nota de versión, y la dirección de la página está construida a partir de ella.
El artículo no forma parte del centro de ayuda de GPTZero, y ninguno de los artículos de ayuda menciona la etiqueta. Revisamos el centro de soporte de forma exhaustiva el 15 de septiembre de 2026. Su página de inicio lista cinco colecciones de nivel superior, cada una con su propio recuento de artículos: General 36, API 17, Origin Extension 8, Account Management 11, Microsoft Word Add-In 5. En total, 77. Entrar en cada una da ocho subcolecciones más tres artículos colgados directamente de la página de una colección, y enumerarlos da exactamente 77 artículos distintos. Recogimos los 77 y buscamos en el `innerText` de cada página, el texto que renderiza el navegador (los espacios de no separación convertidos en espacios normales, con la navegación y la barra lateral del sitio incluidas): 88.894 caracteres en total aquel día. La barra lateral cambia entre cargas de página, así que una repetición no dará exactamente esa cifra:
- `polish`, `polished`, `AI polished`, `AI-polished`, `AI Polished`, `Polished` — 0 cada uno
- `Polish` — 1, y es el idioma, en la lista de idiomas admitidos
- `confidence in the classification`, la frase que usa la pantalla de resultados — 0
El contador funcionaba: sobre el mismo corpus aquel día, `burstiness` devolvió 28, `paraphras` 18, `sentence` 19, `mixed` 11. Pasar página a página por el índice principal de noticias tampoco te lleva hasta él. El 15 de septiembre de 2026 ese índice tenía 30 páginas de profundidad y terminaba en 147 direcciones de artículo distintas, y el artículo de junio de 2025 no estaba entre ellas. Sí aparecía en el sitemap de noticias, que entonces tenía 320 entradas. GPTZero publica a menudo, así que ambas cifras habrán cambiado cuando lo compruebes.
Nada de esto vuelve poco fiable la etiqueta, y el recuento no es un argumento de que lo sea. Solo explica por qué repasar los artículos de ayuda de GPTZero te deja sin nada sobre AI Polished. Si alguien pregunta qué significa tu etiqueta, ese artículo es lo que hay que mandarle. Haz también una captura del panel de definición, no solo de la puntuación. Es una definición corta, a un clic de la lectura que recibió tu documento, y es la diferencia entre quien cree que «polished» es un eufemismo y quien ha leído a GPTZero decir que las ideas centrales son del propio autor.
De qué nivel habla realmente la etiqueta
Los chips describen el documento. El encabezado que hay sobre ellos dice literalmente «Chance this entire text is...» (la probabilidad de que todo este texto sea…). Los resaltados de frases son una segunda salida con otra función, y las FAQ son explícitas sobre en qué sentido va el razonamiento:
The sentence-level classification should not be solely used to indicate that an essay contains AI (such as ChatGPT plagiarism). Rather, when a document gets a MIXED or AI_ONLY classification, the highlighted sentence will indicate where in the document we believe this occurred. (La clasificación a nivel de frase no debería usarse por sí sola para indicar que un ensayo contiene IA (como plagio con ChatGPT). Más bien, cuando un documento recibe una clasificación MIXED o AI_ONLY, la frase resaltada indicará en qué parte del documento creemos que ocurrió esto.)
Primero el documento, después los resaltados. Explican el veredicto en lugar de sumarse para formarlo. En pantalla esto aparece como una lista encabezada por «Your most AI sentences» (tus frases más de IA), en la que cada entrada lleva una marca de impacto y no un porcentaje propio.
GPTZero también publica una ordenación de cuánto hay que fiarse de cada nivel, y va en contra de la forma en que la mayoría lee un informe:
The accuracy of our model increases as more text is submitted to the model. As such, the accuracy of the model on the document-level classification will be greater than the accuracy on the paragraph-level, which is greater than the accuracy on the sentence level. (La precisión de nuestro modelo aumenta cuanto más texto se le envía. Por tanto, la precisión del modelo en la clasificación a nivel de documento será mayor que en la de párrafo, que a su vez será mayor que en la de frase.)
La frase resaltada en concreto es lo que acabas mirando fijamente. Y es también la capa que GPTZero considera menos precisa.
Dos comportamientos más despistan a la gente. Las frases resaltadas, dice el artículo de ayuda de Advanced Scan, son las que están «disproportionately affecting your overall AI or human score» (afectando de forma desproporcionada a tu puntuación global de IA o humana), lo cual es impacto y no proporción, y GPTZero añade que las frases sin resaltar «may still have an effect on your score, but they aren't more likely than other parts of your document» (pueden seguir afectando a tu puntuación, pero no son más probables que otras partes de tu documento). Por otro lado, un resultado intermedio sin ningún resaltado tiene su propio artículo de ayuda: «there isn't one specific section of the document that is especially likely to have AI content. Rather, the entire document has signs of being AI generated, but with lower certainty.» (no hay una sección concreta del documento que sea especialmente probable que contenga IA. Más bien, todo el documento tiene indicios de estar generado por IA, pero con menor certeza.)
Por qué se movió el número si apenas tocaste nada
Dos notas de versión hablan de esto, y ambas son más estrechas de lo que la gente supone.
6 de febrero de 2024:
Processing of long documents has been made more consistent. There should be less variation in predictions when cutting out a few sentences from long AI-generated documents (el procesamiento de documentos largos se ha vuelto más consistente. Debería haber menos variación en las predicciones al quitar algunas frases de documentos largos generados por IA)
2 de mayo de 2025:
Increased output stability when rescanning multiple times (mayor estabilidad de la salida al volver a escanear varias veces)
Mira el alcance de cada una. La primera trata de quitar frases de documentos largos generados por IA. La segunda trata de pasar el mismo texto dos veces. Ninguna es una afirmación sobre editar una frase de tu propio borrador y volver a escanear, y no encontramos ninguna: en los 77 artículos de soporte de arriba, `stabilit`, `rescan` y `re-scan` devuelven 0. Ese es el hueco de este artículo, y tiene una consecuencia práctica: un número de GPTZero solo significa algo junto a otro número de GPTZero si sabes cuándo se tomó cada uno, así que anota la fecha con la puntuación.
La razón por la que importan las fechas está en la página de notas de versión. Contando las fechas de entrada al principio de una línea en el `innerText` de la página, lleva 55 entradas fechadas desde mayo de 2023, 10 de ellas en 2026 hasta el 15 de septiembre, la más reciente del 12 de agosto de 2026 (Model 4.9b). Dos de este año: «More granular mixed text predictions and identification of interleaving mixed texts» (predicciones de texto mixto más granulares e identificación de textos mixtos entrelazados) en mayo, y «Robustness to headers; headers are now excluded from our model's input» (robustez ante encabezados; los encabezados ya no se incluyen en la entrada de nuestro modelo) en agosto. La pantalla de resultados imprime la versión del modelo junto al veredicto, que es lo más barato de anotar que hay en ella. Un escaneo de julio y un escaneo de la semana pasada no los hizo el mismo modelo.
La banda de confianza es la otra mitad de la lectura, y es la parte que se cae cuando alguien te lanza una puntuación. El artículo de ayuda de Advanced Scan asocia las bandas con tasas de error: «Highly confident: our error rate is less than 2%» (muy seguros: nuestra tasa de error es inferior al 2%), «Moderately confident: our error rate would be around 10%» (moderadamente seguros: nuestra tasa de error estaría en torno al 10%), «Low confidence: our error rate would be 14% or higher» (poca confianza: nuestra tasa de error sería del 14% o más). La página de tecnología sitúa la banda superior en un error medio de «less than 1%» (menos del 1%), sobre un conjunto de evaluación interno. Ambas cifras son de GPTZero, sobre datos de GPTZero, no coinciden, y el artículo de ayuda que lleva el 2% está marcado como actualizado por última vez hace un año. El responsable de machine learning de GPTZero también es franco sobre el límite del número subyacente: el paso de calibración hace que el detector «not overconfident in its predictions» (no tenga exceso de confianza en sus predicciones) la mayor parte del tiempo, pero «achieving perfect calibration is nearly impossible» (lograr una calibración perfecta es casi imposible). Una clase citada sin su banda de confianza es medio resultado.
Qué hacer con una etiqueta
Si lo que hiciste estaba permitido es una pregunta para tu institución, no para un clasificador, y GPTZero lo dice con más claridad que muchos de los que lo citan: «these results should not be used to punish students» (estos resultados no deberían usarse para castigar a estudiantes) y «we don't recommend using an AI detection result as the only proof for academic punishment or discipline» (no recomendamos usar un resultado de detección de IA como única prueba para un castigo académico o una sanción). Su responsable de machine learning va más lejos, y esta conviene conocerla si alguien te está agitando un único escaneo delante:
we do not encourage punitive actions based solely on the results of a single scan. Instead, a history of scan results should ideally be established, serving as stronger evidence of AI usage. (No fomentamos acciones punitivas basadas únicamente en los resultados de un solo escaneo. En su lugar, lo ideal sería establecer un historial de resultados de escaneo, que sirva como prueba más sólida del uso de IA.)
Cinco cosas que están en tus manos:
- Abre el chip antes de que te entre el pánico. Un «Mixed» a secas es lo menos informativo que hay en la pantalla. Las dos lecturas que hay debajo son AI-Human Mix y AI polished, y describen situaciones distintas.
- Guarda en una sola captura la clase, la sublectura, la banda de confianza, la versión del modelo y la fecha. Las cinco están en el mismo panel. Copiar el número a mano tira a la basura todo lo que lo hace interpretable.
- Haz también una captura del panel de definición y guarda el enlace al artículo de GPTZero de junio de 2025. El panel está detrás del icono de información, y una captura conserva la definición tal como la mostró tu pantalla. El artículo es donde GPTZero explica por escrito que AI Polished es una etiqueta bajo Mixed.
- Averigua qué usa realmente tu institución antes de discutir con un número que viene de otro sitio. Una autocomprobación con una herramienta gratuita no es el informe que va a mirar tu departamento, y los nombres de clase, las redacciones y los umbrales no se comparten entre proveedores. Que dos herramientas discrepen sobre tu archivo es el resultado esperado, no un fallo.
- Conserva tus borradores y tu historial de revisiones. El consejo que GPTZero da a los docentes es pedir «drafts, revision histories, or brainstorming notes» (borradores, historiales de revisión o notas de lluvia de ideas), y señala en concreto el historial de versiones del editor como lo que suele zanjar la cuestión. Esa evidencia tiene que existir ya cuando la necesites, lo cual la convierte en una tarea de hoy y no de después del correo.
La salida es una lectura del texto que tiene delante, no un registro de cómo llegó a existir ese texto. En el chip que hayas caído, el argumento que sí puedes ganar es el de tu proceso, y la evidencia de eso está en tus borradores.
Para seguir leyendo
- GPTZero frente a Turnitin: por qué las puntuaciones no coinciden y qué mide realmente cada herramienta — para cuando las dos herramientas devuelven dos números distintos sobre el mismo archivo.
- Turnitin eliminó el resaltado morado de «AI-paraphrased» — el conjunto de etiquetas de Turnitin cambió en agosto de 2026, y una captura antigua no está desactualizada en el sentido que la gente supone.
- Por qué el mismo texto se puntúa de forma distinta en cada detector
- Qué miden los detectores de IA más allá de la perplejidad y la ráfaga — GPTZero dice que dejó de usar ambas en otoño de 2023, cuando pasó a una arquitectura de aprendizaje profundo.
- Marcado, pero lo escribiste tú: cómo preparar una respuesta
- Personal Statement marcado como IA: la consigna fijó la forma primero
Todo lo citado arriba se leyó de las propias páginas de GPTZero y de un escaneo gratuito hecho sin iniciar sesión, los días 15 y 17 de septiembre de 2026, y cada cita indica dónde se sitúa. Cuando dos de esas páginas dan cifras distintas para lo mismo, aquí están las dos.
Seguir leyendo
GPTZero frente a Turnitin: por qué las puntuaciones no coinciden y qué mide realmente cada herramienta
5 min de lectura
Detectores de IAPor qué el mismo texto obtiene una puntuación distinta en cada detector
5 min de lectura
Informes de detecciónTurnitin eliminó el resaltado morado del texto parafraseado por IA
11 min de lectura