Pangram frente a Turnitin: por qué los dos valores de IA no cuadran

Una revista, un centro educativo o una plataforma de publicación pasó tu texto por Pangram, y además tienes un valor de Turnitin. No coinciden. La razón es más concreta que la idea de que «los modelos son distintos»: los dos proveedores ni siquiera informan del mismo tipo de métrica y, debajo de eso, cuentan unidades distintas sobre corpus distintos. Aquí tienes lo que publica cada uno y qué puedes hacer con dos cifras que no se van a reconciliar.

Equipo de HumanPen

· 19 min de lectura

La respuesta breve

Un resultado de Pangram y un resultado de Turnitin no son dos lecturas de la misma magnitud: una diferencia entre ellos es esperable y no demuestra que uno de los dos esté averiado. El whitepaper de Turnitin de agosto de 2024 afirma que la empresa no utiliza «accuracy» (exactitud) como métrica. La portada de Pangram, consultada el 15 de septiembre de 2026, lleva la insignia «99.9%+ Accuracy» (más del 99,9 % de exactitud). Bajo el titular vuelven a divergir: las FAQ de Turnitin describen frases puntuadas dentro de segmentos solapados y un porcentaje calculado sobre el texto calificable, mientras que la model card de Pangram describe una predicción a nivel de token con tres etiquetas y fracciones del documento ponderadas por caracteres. La cifra que tiene consecuencias es la que produce la herramienta con la que tu institución toma su decisión.

Los dos proveedores no coinciden en qué métrica publicar

El whitepaper de Turnitin, Turnitin's AI Writing Detection Model Architecture and Testing Protocol, fechado en agosto de 2024, dice lo siguiente:

«Turnitin does not use 'accuracy' as a metric as it is too easily manipulated and too dependent on the specific dataset upon which it is computed.» (Turnitin no utiliza «accuracy» como métrica, porque se manipula con demasiada facilidad y depende demasiado del conjunto de datos concreto sobre el que se calcula.)

La frase siguiente da la razón, y puedes comprobar tú mismo la aritmética:

«For example, consider a dataset with 100 pieces of writing, 99 of which are human written. A simple, naive algorithm that identifies all pieces of writing as 'human-written' would achieve 99% accuracy on this dataset, despite having no value as an AI writing detection system.» (Por ejemplo, piensa en un conjunto de datos con 100 textos, 99 de ellos escritos por personas. Un algoritmo simple e ingenuo que clasifique todos los textos como «escritos por humanos» alcanzaría un 99 % de exactitud en este conjunto, pese a no tener ningún valor como sistema de detección de escritura con IA.)

De este ejemplo merece la pena quedarse con algo. Un detector que nunca marca nada acierta en 99 de esos 100, así que la cifra se mueve con la composición del conjunto de prueba, no con la calidad del detector. El whitepaper dice que Turnitin «uses two main metrics to test AIW-2: recall and FPR» (utiliza dos métricas principales para probar AIW-2: recall y FPR), y define ambas en la misma sección con ejemplos resueltos.

Pangram publica una cifra de exactitud en un lugar destacado. La insignia de la portada dice «99.9%+ Accuracy» (más del 99,9 % de exactitud; consultada el 15 de septiembre de 2026). La página de educación superior muestra las dos a la vez: «99.98% accuracy» (99,98 % de exactitud) en la frase de apertura y, 52 caracteres después, en el mismo banner, una insignia «99.9%+ Accuracy» (más del 99,9 % de exactitud), con solo «Detects AI Assistance Free Credits» (detecta la asistencia de IA, créditos gratis) en medio. La model card de Pangram para Pangram 4, fechada el 29 de julio de 2026, no destaca la exactitud en absoluto: informa de tasas de falsos positivos y falsos negativos desglosadas por corpus, idioma y dominio.

Así que las dos cifras de cabecera no son un valor alto y un valor bajo de la misma propiedad. Un proveedor ha publicado una objeción por escrito a la métrica con la que el otro se promociona. No decimos que ninguna de las dos decisiones sea errónea, y tampoco es un secreto: las dos afirmaciones están hoy en páginas públicas.

Qué cuenta realmente cada puntuación

Ambos sistemas devuelven un porcentaje. Los porcentajes se construyen con materiales distintos.

Turnitin (FAQ y whitepaper de agosto de 2024)Pangram (model card de Pangram 4, 29 de julio de 2026)
Unidad clasificadaFrases, agrupadas en segmentos solapadosTokens, decodificados en segmentos de longitud variable
Tratamiento del solapamientoLas frases que están en varios segmentos reciben varias puntuaciones, «which are then pooled into a single score» (que después se agrupan en una sola puntuación)«predictions for tokens that appear in multiple windows are aligned and averaged» (las predicciones de los tokens que aparecen en varias ventanas se alinean y se promedian), dentro de una ventana de inferencia de 512 tokens
De qué es una parte el porcentaje del documentoSolo el texto calificable. «this percentage is not necessarily the percentage of the entire submission» (este porcentaje no es necesariamente el porcentaje de toda la entrega)El documento analizado. `fraction_human`, `fraction_ai_assisted` y `fraction_ai` son «character-weighted» (ponderadas por caracteres) y «sum to 1.0» (suman 1,0)
Número de clasesDos. El porcentaje cubre el texto «likely generated by AI or likely generated and modified by an AI paraphraser or bypasser» (probablemente generado por IA o probablemente generado y modificado por un parafraseador o evasor de IA)Tres: `Human` (humano), `AI-Assisted` (asistido por IA), `AI-Generated` (generado por IA)
Longitud mínima300 palabras de prosa50 palabras
Resultados bajosEntre el 1 % y el 19 % aparece un asterisco, sin porcentaje ni resaltados`prediction_short` returns `Human` when human characters account for at least 90%, `AI` when AI-generated characters account for at least 80%, `Mixed` otherwise (devuelve la forma abreviada «humano» cuando los caracteres humanos suponen al menos el 90 %, «IA» cuando los caracteres generados por IA suponen al menos el 80 %, y «mixto» en los demás casos)

La fila del denominador es la que duele. Las FAQ de Turnitin dicen que el porcentaje mostrado cubre «the amount of qualifying text within the submission» (la cantidad de texto calificable dentro de la entrega) y que «If text within the submission is not considered long-form prose text, it will not be included.» (Si un texto de la entrega no se considera prosa de formato largo, no se incluirá.) Las fracciones de Pangram cubren el texto analizado y suman 1,0. Si a ambos sistemas les das un trabajo con una bibliografía larga, un índice y un par de tablas, ya no están trabajando sobre el mismo cuerpo de palabras antes de que ninguno de los dos modelos arranque. Cómo leer un informe de escritura con IA de Turnitin repasa qué entra y qué queda fuera del denominador de Turnitin.

Por qué el 1 % y el 1 de cada 10.000 no están en la misma escala

Estas son las dos cifras que la gente pone una al lado de la otra, y dividir una entre la otra produce una razón que no significa nada. Ambas se llaman tasa de falsos positivos. Ninguna está medida como la otra.

Las FAQ de Turnitin fijan un objetivo:

«We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing.» (Nos esforzamos por maximizar la eficacia de nuestro detector manteniendo nuestra tasa de falsos positivos —identificar erróneamente como generado por IA un texto escrito íntegramente por una persona— por debajo del 1 % en documentos con más de un 20 % de escritura con IA.)

Esa condición final es la que sostiene la frase, y el whitepaper explica de dónde sale. Un documento se etiqueta como generado por IA cuando más del 20 % de sus puntuaciones a nivel de frase supera un umbral de frase, y el whitepaper dice que «the 20% document proportion cutoff as well as the predetermined model threshold were chosen to keep document-level FPR below 0.01 (1%)." (tanto el corte del 20 % de proporción del documento como el umbral del modelo predeterminado se eligieron para mantener la tasa de falsos positivos a nivel de documento por debajo de 0,01 (1 %))». El corte y la tasa son partes de un mismo mecanismo, no una afirmación independiente sobre él. Qué significa una tasa de falsos positivos del 1 % cuando una universidad entrega 75.000 trabajos hace la multiplicación.

Las FAQ de la portada de Pangram dan una tasa:

«Pangram's false positive rate (the rate at which human documents are incorrectly flagged as AI) is currently 1 in 10,000. This number is calculated on an aggregate of public datasets containing tens of millions of written documents.» (La tasa de falsos positivos de Pangram —la tasa a la que documentos humanos se marcan erróneamente como IA— es actualmente de 1 entre 10.000. Esta cifra se calcula sobre un agregado de conjuntos de datos públicos que contiene decenas de millones de documentos escritos.)

La model card da una cifra más estrecha y con un corpus concreto: «At the production operating point, Pangram 4 achieves a 0.0041% false positive rate (roughly 1 in 24,000) on 1,000,000 human-written English FineWeb evaluation examples.» (En el punto de operación de producción, Pangram 4 alcanza una tasa de falsos positivos del 0,0041 % —aproximadamente 1 entre 24.000— sobre 1.000.000 de ejemplos de evaluación ingleses de FineWeb escritos por personas.) Una segunda tabla de la ficha desglosa la tasa por dominio, y su fila de escritura académica marca un 0,019 % sobre 62.971 elementos, por encima de la cifra global inglesa que aparece arriba.

Reglas de etiquetado distintas, puntos de operación distintos y, del lado de Turnitin, una tasa que solo se aplica por encima de un corte del 20 %. Así que no te vamos a dar una comparación aritmética entre las dos cifras. Lo que sí puedes hacer es preguntar sobre qué se midió cada una, y ambos proveedores responden por escrito. Las FAQ de Turnitin dicen que valida su tasa contra «over 700,000 additional academic papers that were written before the release of ChatGPT» (más de 700.000 trabajos académicos adicionales escritos antes del lanzamiento de ChatGPT). La portada de Pangram atribuye su tasa a «an aggregate of public datasets» (un agregado de conjuntos de datos públicos) y su model card atribuye la más estrecha a ejemplos de FineWeb, con la escritura académica apareciendo aparte como una fila de dominio entre once. Son respuestas a preguntas distintas, y ahí está todo el problema.

Un porcentaje puede ser una parte o puede ser una confianza

Dos informes pueden mostrar «99%» y significar cosas distintas, y ambos proveedores lo dicen en su propia documentación.

La model card de Pangram trata las cifras del documento como partes: las tres fracciones son porciones del texto ponderadas por caracteres que suman 1,0. También dice explícitamente que sus otras cifras no son lo que parecen. ai_assistance_score es «a continuous AI-involvement score, not the probability of the displayed discrete label» (una puntuación continua de implicación de la IA, no la probabilidad de la etiqueta discreta mostrada), y el valor de confianza del segmento «measures the peakedness of the unconstrained CRF posterior, it is not a calibrated probability estimate.» (mide el grado de concentración de la posterior CRF sin restringir; no es una estimación de probabilidad calibrada). Dicho sin rodeos: un segmento marcado como High es aquel en el que las puntuaciones internas del modelo se agruparon con fuerza en torno a una sola etiqueta, y el proveedor te está diciendo que no lo conviertas en probabilidades.

La página de orientación de Pangram para profesorado lee un porcentaje justo al revés:

«If a segment of text gets a 99% AI score, that doesn't mean we necessarily think the entire text was AI-generated. Rather, we are 99% confident that AI was used to generate some portion of the text.» (Si un segmento de texto recibe una puntuación de IA del 99 %, eso no significa necesariamente que pensemos que todo el texto fue generado por IA. Más bien tenemos un 99 % de confianza en que se usó IA para generar alguna parte del texto.)

Las FAQ de Turnitin también advierten contra la lectura como parte: «Unlike our Similarity Report, the AI writing percentage does not necessarily correlate to the amount of text in the submission.» (A diferencia de nuestro Similarity Report, el porcentaje de escritura con IA no se correlaciona necesariamente con la cantidad de texto de la entrega.)

Antes de comparar dos porcentajes, averigua de qué es porcentaje cada uno. Si uno es una parte de los caracteres y el otro un nivel de confianza, nunca iban a coincidir, y ninguno de los dos te estaba mintiendo. Por qué el mismo texto puntúa distinto en cada detector recoge los demás motivos.

La misma etiqueta aparece sobre cifras con denominadores distintos

Una tasa de falsos positivos solo significa algo junto con el conjunto de documentos sobre el que se calculó. Ambos proveedores publican varias cifras bajo una sola etiqueta, y hay un par que conviene recorrer entero, porque la explicación obvia del desfase resulta ser la equivocada.

Primero Pangram, todo consultado el 15 de septiembre de 2026. Lee la columna derecha con el mismo cuidado que la izquierda: parte de la dispersión depende de en qué página hayas aterrizado y parte de contra qué se midió cada cifra.

CifraDónde aparece
«99.9%+ Accuracy» (más del 99,9 % de exactitud)Insignia de la portada y una insignia en el banner de la página de educación superior
«99.98% accuracy» (99,98 % de exactitud)Frase de apertura del mismo banner, 52 caracteres antes
«99.26% overall» (99,26 % en conjunto)Pangram vs. Turnitin, una entrada del 28 de julio de 2026
Ninguna cifra de exactitudModel card de Pangram 4, del 29 de julio de 2026, que en su lugar informa de FPR y FNR por corpus
«1 in 10,000» (1 de cada 10.000)FAQ de la portada, sobre «an aggregate of public datasets» (un agregado de conjuntos de datos públicos)
«roughly 1 in 24,000» (aproximadamente 1 de cada 24.000)Model card, sobre 1.000.000 de ejemplos ingleses de FineWeb
«approximately 1 in 25,000» (aproximadamente 1 de cada 25.000) para ensayos académicosLa entrada del 28 de julio de 2026
0,019 % para «Academic Writing (English)» (escritura académica, inglés)Model card, sobre 62.971 elementos, por encima de su propia cifra global

Turnitin produce la versión más suave de esto dentro de un mismo archivo: el whitepaper de agosto de 2024 da la tasa de falsos positivos a nivel de documento de AIW-2 como 0,5 % en su texto y como 0,51 % en la Tabla 1, sobre el mismo conjunto de 719.877 trabajos estudiantiles anteriores a 2019.

El par que importa más es el de las dos cifras que Turnitin publica con el mismo nombre: tasa de falsos positivos a nivel de frase. En junio de 2023, su Chief Product Officer escribió:

«Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written.» (Nuestra tasa de falsos positivos a nivel de frase ronda el 4 %. Esto significa que hay un 4 % de probabilidad de que una frase concreta marcada como escrita por IA haya sido escrita por una persona.)

El whitepaper de agosto de 2024 da un 0,33 %, a partir de una prueba de esfuerzo sobre trabajos entregados antes de 2019 de los que dice: «All papers in this dataset are human written.» (Todos los trabajos de este conjunto de datos están escritos por personas.)

La lectura tentadora es que entre medias cambió un modelo. Cambió, y no explica la diferencia. El whitepaper dice que AIW-1 se lanzó en abril de 2023 y que «In December 2023, Turnitin launched AIW-2, an updated and improved model to replace the AIW-1 model» (En diciembre de 2023, Turnitin lanzó AIW-2, un modelo actualizado y mejorado para sustituir el modelo AIW-1), así que el modelo que funcionaba en junio de 2023 era AIW-1. Busca entonces AIW-1 en la Tabla 2 del propio whitepaper: sobre ese mismo conjunto de 719.877 trabajos, su tasa de falsos positivos a nivel de frase es del 0,42 %, no del 4 %. Mismo modelo, misma etiqueta, dos cifras separadas por un orden de magnitud. La historia de la versión se viene abajo.

Lo que cambia es el conjunto sobre el que se calcula cada porcentaje. El 4 % es condicional a una frase que ya ha sido marcada: de las frases que el detector señaló, esa parte puede resultar humana. El 0,42 % y el 0,33 % recorren textos que son enteramente humanos desde el principio: de todas esas frases, esa parte acabó marcada. Responden a dos preguntas distintas, y no hay motivo para que queden cerca. Puedes leer la definición del 4 % en la explicación de Turnitin de junio de 2023.

Nada de esto es un proveedor pillado en falta, y nada de esto es una cifra que se haya quedado vieja. Es lo que pasa cuando una misma expresión se adjudica a varias mediciones distintas. Así que, cuando en una reunión te lancen una tasa, la pregunta que te lleva a alguna parte es sobre qué conjunto se calculó. ¿Todos los documentos entregados? ¿Solo las frases ya marcadas? ¿Solo el texto calificable? Un porcentaje sin conjunto asociado no se puede comprobar y tampoco se puede discutir.

Qué pruebas independientes hay y qué es lo que no resuelven

Un estudio revisado por pares y de acceso abierto ha probado las dos herramientas frente a frente. Who wrote this? Evaluating the reliability of AI detection tools in higher education, publicado en el International Journal for Educational Integrity el 29 de junio de 2026, construyó un conjunto sintético de 160 trabajos académicos en inglés, cuarenta en cada una de cuatro categorías, cada uno de al menos 4.000 palabras.

Sobre el conjunto escrito por personas, el resultado cubre las cuatro herramientas que probó: «all four tools classified 100% of human texts correctly as 'True Negatives' (receiving a score between 0 and 20%). This indicates that none of the detectors are prone to incorrectly flagging human writing as AI-generated for this collection of papers.» (las cuatro herramientas clasificaron correctamente el 100 % de los textos humanos como «verdaderos negativos» —recibiendo una puntuación entre el 0 % y el 20 %—. Esto indica que ninguno de los detectores tiende a marcar erróneamente como generada por IA la escritura humana en esta colección de trabajos). Sobre el conjunto totalmente generado por IA, las dos herramientas se separaron. El artículo informa de que «Turnitin classified 100% of the Fully AI generated papers as False Negatives (scores between 0 and 20%)» (Turnitin clasificó el 100 % de los trabajos totalmente generados por IA como falsos negativos —puntuaciones entre el 0 % y el 20 %—) y de que «Pangram was the only tool that performed well, with a strict accuracy of 65% and an inclusive accuracy of 97.5%, leaving only one case misclassified.» (Pangram fue la única herramienta que funcionó bien, con una exactitud estricta del 65 % y una exactitud inclusiva del 97,5 %, dejando un solo caso mal clasificado).

Antes de que nadie te lo cite en un sentido o en otro, los propios autores fijan sus límites: «the scope of our research was limited to 160 papers, four AI detection tools, and one GenAI model (GPT-4o Deep Research) for the fully AI-generated category» (el alcance de nuestra investigación se limitó a 160 trabajos, cuatro herramientas de detección de IA y un modelo de IA generativa —GPT-4o Deep Research— para la categoría totalmente generada por IA), y los resultados son «valid only for a specific snapshot in time» (válidos solo para una instantánea concreta en el tiempo). Su recomendación a las instituciones es la frase que merece llevarse a una reunión: las herramientas de detección «should not be used as sole evidence in high-stakes decision-making but should be implemented in a broader evaluation strategy.» (no deberían usarse como única prueba en decisiones de alto impacto, sino integrarse en una estrategia de evaluación más amplia).

Una nota de redacción, porque la versión editada viaja más lejos que la original. La frase final del artículo dice: «From the four AI detection tools studied here, at this moment only one produced satisfactory results.» (De las cuatro herramientas de detección de IA estudiadas aquí, en este momento solo una produjo resultados satisfactorios.) El propio resumen que hace Pangram del estudio lo reproduce como «only [Pangram] produced satisfactory results» (solo [Pangram] produjo resultados satisfactorios), con la sustitución entre corchetes.

Otras dos piezas se citan en esta comparación, y ambas necesitan una advertencia. Un research brief del Becker Friedman Institute de la Universidad de Chicago, del 6 de octubre de 2025, dice que «Among commercial options, Pangram achieves essentially zero false positive rates and false negative rates on medium-length to long passages» (entre las opciones comerciales, Pangram logra tasas de falsos positivos y falsos negativos esencialmente nulas en pasajes de longitud media a larga). No probó Turnitin: las cuatro herramientas fueron Pangram, Originality.ai, GPTZero y una base RoBERTa. Su corpus fue de 1.992 pasajes de seis géneros cotidianos, entre ellos noticias, blogs, reseñas de consumidores y currículos, no trabajos de estudiantes. Hay también una conexión que conviene poner sobre la mesa, con sus dos mitades: uno de los dos autores, Alex Imas, aparece en un testimonio firmado en la portada de Pangram, y el working paper lleva en su primera página una línea que dice «All authors declare that they have no financial or personal conflicts of interest related to this study.» (Todos los autores declaran no tener conflictos de interés financieros o personales relacionados con este estudio.) El artículo se descarga gratis desde el instituto, a dos clics del brief. Pésalo como te parezca que merece; preferimos que veas los dos datos a que no veas ninguno.

La segunda es la prueba práctica de un reportero de TechCrunch en julio de 2026, que produjo dos cifras a partir de un solo artículo: «Pangram gave it a 13% AI assisted score» (Pangram le dio una puntuación de asistencia de IA del 13 %), y «when I gave Pangram that same article in its entirety, as I had written it, it got a 100% human score.» (cuando le di a Pangram ese mismo artículo completo, tal como yo lo había escrito, obtuvo una puntuación humana del 100 %). La sesión de un periodista no es un banco de pruebas. Es un registro de primera mano de cómo la forma de enviar un texto cambia la cifra que vuelve, que es justo la situación en la que estás cuando dos instituciones procesan dos archivos distintos.

Y está el caso en que las dos no se pueden comparar en absoluto, porque solo una de ellas devuelve una cifra. El mismo artículo revisado por pares señala bajo su figura principal que «Turnitin regards papers with an AI score between 0% and 20% as uncertain and marks them with an asterisk instead of a numerical score» (Turnitin considera inciertos los trabajos con una puntuación de IA entre el 0 % y el 20 % y los marca con un asterisco en lugar de una puntuación numérica), y que por eso «19 Fully AI-generated papers, 7 Hybrid, 6 Humanised, and 3 Fully Human papers were coded as missing in the figure.» (19 trabajos totalmente generados por IA, 7 híbridos, 6 humanizados y 3 totalmente humanos se codificaron como ausentes en la figura). Eso son 35 de 160 trabajos sin ninguna cifra de Turnitin que contraponer a nada. Si tu resultado de Turnitin es un asterisco, no estás defendiendo una puntuación baja, no tienes puntuación, y qué significa el asterisco (*%) en una puntuación de IA de Turnitin explica la regla de visualización que hay detrás.

Qué puedes hacer cuando los dos resultados no coinciden

Empieza por conseguir los informes, porque en ambos lados dependes de quien los ejecutó. Las FAQ de Turnitin dicen: «The AI writing detection indicator and report are not visible to students. However, with the PDF download feature, instructors can download and share the AI report with students.» (El indicador y el informe de detección de escritura con IA no son visibles para los estudiantes. Sin embargo, con la función de descarga en PDF, el profesorado puede descargar y compartir el informe de IA con los estudiantes.) El centro de ayuda de Pangram dice que un resultado puede compartirse como enlace y que quien lo reciba «will see the scan overview and segment details without having to create a Pangram account.» (verá el resumen del escaneo y los detalles de los segmentos sin tener que crear una cuenta de Pangram). Pide ambos, y en el caso de Pangram pide concretamente el enlace para compartir y no una captura de pantalla, porque la vista por segmentos muestra qué pasajes produjeron la cifra y una captura de un porcentaje no te muestra nada con lo que puedas trabajar.

No cuentes con corregir el registro directamente con Pangram. Su control de comentarios está ligado a la cuenta que ejecutó el escaneo: la página de ayuda dice que hay que «Open the result you want to give feedback on, either after scanning it or from the History / All Checks page in your account» (abrir el resultado sobre el que quieres dar tu opinión, ya sea después de escanearlo o desde la página History / All Checks de tu cuenta), con un pulgar arriba y un pulgar abajo bajo el resultado. Un escaneo que haya hecho tu profesor no está en tu cuenta.

Tampoco encontramos una vía de recurso publicada para la persona que recibe el resultado. Leímos el texto principal de las 256 URL listadas en el sitemap de Pangram el 15 de septiembre de 2026, 2.117.382 caracteres en total, y buscamos en todas las páginas. `appeal` (recurso; aquí en el sentido de «atractivo») aparece en una, en una entrada de blog sobre publicidad. `dispute` (disputa) aparece en dos: la cláusula de arbitraje de los términos del servicio y una entrada de colaboración sobre disputas de autoría. `grievance` (queja formal), `contest` (impugnar), `redress` (reparación), `ombuds` (defensoría) y `request a review` (solicitar una revisión) no aparecen en ninguna de las 256. Esa misma búsqueda encontró `false positive` (falso positivo) en 162 de esas páginas y `student` (estudiante) en 182, que es como sabes que el contador sí estaba encontrando coincidencias en lugar de devolver cero en silencio para cada consulta.

Un límite de ese recuento, ya que es el tipo de afirmación que deberías poder derribar si es falsa: un sitemap no es todo el sitio. La página que este artículo cita más, la model card de Pangram 4, devuelve 200 y no figura en ese sitemap. Lee por tanto el resultado como 256 páginas listadas sin esa vía en ellas, no como una afirmación sobre todas las páginas que aloja Pangram. Y léelo en los dos sentidos: no significa que Pangram rechace correcciones, y desde luego no significa que tu institución no tenga un procedimiento. Significa que el proveedor no es la dirección a la que dirigirse.

Dos organizaciones que usan Pangram publican una vía propia, y esas son las que conviene conocer. Substack dice a los autores que «select Report detection error» (selecciona «Informar de un error de detección») en un informe de detección de IA, y documenta un control «Disable AI detection» (desactivar la detección de IA) en los borradores. Wiki Education, que pasa por Pangram las ediciones de Wikipedia de sus participantes, dice al profesorado qué ha estado detrás de la mayoría de los errores que ha confirmado: «If a student saves an empty outline (for example, with just short bullet points or empty section headers), or includes a significant amount of non-prose text (like sentence fragments or bibliographic entries) this might trigger the AI detector. Non-prose text is a common factor in most of the confirmed false positives we've seen.» (Si un estudiante guarda un esquema vacío —por ejemplo, con solo puntos breves o encabezados de sección vacíos— o incluye una cantidad importante de texto que no es prosa, como fragmentos de frase o entradas bibliográficas, eso puede activar el detector de IA. El texto que no es prosa es un factor común en la mayoría de los falsos positivos confirmados que hemos visto.) También escribe que «not use Pangram as definitive proof that the text was AI generated» (no usa Pangram como prueba definitiva de que el texto fue generado por IA), sino «a way to flag which text needs additional human scrutiny for verifiability.» (una forma de señalar qué texto necesita más escrutinio humano para verificarlo).

Ese punto sobre el texto que no es prosa puedes comprobarlo con tu propio archivo, y la model card de Pangram lo respalda desde el lado del proveedor. El modelo está pensado para textos «of at least 50 words, written primarily in complete sentences» (de al menos 50 palabras, escritos principalmente en frases completas), y la ficha enumera qué queda fuera de ese ámbito, incluidos «tables of contents, reference sections, templated or automated writing, instructions and technical manuals, and text dominated by mathematical notation» (índices, secciones de referencias, escritura basada en plantillas o automatizada, instrucciones y manuales técnicos, y texto dominado por notación matemática). Añade que «human-written headers, footers, instructions, and other extraneous formatting should be removed before checking a document» (los encabezados, pies de página, instrucciones y demás formato ajeno escritos por personas deben eliminarse antes de revisar un documento), y que «Raw text and .docx files are recommended over PDFs when available because PDF parsing can introduce unintended artifacts.» (se recomiendan el texto sin formato y los archivos .docx por encima de los PDF cuando están disponibles, porque el procesamiento de PDF puede introducir artefactos no deseados). Dos preguntas concretas, por tanto, para quien ejecutó el escaneo: ¿era un PDF, y pasaron también la bibliografía y las páginas preliminares?

Unas cuantas líneas merecen citarse en una reunión precisamente porque vienen de los proveedores y no de nosotros. La guía de Pangram para el profesorado dice: «we believe that AI detection is a great way to flag assignments, but detection warrants futher investigation before any punitive measures» (creemos que la detección de IA es una buena forma de señalar trabajos, pero un resultado de detección requiere más investigación antes de cualquier medida punitiva —la grafía es suya—), y añade que «A nonzero false positive rate means that any positive detection could be real, or it could be the statistically anomalous one-in-ten-thousand situation where Pangram gets it wrong.» (Una tasa de falsos positivos distinta de cero significa que cualquier detección positiva podría ser real, o podría ser el caso estadísticamente anómalo de uno entre diez mil en el que Pangram se equivoca.) Las FAQ de Turnitin dicen: «Turnitin does not make a determination of misconduct; rather, it provides data for the educators to make an informed decision based on their academic and institutional policies.» (Turnitin no determina si hubo mala conducta; más bien aporta datos para que el profesorado tome una decisión informada basada en sus políticas académicas e institucionales.)

La página de Pangram para el profesorado señala también al profesorado hacia pruebas del proceso de escritura y menciona Google Docs: «select File -> Version history -> See version history to see a full history of their writing process.» (selecciona Archivo -> Historial de versiones -> Ver historial de versiones para ver el historial completo de su proceso de escritura). Si tienes ese registro, la conversación se aparta de la pregunta de qué porcentaje tiene razón, que es la única pregunta que las cifras publicadas no pueden resolver. Cómo conservar el historial de versiones en Word, Google Docs y Overleaf explica dónde guarda cada herramienta el suyo, y marcado injustamente por IA: cómo recurrir y qué pruebas aceptará tu universidad cubre el resto del proceso.

Qué significa esto para ti

  • Los dos proveedores no informan de la misma métrica. El whitepaper de Turnitin de agosto de 2024 dice que no usa la exactitud como métrica; Pangram encabeza su portada y su página de educación superior con una cifra de exactitud.
  • Los porcentajes cuentan cosas distintas. El de Turnitin cubre solo la prosa calificable; las fracciones de Pangram están ponderadas por caracteres sobre el texto analizado y suman 1,0. El objetivo de Turnitin de quedarse por debajo del 1 % está además condicionado a documentos con más de un 20 % de escritura con IA, así que no hay ninguna suma que lo convierta en el 1 de cada 10.000 de Pangram.
  • Pregunta sobre qué conjunto se calculó un porcentaje, no qué versión lo produjo. Turnitin publica dos tasas a nivel de frase: en torno al 4 % (junio de 2023) y el 0,33 % (whitepaper de agosto de 2024). Entre medias hubo de verdad un cambio de modelo, en diciembre de 2023, y no explica la diferencia: el whitepaper sitúa el modelo antiguo en el 0,42 % sobre su corpus de prueba, no en el 4 %. Lo que las separa es el conjunto. El 4 % cuenta solo las frases ya marcadas; el 0,42 % y el 0,33 % recorren textos enteramente humanos.
  • Averigua si tu cifra es una parte o una confianza antes de compararla con nada.
  • Un asterisco no es una puntuación baja. En el estudio revisado por pares, 35 de 160 trabajos no tenían ninguna cifra de Turnitin.
  • Dirige tu reclamación a quien ejecutó el escaneo. El control de comentarios de Pangram vive en la cuenta que escaneó, y ninguna de las 256 páginas listadas en su sitemap ofrece una vía de recurso para la persona marcada. Pide el informe en sí y el enlace para compartir de Pangram con su vista por segmentos.

Si tienes en la mano un informe de Turnitin o iThenticate, puedes importar el informe y trabajar en los pasajes que señaló. Los pasajes que cumplen los requisitos pueden volver a procesarse sin coste.

Seguir leyendo