Qué significa una tasa de falsos positivos del 1 % cuando una universidad presenta 75 000 trabajos

Una tasa de error del uno por ciento suena a diferencia insignificante, hasta que alguien la multiplica por su volumen real de entregas. Una universidad hizo esa multiplicación pública, junto con su decisión.

Equipo de HumanPen

· 8 min de lectura

La respuesta breve

La tasa de falsos positivos es una propiedad de una población, no de tu trabajo. Vanderbilt University puso números a esto en agosto de 2023: había presentado 75 000 trabajos a Turnitin en 2022, así que si el detector de IA hubiera estado activo entonces, una tasa de falsos positivos del 1 % habría significado "around 750 student papers could have been incorrectly labeled" (alrededor de 750 trabajos de estudiantes podrían haber sido etiquetados incorrectamente). Desactivó el detector. Dos condiciones acompañan esa frase y ambas se pierden al repetirla: el detector no estaba activo en 2022, por eso la fuente dice "if" (si), y la propia cifra del 1 % del proveedor incluye un calificador que su propia siguiente frase descarta.

La multiplicación, en palabras de la universidad

La Oficina de Aprendizaje e Innovación de Vanderbilt publicó una entrada el 16 de agosto de 2023 titulada "Guidance on AI Detection and Why We're Disabling Turnitin's AI Detector" (Orientación sobre la detección de IA y por qué estamos desactivando el detector de IA de Turnitin). La decisión en sí se plantea con claridad: "Vanderbilt has decided to disable Turnitin's AI detection tool for the foreseeable future" (Vanderbilt ha decidido desactivar la herramienta de detección de IA de Turnitin en el futuro previsible).

El pasaje que vale la pena recordar es la cuenta:

"At the time of launch, Turnitin claimed that its detection tool had a 1% false positive rate (Chechitelli, 2023). To put that into context, Vanderbilt submitted 75,000 papers to Turnitin in 2022. If this AI detection tool was available then, around 750 student papers could have been incorrectly labeled as having some of it written by AI." (En el momento del lanzamiento, Turnitin afirmó que su herramienta de detección tenía una tasa de falsos positivos del 1 % (Chechitelli, 2023). Para poner eso en contexto, Vanderbilt presentó 75 000 trabajos a Turnitin en 2022. Si esta herramienta de detección de IA hubiera estado disponible entonces, alrededor de 750 trabajos de estudiantes podrían haber sido etiquetados incorrectamente como si tuvieran parte escrito por IA).

No hay nada rebuscado ahí. Es uno por ciento de setenta y cinco mil. Pero convierte un porcentaje en un número de documentos, y esa conversión es la razón completa por la que las tasas de error son difíciles de entender.

Ahora lee la segunda oración otra vez, empezando por la palabra if (si). El detector no estaba activo cuando se presentaron esos 75 000 trabajos, eso es lo que significa "if this AI detection tool was available then" (si esta herramienta de detección de IA hubiera estado disponible entonces). Así que 750 no es un recuento de nada que haya ocurrido en Vanderbilt ni en ningún otro sitio. Es lo que representa uno por ciento del volumen anual real de una universidad escrito en números. Es una afirmación más modesta que aquella para la que suele usarse la cifra, y mucho más fácil de defender.

Por qué el número cambia de significado según dónde te coloques

Para un proveedor, uno de cada cien es una especificación. Para una institución, es una carga de casos anual. Para ti, no es ninguna de las dos cosas: tú eres un documento, y la tasa no dice nada sobre si el tuyo es ese uno.

Ese último punto funciona en ambas direcciones, y ahí es donde la gente exagera en los dos sentidos:

  • No significa que tu marca sea probablemente errónea. Una tasa de error del 1 % en trabajos escritos por humanos es totalmente compatible con que la mayoría de los trabajos marcados lo estén correctamente, dependiendo de cuántos hubieran sido asistidos por IA desde el principio.
  • Significa que "la herramienta tiene un 99 % de precisión, así que debiste hacerlo tú" no es un argumento. Una tasa describe una población; no puede decirte qué miembro de esa población tienes delante. Y uno por ciento de un año con 75 000 trabajos son cientos de documentos, así que estar en ese rango es algo ordinario, no exótico. Cientos de documentos no son cientos de acusaciones, sin embargo, y la distancia entre esas dos cosas es donde viven la mayoría de las versiones malas de este argumento.

La postura útil no es "el detector está roto" ni "el detector tiene razón". Es que una estadística de población no puede dirimir un caso individual, y el proveedor lo reconoce por escrito: su FAQ indica a los instructores que no traten el porcentaje del indicador de escritura por IA como "the sole basis for action or a definitive grading measure" (la única base para actuar o una medida de calificación definitiva).

El calificador que siempre se pierde

Aquí va un detalle que importa si alguna vez vas a citar la cifra del 1 % ante alguien.

La FAQ de Turnitin plantea la afirmación así: se esfuerza por mantener su tasa de falsos positivos —"incorrectly identifying fully human-written text as AI-generated" (identificar incorrectamente texto totalmente escrito por humanos como generado por IA)— por debajo del 1 % "for documents with over 20% of AI writing" (para documentos con más del 20 % de escritura por IA).

For documents with over 20% of AI writing (Para documentos con más del 20 % de escritura por IA). Ese es un límite sustancial para la afirmación, y no sobrevive a la propia reformulación del proveedor una oración después, que dice: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents" (En otras palabras, podríamos marcar un documento escrito por humanos como escrito por IA en uno de cada 100 documentos totalmente escritos por humanos).

Las dos oraciones no son equivalentes, y la segunda es la que viaja. Si usas la cifra, usa la versión con calificativo, en parte porque es precisa, y sobre todo porque alguien al otro lado de la mesa puede saber que el calificador está ahí.

Qué partes de una entrada de 2023 sobreviven a ser repetidas

La entrada es de agosto de 2023. Parte es aritmética, que no envejece. Parte es una afirmación sobre lo que el proveedor había publicado, que sí. Distinguir eso antes de citar nada es la mayor parte del trabajo.

La aritmética se puede repetir sin problema, con el if (si) adjunto. Uno por ciento de un gran volumen de entregas es un gran número de documentos, y nada desde 2023 toca eso.

La preocupación por los escritores no nativos de inglés se puede repetir, y no depende de esta entrada en absoluto. Hay investigación detrás, y revisamos lo que esa investigación midió realmente en Sesgo de los detectores de IA contra la escritura en inglés no nativa.

La queja sobre transparencia es la que hay que verificar antes de repetirla. Vanderbilt escribió que "Turnitin gives no detailed information as to how it determines if a piece of writing is AI-generated or not" (Turnitin no ofrece información detallada sobre cómo determina si un texto está generado por IA o no). La FAQ de hoy sí describe cómo se ensambla una puntuación: se extraen oraciones y se segmentan en secciones superpuestas, cada segmento se clasifica y recibe un valor entre 0 y 1, las oraciones que califican heredan la puntuación de su segmento, las puntuaciones superpuestas se agrupan y las puntuaciones de oración agrupadas se agregan en una puntuación del documento. Afirmar en una reunión que nunca se ha publicado nada sobre cómo funciona y alguien puede poner ese párrafo delante de ti.

Lee la oración que le sigue en la entrada, sin embargo, antes de decidir que la objeción fue respondida, porque la objeción es más estrecha que "díganos cómo funciona". La queja es que la herramienta "looks for patterns common in AI writing, but they do not explain or define what those patterns are" (busca patrones comunes en la escritura por IA, pero no explican ni definen cuáles son esos patrones). Una descripción de cómo se combinan las puntuaciones de los segmentos no es una descripción de los patrones. El mecanismo publicado y la objeción publicada tratan dos preguntas diferentes, y ambos se pueden citar con precisión el mismo día.

Lo que no podemos decirte es cuándo apareció por primera vez ese pasaje de la FAQ. No le hemos puesto fecha, así que nada de lo anterior debe leerse como que el proveedor lo publicó en respuesta a esta entrada.

Un calificador más, y este pertenece a Vanderbilt. La entrada describe que la función llegó con "less than 24-hour advance notice, no option at the time to disable the feature" (menos de 24 horas de aviso previo, sin opción en ese momento de desactivar la función). At the time (en ese momento) está en la oración original. Cítala sin esas tres palabras y has convertido una afirmación sobre el lanzamiento en una afirmación permanente sobre el producto. Es la misma maniobra que quitar "over 20%" (más del 20 %) a la cifra del 1 %, solo que hecha por el otro lado del argumento.

Cómo usar esto sin exagerarlo

  1. Cita la fecha. "En 2023, Vanderbilt desactivó la herramienta y publicó este razonamiento" es verificable y defendible. "Las universidades han abandonado la detección de IA" no lo es.
  2. Di qué ilustra la aritmética. Viaja porque cualquiera puede rehacerla con el volumen de su propia institución, y plantea un punto real: un porcentaje pequeño aún produce una carga de casos que alguien tiene que revisar con justicia. Lo que no hace es estimar acusaciones. No todas las entregas son elegibles para una puntuación, nadie fuera de la institución sabe cuánto uso de IA hubo realmente, y una marca no tiene que convertirse en un cargo. Desmontamos eso con más detalle en ¿es un 20 % de IA demasiado alto?.
  3. No afirmes que prueba nada sobre tu documento. Establece que ser marcado erróneamente es un evento ordinario a escala, que es una afirmación diferente y más modesta.
  4. Comprueba si tu propia institución ha publicado algo. Busca en la política de integridad académica y en lo que publique el centro de enseñanza y aprendizaje, no solo en la página de noticias. Una declaración local supera a una distante en cualquier conversación que vayas a tener.
  5. Mantenlo fuera de tu apertura. El proceso y el origen persuaden primero; las estadísticas son a lo que recurres cuando alguien argumenta que el número es evidentemente conclusivo.

Si tu institución aún lo usa

Si lo usa, el informe que tienes delante es lo que importa, en lugar de cualquiera de lo anterior. De qué es estadística el porcentaje y por qué los resaltados y el número pueden discrepar son terreno separado, cubierto en leer el informe de escritura por IA línea por línea.

HumanPen solo entra en el punto en que se marcan pasajes específicos y algunos de ellos necesitan cambiar: el informe establece el límite, y los párrafos no marcados conservan la redacción que ya tienes.

Nada de eso es una respuesta a un falso positivo. Si tu posición es que lo escribiste tú, reescribirlo es el movimiento equivocado, y lo que realmente ha persuadido a los revisores es un tema completamente distinto: la evidencia que ha movido a un panel.

Preguntas frecuentes

¿Significa una tasa de falsos positivos del 1 % que mi marca es probablemente errónea? No. Es una tasa en toda una población de documentos escritos por humanos y no dice nada sobre un caso individual. Significa que a volumen institucional, los trabajos marcados erróneamente son una ocurrencia ordinaria, no un evento freak.

¿De dónde sale la cifra de 750? De la propia entrada de Vanderbilt del 16 de agosto de 2023, aplicando la cifra del 1 % a los 75 000 trabajos que presentó a Turnitin en 2022. Nota el condicional: el detector no estaba activo en 2022, así que la oración dice "if this AI detection tool was available then" (si esta herramienta de detección de IA hubiera estado disponible entonces). Muestra cómo se ve escrito uno por ciento del volumen de esa universidad. No es un registro de 750 trabajos marcados erróneamente, y no es una predicción para la institución de nadie más.

¿Es incondicional la afirmación del 1 %? No. El objetivo declarado de Turnitin está por debajo del 1 % "for documents with over 20% of AI writing" (para documentos con más del 20 % de escritura por IA). Su propia reformulación en la oración siguiente descarta ese calificador, por eso circula la versión sin calificativo.

¿Han desactivado generalmente las universidades la detección de IA? Esto no es algo que esta fuente respalde. Documenta la decisión de una institución en 2023, con su razonamiento. Si tu institución lo usa es una pregunta local con una respuesta local.

Seguir leyendo