¿Es ChatGPT un detector de IA? Lo que OpenAI publicó sobre su propio clasificador
Cada vez más acusaciones empiezan con la captura de un chatbot que dice «esto probablemente lo escribió una IA». Vale la pena saber qué ha publicado la empresa que está detrás de ese chatbot sobre hacer exactamente esto.
Equipo de HumanPen
· 6 min de lectura
La respuesta breve
No. OpenAI construyó para esto un clasificador aparte, entrenado expresamente, publicó la precisión medida — identificó correctamente el 26 % del texto escrito por IA mientras etiquetaba erróneamente como escrito por IA el 9 % del texto escrito por humanos — y lo retiró el 20 de julio de 2023, indicando que se retiraba «due to its low rate of accuracy» (debido a su baja tasa de precisión). Un modelo de chat al que se le pregunta «¿lo escribió una IA?» no es ese clasificador y nunca lo fue; produce una respuesta que suena plausible porque producir respuestas que suenan plausibles es lo que hace.
Qué construyó realmente OpenAI y qué midió
En enero de 2023, OpenAI lanzó un clasificador «trained to distinguish between text written by a human and text written by AIs from a variety of providers» (entrenado para distinguir entre texto escrito por un humano y texto escrito por IA de diversos proveedores). El anuncio sigue en línea, con una nota de retirada añadida en la parte superior.
Las cifras están en el propio anuncio, no en el test independiente de nadie:
"In our evaluations on a 'challenge set' of English texts, our classifier correctly identifies 26% of AI-written text (true positives) as 'likely AI-written,' while incorrectly labeling human-written text as AI-written 9% of the time (false positives)." (En nuestras evaluaciones sobre un «challenge set» de textos en inglés, nuestro clasificador identifica correctamente el 26 % del texto escrito por IA como «probablemente escrito por IA», los verdaderos positivos, mientras que etiqueta erróneamente como escrito por IA el texto escrito por humanos en el 9 % de los casos, los falsos positivos.)
Veintiséis por ciento detectado. Nueve por ciento de la escritura humana marcado por error. Y esta es la evaluación que el propio proveedor hace de un sistema que construyó a propósito, con acceso a las salidas de sus propios modelos como datos de entrenamiento.
El párrafo inicial contiene una frase que se cita menos de lo que debería: «it is impossible to reliably detect all AI-written text.» (es imposible detectar de forma fiable todo el texto escrito por IA).
Las limitaciones que publicó sobre sí mismo
El anuncio incluye una sección de limitaciones, y se lee como si la hubieran escrito personas que esperaban que se usara mal. Con sus propias palabras:
- "It should not be used as a primary decision-making tool, but instead as a complement to other methods of determining the source of a piece of text." (No debería usarse como herramienta principal de toma de decisiones, sino como complemento de otros métodos para determinar el origen de un texto.)
- "The classifier is very unreliable on short texts (below 1,000 characters). Even longer texts are sometimes incorrectly labeled." (El clasificador es muy poco fiable con textos cortos, por debajo de 1,000 caracteres. Incluso los textos más largos se etiquetan a veces incorrectamente.)
- "Sometimes human-written text will be incorrectly but confidently labeled as AI-written by our classifier." (A veces, el texto escrito por humanos será etiquetado incorrectamente, pero con seguridad, como escrito por IA por nuestro clasificador.)
- "We recommend using the classifier only for English text. It performs significantly worse in other languages and it is unreliable on code." (Recomendamos usar el clasificador solo con texto en inglés. Su rendimiento es significativamente peor en otros idiomas y no es fiable con código.)
- "Text that is very predictable cannot be reliably identified." (El texto muy predecible no puede identificarse de forma fiable.) El ejemplo que se da es una lista de los primeros 1,000 números primos, «because the correct answer is always the same» (porque la respuesta correcta es siempre la misma).
- "Classifiers based on neural networks are known to be poorly calibrated outside of their training data. For inputs that are very different from text in our training set, the classifier is sometimes extremely confident in a wrong prediction." (Se sabe que los clasificadores basados en redes neuronales están mal calibrados fuera de sus datos de entrenamiento. Para entradas muy distintas del texto de nuestro conjunto de entrenamiento, el clasificador a veces se muestra extremadamente seguro de una predicción errónea.)
Ese tercer punto y el último son el mismo fenómeno enunciado dos veces: la confianza y la corrección no están conectadas. Que una herramienta de este tipo diga «sin duda es IA» no es una afirmación más fuerte que si dice «posiblemente es IA». Es la misma maquinaria con una cifra distinta pegada.
Luego lo retiraron
En la parte superior de la misma página:
"As of July 20, 2023, the AI classifier is no longer available due to its low rate of accuracy." (Desde el 20 de julio de 2023, el clasificador de IA ya no está disponible debido a su baja tasa de precisión.)
Que una empresa retire su propio producto y señale la precisión como motivo es de lo más limpio que produce este campo en materia de pruebas. Decirlo le cuesta algo a la empresa, y por eso mismo vale más que una opinión de terceros en cualquier dirección.
El modelo de chat no es el clasificador
Esta es la parte que más hace falta decir, porque a veces se cuenta la retirada como si la capacidad se hubiera trasladado al chatbot. No fue así. El clasificador era un modelo afinado aparte, descrito en el anuncio como «a language model fine-tuned on a dataset of pairs of human-written text and AI-written text on the same topic» (un modelo de lenguaje afinado sobre un conjunto de datos de pares de texto escrito por humanos y texto escrito por IA sobre el mismo tema), con un umbral de confianza ajustado deliberadamente «to keep the false positive rate low» (para mantener baja la tasa de falsos positivos).
Nada de eso describe una interfaz de chat. Cuando se pregunta a un modelo de chat si un pasaje fue escrito por IA, no tiene ningún componente de detección al que consultar; genera el tipo de texto que suele seguir a ese tipo de pregunta. Producirá un veredicto de tono seguro, un porcentaje si se lo pides y una lista de razones, y a menudo producirá un veredicto distinto para el mismo pasaje en un segundo intento.
Así que la captura que circula no es una medición débil. No es una medición.
Qué dice esto sobre Turnitin y qué no
El clasificador retirado de un proveedor no dice nada sobre el producto actual de otro proveedor, y sería deshonesto estirarlo hasta ese punto.
El detector de Turnitin es un sistema distinto, descrito por su fabricante en otros términos, con sus propias afirmaciones publicadas y sus propios modos de fallo documentados. Los detectores en general discrepan entre sí de forma sustancial sobre el mismo pasaje, y eso es un problema aparte con sus propias pruebas, expuesto en cuánto se separan los detectores ante un texto idéntico. Y el grupo más afectado por los falsos positivos está documentado, de una manera que importa si el inglés no es tu primera lengua: véase lo que muestra la investigación sobre la escritura en inglés no nativo.
La afirmación estrecha que se hace aquí es la única que respalda la fuente: preguntar a un modelo de chat si algo fue escrito por IA no es detección, y la empresa que fabrica el modelo de chat más conocido publicó un clasificador construido a propósito, lo midió y lo retiró.
Si así te señalaron
Un poco de forma práctica, sin pretender que conocemos el proceso de tu institución.
- Establece qué produjo la acusación. «Fue marcado» puede significar un detector institucional con un informe, o una persona que pegó tu trabajo en un chatbot. Son situaciones distintas y solo una de ellas viene con un documento.
- Si hay un informe, pídelo. Un informe contiene pasajes y ubicaciones; la captura de una ventana de chat contiene una frase.
- Haz la misma pregunta dos veces a un modelo de chat, sobre el mismo pasaje, en dos sesiones nuevas. La inestabilidad es una propiedad que puedes demostrar en lugar de limitarte a afirmarla.
- No empieces por nada de esto. El procedimiento y la procedencia convencen; los argumentos sobre herramientas rara vez lo hacen, y abrir con una objeción técnica puede leerse como una forma de esquivar la pregunta.
Dónde nos situamos en esto
Nos dedicamos a reescribir documentos, así que conviene ser claros: nada de lo anterior es un argumento de que la detección no funcione, y no vendemos ninguno. La herramienta HumanPen es para la situación en la que existe un informe real y pasajes concretos llevan resaltados. Esos resaltados marcan el límite de lo que edita; nada fuera de ellos se toca.
Si tu situación es la captura de un chatbot sin ningún informe detrás, no tienes un problema de reescritura. Tienes una conversación pendiente, y el material de arriba es lo que llevaríamos a ella.
Preguntas frecuentes
¿Puede ChatGPT saber si un texto fue escrito por IA? OpenAI construyó un clasificador aparte para esa tarea en lugar de usar el modelo de chat, publicó su precisión y lo retiró en julio de 2023 alegando su baja tasa de precisión. Una interfaz de chat no tiene ningún componente de detección al que consultar.
¿Cuáles fueron las cifras del clasificador de OpenAI? Sobre un «challenge set» de textos en inglés identificó correctamente el 26 % del texto escrito por IA y etiquetó erróneamente como escrito por IA el texto escrito por humanos en el 9 % de los casos.
¿Por qué el chatbot suena tan seguro? En las propias limitaciones de OpenAI se señala que los clasificadores de este tipo pueden ser «extremely confident in a wrong prediction» (extremadamente seguros de una predicción errónea), y el tono confiado de un modelo de chat es una propiedad de su manera de escribir, no una prueba sobre tu texto. Preguntar dos veces suele dar dos respuestas distintas.
¿Significa eso que la detección de IA de Turnitin tampoco funciona? No dice nada al respecto. Otro proveedor, otro sistema, otras afirmaciones publicadas. Lo único que respalda esta fuente es que usar un modelo de chat como detector no es detección.
Seguir leyendo
Por qué el mismo texto obtiene una puntuación distinta en cada detector
5 min de lectura
Detectores de IAQué miden los detectores de IA más allá de la perplexity y la burstiness
6 min de lectura
Detectores de IAPor qué los detectores de IA señalan con más frecuencia a escritores no nativos de inglés
8 min de lectura