O ChatGPT é um detector de IA? O que a OpenAI publicou sobre o classificador que criou

Um número crescente de acusações começa com a captura de tela de um chatbot dizendo "isto provavelmente foi escrito por IA". Vale saber o que a empresa por trás desse chatbot publicou sobre fazer exatamente isso.

Equipe HumanPen

· 6 min de leitura

A resposta curta

Não. A OpenAI construiu para isso um classificador separado, treinado de propósito, publicou a precisão medida — identificou corretamente 26% do texto escrito por IA enquanto rotulava erroneamente como escrito por IA 9% do texto escrito por humanos — e o tirou do ar em 20 de julho de 2023, informando que foi retirado "due to its low rate of accuracy" (devido à sua baixa taxa de precisão). Um modelo de chat a quem se pergunta "foi a IA que escreveu isto?" não é esse classificador e nunca foi; ele produz uma resposta que soa plausível porque produzir respostas que soam plausíveis é exatamente o que ele faz.

O que a OpenAI realmente construiu e o que mediu

Em janeiro de 2023, a OpenAI lançou um classificador "trained to distinguish between text written by a human and text written by AIs from a variety of providers" (treinado para distinguir entre texto escrito por um humano e texto escrito por IAs de diversos fornecedores). O anúncio continua no ar, com uma nota de retirada acrescentada no topo.

Os números estão no próprio anúncio, não no teste independente de ninguém:

"In our evaluations on a 'challenge set' of English texts, our classifier correctly identifies 26% of AI-written text (true positives) as 'likely AI-written,' while incorrectly labeling human-written text as AI-written 9% of the time (false positives)." (Nas avaliações que fizemos sobre um "challenge set" de textos em inglês, o nosso classificador identifica corretamente 26% do texto escrito por IA como "provavelmente escrito por IA", os verdadeiros positivos, enquanto rotula incorretamente como escrito por IA o texto escrito por humanos em 9% dos casos, os falsos positivos.)

Vinte e seis por cento detectados. Nove por cento da escrita humana marcados por engano. E essa é a avaliação do próprio fornecedor sobre um sistema que ele construiu de propósito, com acesso às saídas dos modelos dele mesmo como dados de treinamento.

O parágrafo de abertura contém uma frase citada com menos frequência do que deveria: "it is impossible to reliably detect all AI-written text." (é impossível detectar de forma confiável todo o texto escrito por IA).

As limitações que publicou sobre si mesmo

O anúncio traz uma seção de limitações, e ela parece ter sido escrita por pessoas que esperavam que fosse usada de forma errada. Com as palavras do próprio documento:

  • "It should not be used as a primary decision-making tool, but instead as a complement to other methods of determining the source of a piece of text." (Não deve ser usado como ferramenta principal de decisão, mas como complemento a outros métodos de determinar a origem de um texto.)
  • "The classifier is very unreliable on short texts (below 1,000 characters). Even longer texts are sometimes incorrectly labeled." (O classificador é muito pouco confiável em textos curtos, abaixo de 1,000 caracteres. Mesmo textos mais longos às vezes são rotulados incorretamente.)
  • "Sometimes human-written text will be incorrectly but confidently labeled as AI-written by our classifier." (Às vezes, o texto escrito por humanos será rotulado incorretamente, mas com confiança, como escrito por IA pelo nosso classificador.)
  • "We recommend using the classifier only for English text. It performs significantly worse in other languages and it is unreliable on code." (Recomendamos usar o classificador apenas para texto em inglês. Ele tem desempenho significativamente pior em outros idiomas e não é confiável com código.)
  • "Text that is very predictable cannot be reliably identified." (Um texto muito previsível não pode ser identificado de forma confiável.) O exemplo dado é uma lista dos primeiros 1,000 números primos, "because the correct answer is always the same" (porque a resposta correta é sempre a mesma).
  • "Classifiers based on neural networks are known to be poorly calibrated outside of their training data. For inputs that are very different from text in our training set, the classifier is sometimes extremely confident in a wrong prediction." (Sabe-se que classificadores baseados em redes neurais são mal calibrados fora dos dados de treinamento. Para entradas muito diferentes do texto do nosso conjunto de treinamento, o classificador às vezes fica extremamente confiante em uma previsão errada.)

Aquele terceiro item e o último são o mesmo fenômeno enunciado duas vezes: confiança e correção não estão conectadas. Uma ferramenta desse tipo dizer "com certeza é IA" não é uma afirmação mais forte do que dizer "provavelmente é IA". É a mesma engenharia com um número diferente anexado.

Depois foi retirado

No topo da mesma página:

"As of July 20, 2023, the AI classifier is no longer available due to its low rate of accuracy." (Desde 20 de julho de 2023, o classificador de IA não está mais disponível devido à sua baixa taxa de precisão.)

Uma empresa retirar o próprio produto e apontar a precisão como motivo é uma das evidências mais limpas que este campo produz. Dizer isso custa algo à empresa, e é exatamente por isso que vale mais do que a opinião de terceiros em qualquer direção.

O modelo de chat não é o classificador

Esta é a parte que mais precisa ser dita, porque a retirada às vezes é relatada como se a capacidade tivesse passado para o chatbot. Não passou. O classificador era um modelo ajustado separadamente, descrito no anúncio como "a language model fine-tuned on a dataset of pairs of human-written text and AI-written text on the same topic" (um modelo de linguagem ajustado em um conjunto de dados com pares de texto escrito por humanos e texto escrito por IA sobre o mesmo tema), com um limiar de confiança ajustado de propósito "to keep the false positive rate low" (para manter baixa a taxa de falsos positivos).

Nada disso descreve uma interface de chat. Quando se pergunta a um modelo de chat se uma passagem foi escrita por IA, ele não tem nenhum componente de detecção a consultar; ele gera o tipo de texto que costuma vir depois desse tipo de pergunta. Vai produzir um veredito de tom confiante, uma porcentagem se você pedir e uma lista de motivos — e, com frequência, vai produzir um veredito diferente para a mesma passagem em uma segunda tentativa.

Portanto, a captura de tela que circula não é uma medição fraca. Não é uma medição.

O que isso diz e não diz sobre o Turnitin

O classificador retirado de um fornecedor não diz nada sobre o produto atual de outro fornecedor, e seria desonesto esticá-lo até esse ponto.

O detector do Turnitin é um sistema diferente, descrito por quem o fabrica em outros termos, com as próprias afirmações publicadas e os próprios modos de falha documentados. Detectores em geral discordam bastante entre si sobre a mesma passagem, e esse é um problema separado, com as próprias evidências, exposto em quão distantes ficam os detectores em textos idênticos. E a população mais afetada pelos falsos positivos está documentada, de um modo que importa se o inglês não é a sua primeira língua: veja o que a pesquisa mostra sobre a escrita em inglês não nativo.

A afirmação restrita feita aqui é a única que a fonte sustenta: perguntar a um modelo de chat se algo foi escrito por IA não é detecção, e a empresa que fabrica o modelo de chat mais conhecido publicou um classificador feito de propósito, mediu o desempenho dele e o retirou.

Se foi assim que você foi sinalizado

Alguma forma prática, sem fingir que conhecemos o processo da sua instituição.

  1. Estabeleça o que produziu a acusação. "Foi sinalizado" pode significar um detector institucional com um relatório, ou uma pessoa que colou o seu trabalho em um chatbot. São situações diferentes e só uma delas vem com um documento.
  2. Se existe um relatório, peça-o. Um relatório contém passagens e localizações; a captura de tela de uma janela de chat contém uma frase.
  3. Faça a mesma pergunta duas vezes a um modelo de chat, sobre a mesma passagem, em duas sessões novas. A instabilidade é uma propriedade que você pode demonstrar em vez de apenas afirmar.
  4. Não comece por nada disso. Processo e procedência convencem; argumentos sobre ferramentas raramente convencem, e abrir com uma objeção técnica pode parecer uma forma de evitar a pergunta.

Onde nos situamos nisso

Nós reescrevemos documentos, então vale ser claro: nada acima é um argumento de que a detecção não funciona, e não vendemos nenhum. A ferramenta HumanPen é para a situação em que existe um relatório real e passagens específicas têm destaques. Esses destaques definem o limite do que ele edita; nada fora deles é tocado.

Se a sua situação é a captura de tela de um chatbot sem nenhum relatório por trás, você não tem um problema de reescrita. Você tem uma conversa pela frente, e o material acima é o que levaríamos a ela.

Perguntas frequentes

O ChatGPT consegue dizer se um texto foi escrito por IA? A OpenAI construiu um classificador separado para essa tarefa em vez de usar o modelo de chat, publicou a precisão dele e o retirou em julho de 2023, citando a baixa taxa de precisão. Uma interface de chat não tem nenhum componente de detecção a consultar.

Quais foram os números do classificador da OpenAI? Em um "challenge set" de textos em inglês, ele identificou corretamente 26% do texto escrito por IA e rotulou incorretamente como escrito por IA o texto escrito por humanos em 9% dos casos.

Por que o chatbot soa tão certo? As próprias limitações da OpenAI observam que classificadores desse tipo podem ficar "extremely confident in a wrong prediction" (extremamente confiantes em uma previsão errada), e o tom confiante de um modelo de chat é uma característica do modo como ele escreve, não uma evidência sobre o seu texto. Perguntar duas vezes costuma produzir duas respostas diferentes.

Isso significa que a detecção de IA do Turnitin também não funciona? Não diz nada sobre isso. Fornecedor diferente, sistema diferente, afirmações publicadas diferentes. A única coisa que esta fonte sustenta é que usar um modelo de chat como detector não é detecção.

Continue lendo