A Turnitin testou o próprio detector em busca de viés contra quem aprende inglês. O resultado tem duas metades.
Em trabalhos acima de 300 palavras, a Turnitin informa que a diferença entre escritores L2 e L1 é pequena e não estatisticamente significativa. Em trabalhos entre 150 e 300 palavras, a mesma avaliação encontrou uma diferença maior, bem acima da própria meta de 1 %. E a Turnitin aponta uma limitação da própria amostra que importa se você escreve em nível universitário.
Equipe HumanPen
· 6 min de leitura
A resposta curta, com as duas metades
A Turnitin fez a sua própria avaliação sobre essa questão e publicou o resultado. A resposta tem duas metades, e elas apontam em direções opostas.
Em trabalhos de 300 palavras ou mais, constatou que a diferença na taxa de falsos positivos (FPR) entre aprendizes de inglês (L2) e falantes nativos de inglês (L1) era pequena e não estatisticamente significativa. Em trabalhos entre 150 e 300 palavras, a mesma avaliação encontrou uma diferença maior, bem acima da própria meta de 1 %.
Portanto, se o achado tranquilizador vale para você depende do tamanho do que você enviou. Há também uma limitação que a Turnitin declara sobre a própria amostra: ela importa se você escreve em nível universitário e está mais abaixo.
O que foi testado
A Turnitin reuniu até 2.000 textos para cada combinação de duas variáveis: inglês L2 (aprendiz de inglês) contra inglês L1 (inglês materno), e "curto demais" (entre 150 e 300 palavras) contra "longo o suficiente" (300 palavras ou mais). Os conjuntos de dados não faziam parte do conjunto de treinamento do detector.
O resultado que vai para o título
Para os documentos que alcançam o mínimo de 300 palavras, a Turnitin informa que a diferença na taxa de falsos positivos entre escritores L2 e L1 é pequena e não estatisticamente significativa:
"For documents meeting our minimum 300 word count requirement, the difference in the false positive rate (FPR) between L2 English writers (ELL writers) and L1 English writers (native English writers) is small, and not statistically significant, illustrating that our detector is not biased between these two groups of writers. Additionally, although the FPR for each group is slightly higher than our overall target of 0.01 (1%), neither group's FPR is significantly different from this target." (Entre os documentos que cumprem o nosso requisito mínimo de 300 palavras, a diferença na taxa de falsos positivos (FPR) entre escritores de inglês L2 (escritores ELL) e escritores de inglês L1 (falantes nativos de inglês) é pequena e não estatisticamente significativa, o que mostra que o nosso detector não é tendencioso entre esses dois grupos. Além disso, embora a FPR de cada grupo esteja ligeiramente acima da nossa meta global de 0,01 (1 %), a FPR de nenhum dos grupos difere significativamente dessa meta.)
"Not statistically significant" (não estatisticamente significativo) significa que a diferença encontrada pode ser ruído. Não significa que a diferença seja zero e não significa que não exista viés. E a taxa de falsos positivos dos dois grupos ficou acima da meta de 1 %, só que por uma margem que o teste não considerou relevante. "Slightly higher" (ligeiramente acima) não é a mesma coisa que "at or below." (na meta ou abaixo dela).
O resultado que não vai para o título
Para os documentos entre 150 e 300 palavras, a mesma avaliação encontrou a direção oposta. A diferença entre escritores L2 e L1 foi maior e a taxa de falsos positivos ficou significativamente acima da meta de 1 %:
"Conversely, for documents that are (De outro lado, para os documentos que são) "too short," (curtos demais:) we found there is a greater difference in FPR between these groups of writers and it's significantly greater than our target of 0.01 FPR. This again corroborates our earlier finding that AI writing detectors require longer samples to correctly identify AI-generated content and to keep false positives to a minimum." (Nesses casos, encontramos uma diferença maior na FPR entre esses dois grupos de escritores, significativamente acima da nossa meta de 0,01 de FPR. Isso confirma mais uma vez a nossa descoberta anterior: os detectores de escrita com IA precisam de amostras mais longas para identificar corretamente conteúdo gerado por IA e manter os falsos positivos no mínimo.)
O mesmo estudo, com o mesmo detector, produziu um resultado para os textos longos e outro para os curtos. O título do blog traz o primeiro. O segundo está no corpo do texto.
O que a amostra realmente continha
É o que diz a Turnitin:
"Most of the L2 English documents are short persuasive or informative writing tasks, most similar to the Automated Scoring and Assessment Prize (ASAP) secondary-level essay corpus. A comparable collection of publicly available full-length university level documents from L2 and L1 writers was not available for this evaluation." (A maior parte dos documentos em inglês L2 são tarefas curtas de escrita persuasiva ou informativa, muito parecidas com o corpus de redações do ensino secundário do Automated Scoring and Assessment Prize (ASAP). Uma coleção comparável, disponível publicamente, de documentos universitários completos escritos por autores L2 e L1 não estava disponível para esta avaliação.)
Os textos L2 desta avaliação são, na maior parte, redações de nível secundário. Se você está escrevendo um trabalho universitário, uma revisão bibliográfica, um relatório de laboratório ou um capítulo de tese, não é isso que foi testado. A Turnitin diz que não encontrou uma coleção pública de documentos universitários completos de escritores L2 e L1 para rodar essa comparação. O achado "not statistically significant" (não estatisticamente significativo) vale para redações curtas, persuasivas ou informativas, de nível secundário. Se isso vale também para o tipo de documento que você realmente envia é uma pergunta que esta avaliação não responde.
A linha das 300 palavras
A Turnitin liga o mínimo de 300 palavras diretamente a esta pesquisa. Depois de avaliar 800.000 documentos e ver que trabalhos curtos empurravam a taxa de falsos positivos para cima, passaram a exigir 300 palavras:
"Our evaluation of 800,000 documents—mentioned earlier in this blog—shows a slightly higher-than-comfortable false positive rate on short submissions (fewer than 300 words). There may not be enough signal/markers in such short samples to identify the telltale distributional differences in AI writing. In order to ensure we keep our false positive rate below 1%, we moved quickly to update the minimum submission length to 300 words for our AI writing detection capability to process a submission." (A nossa avaliação de 800.000 documentos, mencionada antes neste blog, mostra uma taxa de falsos positivos um pouco acima do confortável em trabalhos curtos (menos de 300 palavras). Pode não haver sinal e marcadores suficientes em amostras tão curtas para identificar as diferenças de distribuição que denunciam a escrita com IA. Para garantir que mantemos a nossa taxa de falsos positivos abaixo de 1 %, atualizamos rapidamente o tamanho mínimo do trabalho para 300 palavras, exigido para que a nossa detecção de escrita com IA processe um envio.)
O mínimo existe porque os textos curtos deram problema. O resultado tranquilizador só vale acima desse mínimo. Abaixo dele, a mesma avaliação encontrou a diferença que você gostaria de conhecer.
E o estudo de Liang?
Talvez você tenha visto manchetes ligadas a um estudo de Liang. A Turnitin responde a ele diretamente:
"Liang's claim is grounded on a small collection of works of just 91 Test of English as a Foreign Language (TOEFL) practice essays, all of which are less than 150 words long. Turnitin's AI writing detection was not included in this evaluation, perhaps in part because we won't make predictions about documents that are so short." (A afirmação de Liang se apoia numa pequena coleção de apenas 91 redações de treino do TOEFL (Test of English as a Foreign Language), todas com menos de 150 palavras. A detecção de escrita com IA da Turnitin não foi incluída nesta avaliação, talvez em parte porque não fazemos previsões sobre documentos tão curtos.)
O que fazer com isso
Se o seu trabalho passa de 300 palavras, os próprios dados da Turnitin dizem que a diferença entre as taxas de falsos positivos de L2 e L1 é pequena e não estatisticamente significativa. Isso não garante que você não seja marcado. Significa que a avaliação não encontrou evidências fortes de que os escritores L2 estejam sistematicamente em desvantagem, pelo menos não na amostra que tinham.
Aqui está o que você pode usar de verdade:
Verifique a contagem de palavras antes de enviar. Se uma seção com menos de 300 palavras for marcada, a avaliação do próprio detector diz que textos curtos produzem uma diferença maior entre escritores L2 e L1 e uma taxa de falsos positivos mais alta no geral. Você pode pedir ao seu professor que rode a verificação no documento inteiro, e não num trecho curto.
Pergunte o que marcou você e em qual limite. Se a Turnitin foi usada, o mínimo de 300 palavras e o detalhe "slightly higher than 1%" (ligeiramente acima de 1 %) são coisas específicas que você pode levantar com quem estiver analisando a marcação.
Guarde os seus rascunhos, anotações e fontes. Se você for marcado e achar que o seu inglês L2 teve algum peso, mostrar o histórico de revisões e os materiais de consulta é o que resolve a conversa. Discutir significância estatística com o seu professor provavelmente não resolve.
Continue lendo
Por que escritores não nativos de inglês são sinalizados com mais frequência por detectores de IA
8 min de leitura
Relatórios de detecçãoEntenda a Taxa de Falsos Positivos da Turnitin
5 min de leitura
Relatórios de detecçãoDocumentos curtos e o problema do tudo ou nada no Turnitin
6 min de leitura