Como reduzir a taxa de IA num artigo em inglês? Entenda o que o Turnitin verifica

Para reduzir a sua taxa de IA, primeiro tem de saber o que o detetor analisa. O Turnitin apenas analisa frases em prosa padrão. O modelo classifica com base na probabilidade das palavras, não em burstiness ou perplexity. Textos estruturalmente uniformes ou repetitivos têm maior probabilidade de ser sinalizados por engano.

Equipe HumanPen

· 4 min de leitura

Quais textos são sinalizados por engano

Antes de começar a reescrever, compreenda uma coisa: há texto sinalizado que não foi gerado por IA, mas cujas características disparam falsos positivos. O FAQ do Turnitin diz:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Por vezes, os falsos positivos – quando texto escrito por humanos é incorretamente sinalizado como gerado por IA – podem incluir conteúdo com pouca variação estrutural, texto que se repete literalmente ou texto que foi parafraseado sem desenvolver ideias novas.)
"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se o nosso indicador mostrar uma quantidade mais elevada de escrita por IA neste tipo de texto, recomendamos que tenha isso em conta ao analisar a percentagem indicada.)

Isto significa que, se a sua escrita tiver pouca variação estrutural, contiver repetição literal ou tiver sido parafraseada sem adicionar ideias novas, o detetor pode reportar uma percentagem de IA inflacionada. Não significa que usou IA. Significa que estas características se sobrepõem aos padrões estatísticos do texto gerado por IA.

Essa frase do FAQ dá-lhe três aspetos que pode verificar no seu próprio rascunho, e todos os três são propriedades do parágrafo final: se a estrutura varia, se há repetição e se cada parágrafo faz avançar um argumento que o anterior ainda não tinha feito. O que a frase não faz é dizer quais as edições que usou para lá chegar. As edições que realmente alteram as estatísticas são a nossa tentativa de tratar dessa parte manualmente.

O Turnitin apenas analisa frases em prosa

Nem tudo no seu artigo é analisado. O FAQ afirma:

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Este texto qualificativo inclui apenas frases em prosa, ou seja, apenas analisamos blocos de texto escritos em frases gramaticais padrão e que não incluem outros tipos de escrita, como listas, marcas de lista (estruturas curtas que não são frases) ou outras estruturas que não sejam frases.)

Listas, marcas de lista e estruturas curtas que não são frases estão fora do âmbito da análise. Se o seu relatório apresentar uma percentagem, essa percentagem é calculada apenas com base nas frases em prosa, não no documento inteiro.

Isto também aponta para uma estratégia: se os seus argumentos estão em parágrafos de prosa, são esses parágrafos que o detetor examina. Ao reescrever, foque o seu esforço nesses parágrafos. Listas e tabelas não precisam de se preocupar com a deteção de IA. Quais as frases dentro desses parágrafos que devem permanecer exatas é uma questão à parte: o que pode reformular e o que deve permanecer exato.

Como o classificador pontua o texto

Compreender como o detetor atribui pontuações ajuda a explicar por que razão algumas revisões resultam e outras não. O Turnitin descreve o processo:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Quando um artigo é submetido ao Turnitin, as frases da submissão são extraídas e segmentadas em secções sobrepostas para análise de previsão. Cada segmento é classificado pelo modelo de deteção de IA e recebe um valor entre 0 e 1, indicando a probabilidade de o texto ser provavelmente humano ou gerado por IA.)

Cada segmento recebe um valor entre 0 e 1, que representa a probabilidade de ser gerado por IA. Mas o modelo não funciona usando as métricas que vê frequentemente em publicações de blogues:

"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (O nosso modelo não está explicitamente programado para avaliar sinais específicos como 'burstiness', 'perplexity' ou outras métricas individuais por vezes referidas em discussões públicas.)
"Instead, it learns statistical patterns from our training data." (Em vez disso, aprende padrões estatísticos a partir dos nossos dados de formação.)

O sinal principal é a probabilidade das palavras:

"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Os nossos classificadores são treinados para detetar estas diferenças na probabilidade das palavras e são experientes nas sequências particulares de probabilidade de palavras de escritores humanos.)

Ligando isto de volta à secção de falsos positivos: texto estruturalmente uniforme e repetitivo é sinalizado não porque "pareça IA" de alguma forma superficial, mas porque as suas sequências de probabilidade de palavras se assemelham às de texto gerado por IA. A escrita humana tende a ter mais imprevisibilidade na escolha de palavras, enquanto o texto gerado por IA tende a selecionar palavras de alta probabilidade. O que os detetores de IA medem além de perplexity e burstiness é a explicação mais completa disto.

Orientações práticas para reduzir a sua taxa de IA

Juntando o que foi dito:

  1. Revise parágrafos de prosa, não listas. O detetor apenas analisa frases em prosa padrão. Listas, marcas de lista e estruturas curtas em tabelas estão fora do âmbito da análise.
  2. Aumente a variação estrutural. A falta de variação estrutural é uma causa comum de falsos positivos. Se os seus parágrafos tiverem todos comprimento e estrutura de frases semelhantes, tente variar o comprimento das frases e os padrões sintáticos.
  3. Reduza a repetição. A autorrepetição literal faz subir a pontuação de IA. Se dois parágrafos disserem a mesma coisa, funda-os ou faça o segundo fazer avançar genuinamente o argumento.
  4. Desenvolva a ideia, não apenas a redação. O que o FAQ designa é paráfrase "sem desenvolver ideias novas", por isso o teste que implica é se o parágrafo agora transporta algo que não transportava antes. Não diz nada sobre quais as edições que faz no processo, e escolher uma palavra mais clara é uma parte normal de rever qualquer coisa.
  5. Compreenda a unidade de pontuação. Cada segmento é pontuado individualmente, por isso um parágrafo sinalizado não significa que o artigo inteiro seja gerado por IA. O relatório dá-lhe probabilidades por segmento, não um julgamento único e abrangente.

O que isto significa para si

Reduzir a sua taxa de IA não se trata de encontrar a ferramenta certa ou o prompt certo. Começa por compreender o que o detetor examina. O Turnitin apenas analisa frases em prosa. Listas e estruturas curtas estão fora do âmbito. O modelo classifica com base em sequências de probabilidade de palavras, não em burstiness ou perplexity, e cada segmento é pontuado independentemente. Texto com pouca variação estrutural, repetição literal ou paráfrase que não desenvolve ideias novas tem maior probabilidade de ser sinalizado por engano.

Depois de obter o seu relatório, veja quais os parágrafos de prosa que estão sinalizados e trabalhe neles: varie a estrutura, reduza a repetição e desenvolva argumentos substantivos. Não precisa de tocar em listas, tabelas ou citações. Manter o texto intocado intocado é toda a ideia por trás de reescrever apenas os parágrafos que um relatório do Turnitin sinalizou.

Continue lendo