Revisões Sistemáticas e Detecção de IA: Por Que Seções de Metodologia São Sinalizadas
Revisões sistemáticas seguem modelos metodológicos rígidos. A seção de metodologia repete os mesmos verbos e estruturas frasais entre estudos, o que se encaixa nos padrões de falso-positivo descritos pelo Turnitin. O detector não mede burstiness ou perplexity. É um classificador de probabilidade de palavras. Eis o que a documentação diz sobre como a pontuação é produzida e como interpretá-la.
Equipe HumanPen
· 6 min de leitura
Por Que Seções de Metodologia Se Encaixam em Padrões de Falso-Positivo
Revisões sistemáticas exigem uma seção de metodologia padronizada. Você descreve as bases de dados pesquisadas, as strings de busca, os critérios de inclusão e exclusão e o processo de triagem. A linguagem é necessariamente repetitiva porque o checklist PRISMA exige elementos de relato específicos. A documentação do Turnitin descreve tipos de texto que produzem falsos-positivos:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Às vezes, falsos-positivos — identificar incorretamente texto escrito por humanos como gerado por IA — podem incluir conteúdo sem muita variação estrutural, texto que literalmente se repete ou texto parafraseado sem desenvolver ideias novas.)
A frase seguinte: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se nosso indicador mostrar quantidade maior de escrita por IA nesse tipo de texto, aconselhamos levar isso em conta ao analisar a porcentagem indicada.)
Uma seção de metodologia preenche os três critérios — por isso Turnitin sinalizou toda a minha seção de metodologia é reclamação tão comum. A variação estrutural é baixa porque toda revisão sistemática relata as mesmas etapas. O fraseado se repete ("pesquisamos", "identificamos", "fizemos a triagem"). O texto é paráfrase de descrições de protocolo sem desenvolver ideias novas. A documentação diz para levar a porcentagem em conta quando o texto se encaixa nesses padrões, não para aceitar como definitivo.
Como o Detector Calcula a Pontuação
O pipeline de detecção divide o texto qualificável em segmentos e pontua cada um:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Quando um artigo é enviado ao Turnitin, frases da submissão são extraídas e segmentadas em seções sobrepostas para análise de predição. Cada segmento é classificado pelo modelo de detecção de IA e recebe valor entre 0 e 1, indicando a probabilidade de o texto ser provavelmente humano ou gerado por IA. Cada frase qualificável dentro desses segmentos herda a pontuação do segmento. Como os segmentos se sobrepõem, algumas frases podem ter múltiplas pontuações, que são então combinadas numa única pontuação. Essas pontuações frasais são agregadas e usadas para calcular a pontuação geral de escrita por IA do documento.)
Numa revisão sistemática, os padrões repetitivos da seção de metodologia podem gerar pontuações altas de segmento em múltiplos segmentos sobrepostos. Essas pontuações se agregam numa porcentagem alta a nível de documento. Uma seção de metodologia de 800 palavras pode elevar a pontuação de uma revisão inteira de 5000 palavras. Se acabar revisando, o que dá para reformular e o que precisa ficar exato marca as linhas que não pode mover.
O Que o Detector Realmente Mede
O detector não avalia burstiness, perplexity ou outras métricas nomeadas — afirmação examinada em o Turnitin usa perplexity e burstiness para detectar IA:
"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (Nosso modelo não está explicitamente programado para avaliar sinais específicos como 'burstiness', 'perplexity' ou outras métricas individuais por vezes referidas em discussões públicas.)
A frase seguinte: "Instead, it learns statistical patterns from our training data." (Em vez disso, aprende padrões estatísticos dos nossos dados de treino.)
A mesma fonte explica o que o modelo faz na realidade:
"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (Nossos classificadores são treinados para detectar essas diferenças na probabilidade de palavras e são aptos a reconhecer as sequências de probabilidade de palavras particulares de escritores humanos.)
O detector avalia sequências de probabilidade de palavras. Verifica se as palavras num segmento correspondem a padrões aprendidos de escrita humana ou de texto gerado por IA. Numa seção de metodologia, a sequência de palavras é conduzida pelo modelo de relato. Frases como "pesquisamos as seguintes bases de dados" e "estudos foram incluídos se" aparecem em milhares de artigos. Essas sequências podem se alinhar mais de perto com padrões estatísticos dos dados de treino do que com escolhas de palavras de um escritor individual. Esse alinhamento pode produzir pontuação alta de probabilidade sem envolvimento de IA.
O Que Qualifica Como Texto Analisado
O detector processa apenas texto qualificável:
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Este texto qualificável inclui apenas frases em prosa, ou seja, analisamos apenas blocos de texto escritos em frases gramaticais padrão e não incluímos outros tipos de escrita como listas, tópicos (estruturas curtas não-frasais) ou outras estruturas não-frasais.)
A frase seguinte: "This percentage is not necessarily the percentage of the entire submission." (Essa porcentagem não é necessariamente a porcentagem da submissão inteira.)
Revisões sistemáticas contêm tabelas (diagramas de fluxo PRISMA, tabelas de extração) e listas estruturadas (critérios de inclusão e exclusão). Isso não é prosa qualificável. A porcentagem cobre apenas frases em prosa. Se sua seção de resultados é majoritariamente tabelas, a porcentagem fica ponderada para seções com mais prosa, como metodologia. A documentação também observa:
"The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (O modelo não detecta de forma confiável texto gerado por IA na forma de não-prosa ou código, nem detecta escrita curta/não convencional como tópicos (estruturas curtas não-frasais).)
A frase seguinte: "This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (Isso significa que um documento contendo vários tipos de escrita diferentes resultaria numa disparidade entre a porcentagem e os destaques.)
Uma revisão sistemática é um documento multiformato. A disparidade entre porcentagem e destaques é comportamento esperado.
Segmentos Curtos
Seções de metodologia às vezes são divididas em subseções curtas. Uma subseção de estratégia de busca pode ter só 200 palavras. A documentação alerta:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Em documentos mais curtos com apenas algumas centenas de palavras, a predição será principalmente 'tudo ou nada' porque estamos prevendo num único segmento sem oportunidade de sobreposição.)
A frase seguinte: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Isso significa que algum texto que seja mistura de conteúdo gerado por IA e original pode ser sinalizado como inteiramente gerado por IA.)
Para uma subseção curta, o detector pode prever num único segmento sem sobreposição para moderar a pontuação. Uma subseção escrita por humanos mas que segue modelo pode receber pontuação alta de tudo-ou-nada.
Melhoria de Fronteira do Turnitin
Em 2023, o Turnitin também abordou falsos-positivos nas fronteiras do documento:
"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way. As a result, we have changed our detection logic to help reduce these false positives." (Desde o lançamento, observamos incidência maior de detecção de falsos-positivos nas primeiras ou últimas frases de um documento. Muitas vezes essas frases consistem em conteúdo de introdução ou conclusão escrito de forma genérica. Como resultado, mudamos nossa lógica de detecção para ajudar a reduzir esses falsos-positivos.)
A frase seguinte: "We also worked on making our segment boundaries detection more precise which could lead in some rare cases to change of boundaries compared with a previous version." (Também trabalhamos para tornar nossa detecção de fronteiras de segmento mais precisa, o que pode levar em alguns casos raros a mudança de fronteiras comparado com uma versão anterior.)
Foi uma melhoria de 2023. Introduções e conclusões de revisões sistemáticas seguem modelos (contexto, lacuna, objetivo, resumo de achados). A mudança de lógica abordou esse padrão.
Não Tome a Pontuação Como Única Evidência
A documentação do Turnitin é explícita sobre as limitações:
"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." (Nosso modelo de detecção de escrita por IA pode nem sempre ser preciso — pode identificar incorretamente texto escrito por humanos, gerado por IA e parafraseado por IA —, por isso não deve ser usado como única base para ações adversas contra um estudante.)
A frase seguinte: "It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." (É necessário escrutínio adicional e julgamento humano em conjunto com a aplicação das políticas acadêmicas específicas de uma organização para determinar se ocorreu má conduta acadêmica.)
Uma revisão sistemática com pontuação alta de IA na seção de metodologia não é prova de má conduta. A seção de metodologia se encaixa em padrões de falso-positivo. O detector é um classificador de probabilidade de palavras. A pontuação exige julgamento humano e política institucional. O que seu instrutor deve fazer quando sua porcentagem de IA está alta é a orientação com que o avaliador trabalha.
O Que Isso Significa Para Você
Resumindo:
- Seções de metodologia se encaixam em padrões de falso-positivo: baixa variação estrutural, fraseado repetitivo e texto parafraseado sem ideias novas.
- O detector é um classificador de probabilidade de palavras, não um avaliador de burstiness ou perplexity.
- Apenas prosa qualificável é analisada. Tabelas, listas e tópicos são excluídos.
- Subseções curtas de metodologia enfrentam problema de pontuação tudo-ou-nada.
- Em 2023, o Turnitin melhorou a lógica de detecção para reduzir falsos-positivos nas fronteiras do documento.
- A pontuação não deve ser usada como única base para ações adversas. Exige julgamento humano.
Se receber um relatório de IA do Turnitin sobre uma revisão sistemática e quiser tratar as passagens sinalizadas, importe o relatório e trabalhe nelas. Passagens elegíveis podem ser reanalisadas sem custo.
Continue lendo