O Turnitin marcou toda a minha seção de metodologia

A pergunta que realmente importa não é por que o modelo acha que você colou no capítulo três. É por que o realce chegou como um bloco contínuo e do que exatamente essa porcentagem é porcentagem.

Equipe HumanPen

· 13 min de leitura

Resposta curta

Porque a pontuação não chega nas suas sentenças uma por uma. A descrição publicada da Turnitin diz que a submissão é cortada em segmentos sobrepostos, cada segmento recebe uma probabilidade e toda sentença que se qualifica herda a pontuação dos segmentos em que está inserida. Alimente o sistema com um trecho de escrita que mantém o mesmo registro, as mesmas estruturas de frase e o mesmo vocabulário por duas mil palavras e não sobra muito para os segmentos vizinhos discordarem. O realce então tende a chegar como uma faixa, não como pontos espalhados. Metodologia e materiais é a seção escrita assim de propósito, e o próprio relato da Turnitin sobre onde seus falsos positivos se concentram nomeia duas propriedades que o gênero é obrigado por convenção a ter. Isso não quer dizer que o número esteja errado. Quer dizer que uma parede vermelha cobrindo uma seção não são quarenta veredictos separados sobre quarenta sentenças, e ler como se fosse vai mandar você consertar a coisa errada.

Por que chega como um bloco

O que as pessoas descrevem é específico e tem sempre a mesma cara. A revisão de literatura está limpa. A discussão está limpa. Aí o capítulo de metodologia abre e o realce começa na primeira frase abaixo do título e não para até o capítulo terminar. Isso parece menos um modelo achando passagens suspeitas e mais um modelo achando um capítulo suspeito, e é por isso que é tão perturbador olhar.

A Turnitin publica como uma pontuação chega numa sentença, e vale a pena ler as duas frases do meio dessa descrição em vez do resumo:

"Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score." ("Cada sentença qualificada dentro desses segmentos herda a pontuação do segmento. Como os segmentos se sobrepõem, algumas sentenças podem ter múltiplas pontuações, que são então agrupadas numa única pontuação.")

Então a unidade sendo classificada é uma janela de texto, não uma sentença. Uma sentença é pontuada pela companhia que mantém. O que segue disso é nossa leitura, não algo que a Turnitin publica: onde sentenças consecutivas compartilham janelas e as janelas se parecem, as pontuações que essas janelas produzem têm pouca razão para divergir, e o realce derivado delas sai contíguo. Uma faixa é a renderização esperada de um trecho uniforme. Não é uma contagem de achados independentes.

Isso tem uma borda prática. A primeira sentença realçada no seu capítulo de metodologia não é necessariamente onde alguma coisa começou, porque um segmento atravessando o título contém o último parágrafo do que quer que veio antes. As pessoas gastam tempo de verdade encarando a primeira sentença marcada tentando descobrir o que tem de errado com ela especificamente. Sob a descrição publicada, pode não ter nada de errado com ela especificamente.

Também quer dizer que a aritmética que as pessoas alcançam não existe. Você não pode dividir uma faixa pelas suas sentenças e chegar num custo por sentença, e não pode subtrair uma sentença e prever o que acontece. Desmontamos isso contra as três versões mais circuladas em se eu reescrever uma sentença marcada, a pontuação cai.

O limite honesto sobre tudo isso: a Turnitin publicou a forma do pipeline e não a função de agrupamento, a agregação ou o comprimento do segmento. Tudo acima é o que a descrição publicada implica sobre distribuição. Nada disso deixa alguém prever um número.

Quanto do seu capítulo de metodologia está sendo pontuado

A segunda coisa a estabelecer é o denominador, porque dois capítulos de metodologia contendo a mesma informação podem apresentar ao modelo quantidades de texto completamente diferentes. A Turnitin só analisa o que chama de texto qualificado:

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." ("Este texto qualificado inclui apenas sentenças em prosa, ou seja, analisamos apenas blocos de texto escritos em sentenças gramaticais padrão e não incluímos outros tipos de escrita como listas, marcadores (estruturas curtas que não são sentenças) ou outras estruturas que não são sentenças.") A frase imediatamente depois é a que importa aqui: "This percentage is not necessarily the percentage of the entire submission." ("Esta porcentagem não é necessariamente a porcentagem da submissão inteira.")

Agora olhe como sua disciplina realmente escreve essa seção. Um protocolo de laboratório chega como passos numerados, uma tabela de reagentes, uma lista de instrumentos e um bloco de configurações. Um capítulo de metodologia de psicologia ou educação chega como parágrafos contínuos: participantes, materiais, procedimento, análise, cada um uma sequência de sentenças completas. São duas submissões diferentes no que tange à análise, e a segunda é a que volta sólida.

Como a seção está organizadaO que entra no texto qualificadoDo que a porcentagem trata então
Passos numerados, tabelas de parâmetros, listas de equipamentos, equaçõesPouco, já que a maioria não são sentenças gramaticais padrãoPrincipalmente a prosa em outras partes do arquivo, não esta seção
Parágrafos contínuos descrevendo participantes, materiais e procedimentoEfetivamente tudoUma amostra feita quase inteiramente de prosa procedural convencional
Prosa de forma longa dentro de uma célula de tabelaÉ processada. Uma nota de release datada de 9 de agosto de 2023 anunciou que o modelo podia lidar com prosa de forma longa em tabelas, e acrescentou que submissões existentes precisam ser reenviadas antes de serem reprocessadasO mesmo que parágrafos comuns, o que surpreende quem moveu texto para uma tabela por outros motivos

Tem uma consequência contraintuitiva na linha do meio. Ser excluído do texto qualificado não é um desconto. Remove os passos numerados e as tabelas de valores, que nunca iam parecer prosa gerada, e deixa para trás a parte da sua escrita que é mais convencional. Quanto mais estreita a amostra qualificada, mais completamente o número é uma declaração sobre seus parágrafos procedurais especificamente.

Uma exclusão vai para o outro lado e vale conhecer porque remove um alarme falso comum: a mesma nota de release de 2023 registra que realce dentro de uma bibliografia era um bug, que bibliografias agora são excluídas quando o AI Writing Report é processado, e que submissões com seções de referência destacadas precisam ser reenviadas para reprocessar. Se você está olhando um relatório antigo com a lista de referências iluminada, é disso que está olhando.

A lacuna entre o número e a quantidade de realce na página vem de tudo isso, e a Turnitin diz diretamente em vez de deixar ser inferido. Como ler um AI Writing Report da Turnitin trabalha essa lacuna; o Turnitin pode verificar uma tese inteira cobre o que acontece nos limites de comprimento, onde vivem as submissões em nível de capítulo.

O gênero responde à própria lista da fornecedora

A Turnitin publica um relato do que seus falsos positivos tendem a ter em comum. Verbatim:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." ("Às vezes falsos positivos (marcar incorretamente texto escrito por humano como gerado por IA) podem incluir conteúdo sem muita variação estrutural, texto que literalmente repete a si mesmo, ou texto que foi parafraseado sem desenvolver novas ideias.")

A frase depois não é endereçada a você:

"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." ("Se nosso indicador mostra uma quantidade maior de escrita por IA em tal texto, aconselhamos que você leve isso em consideração ao olhar a porcentagem indicada.")

Dois dos três itens dessa lista descrevem coisas que uma seção de metodologia é suposta fazer. Variação estrutural é o que uma checklist de relatório gasta tempo removendo: o mesmo quadro para cada medição, a mesma ordem de subseções, a mesma construção para cada instrumento para que dois procedimentos descritos identicamente possam ser comparados. Repetição literal é como você sinaliza que duas condições foram realmente tratadas da mesma forma. Esta é a única seção de uma tese onde escrever a mesma forma de sentença onze vezes está correto, e também é a seção onde fazer isso é custoso de desfazer. O que você pode e não pode reescrever com segurança lá é um problema separado com suas próprias regras, em o que você pode reformular em metodologia e resultados, e a questão mais ampla de se ajustar sua escrita é em você deve mudar como escreve.

Se você verificou a seção sozinha, mediu outra coisa

Muito do pânico nessa situação vem de uma autoverificação em vez de um relatório institucional: o capítulo é colado em alguma coisa, ou submetido sozinho a uma tarefa de verificação de rascunho, e volta com um número que ninguém quer ver.

A Turnitin descreve submissões curtas se comportando de modo diferente em tipo, não só em grau:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." ("Em documentos mais curtos onde há apenas algumas centenas de palavras, a previsão será principalmente 'tudo ou nada' porque estamos prevendo em um único segmento sem oportunidade de sobreposição.") E a frase que segue: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." ("Isso significa que algum texto que é uma mistura de conteúdo gerado por IA e original pode ser marcado como inteiramente gerado por IA.")

Um capítulo de metodologia submetido sozinho é candidato para essa zona, e mais do que sua contagem de palavras sugere, porque os passos numerados e tabelas saem do denominador primeiro. Também tem um piso embaixo: um AI Writing Report precisa de pelo menos 300 palavras de prosa em formato de forma longa, então uma seção de metodologia curta sozinha pode não produzir relatório nenhum em vez de um baixo. E abaixo do limiar de exibição não tem nada para ler: resultados acima de 0% e abaixo de 20% são mostrados como um asterisco sem número e sem realces, o que significa que uma melhoria real e nenhuma melhoria parecem idênticos de onde você está.

O que uma seção vermelha não resolve

É tentador pegar o mecanismo acima e tratar como um achado a seu favor. Não é. Tudo nesta página explica do que o número é uma medição. Nada disso é evidência sobre quem escreveu seu capítulo, e corta nos dois lados: uma faixa na sua seção de metodologia não é prova de nada, e também não é uma explicação de por que faixas acontecem.

"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." ("Nosso modelo de detecção de escrita por IA pode não ser sempre preciso (pode identificar erroneamente texto escrito por humano, gerado por IA e parafraseado por IA), então não deve ser usado como única base para ações adversas contra um estudante.") A próxima frase é onde o peso está: "It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." ("É necessário escrutínio adicional e julgamento humano em conjunto com a aplicação de políticas acadêmicas específicas da organização para determinar se má conduta acadêmica ocorreu.")
  • Uma faixa é uma distribuição, não uma contagem. Diz que as pontuações do modelo foram uniformes naquele trecho. Não diz quão confiante alguma delas estava.
  • A porcentagem é sobre prosa qualificada, então não é comparável entre dois capítulos organizados de forma diferente, e somar porcentagens de capítulos produz um número que não se refere a nada.
  • O relatório é gerado por um sistema que o próprio fornecedor diz poder identificar texto erroneamente, o que é uma razão para uma pessoa olhar em vez de uma razão para descartar a saída.
  • Nada disso é verificável por você na maioria das configurações. O indicador e relatório não são visíveis para estudantes, embora um instrutor possa baixar o relatório como PDF e compartilhar.

Não leve este artigo para uma reunião como um argumento. Explicar um classificador para alguém que já leu as mesmas páginas de ajuda tende a parecer preparação em vez de resposta, e move a conversa para um terreno onde você está argumentando sobre um modelo em vez de sobre seu trabalho. O que realmente tem peso é procedência: rascunhos, o protocolo, o arquivo de análise, as datas. Marcado, mas você escreveu cobre que evidência vale a pena montar, a conversa depois de uma marcação de IA cobre o que a reunião é proceduralmente, e histórico de versão como evidência cobre onde o registro vive se você não pensou sobre isso antes.

Se a seção vai ser revisada de qualquer forma

Às vezes a decisão já foi feita, por um orientador ou por você, e a pergunta vira como fazer sem quebrar nada. Metodologia é a pior seção numa tese para reformular casualmente. Ordem, tempo, dose, equipamento, configurações, regras de decisão, população de análise e exclusões são o conteúdo, e uma sentença fluente que silenciosamente deixa cair um deles é um defeito real onde uma sentença rígida não era.

O custo que as pessoas subestimam não é a reescrita. É a reverificação. Cada parágrafo que é tocado é um parágrafo que você agora tem que ler contra o protocolo, o código de análise e as tabelas. Um plano que toca um capítulo inteiro criou um trabalho de revisão do tamanho de um capítulo, e é por isso que o escopo da mudança importa mais que o método usado para fazê-la.

É essa a parte que o HumanPen é construído em volta. Importe o AI Writing Report do Turnitin ou iThenticate para aquela submissão e as passagens que marca viram o escopo: só aquele texto é reescrito, o resto fica congelado, e a própria descrição do site da regra do parágrafo é que "a paragraph is the smallest unit the engine rewrites: if your selection covers only part of one, it is expanded to the full paragraph and shown that way for you to confirm" ("um parágrafo é a menor unidade que o mecanismo reescreve: se sua seleção cobre apenas parte de um, ele é expandido para o parágrafo completo e mostrado assim para você confirmar"). Fórmulas, figuras e estruturas de tabela não são parte da reescrita de texto, o que importa mais nesta seção que em qualquer outra do documento. A cobrança conta as palavras efetivamente reescritas em vez do arquivo que você enviou. Resultados elegíveis podem continuar baixando IA de graça.

O que nada disso é, é uma previsão. O modelo da Turnitin muda, as regras de exibição já mudaram antes, e não temos como te dizer o que seu próximo relatório vai dizer. As afirmações acima são sobre quais palavras são tocadas e quais são cobradas, que são as duas coisas que podemos realmente controlar.

Perguntas frequentes

Por que minha seção de metodologia inteira está destacada se eu escrevi cada palavra? Porque a unidade de classificação é um segmento sobreposto, não uma sentença, e sentenças herdam e agrupam as pontuações dos segmentos que as contêm. Um trecho longo escrito num mesmo registro dá aos segmentos adjacentes pouco para diferenciar, então a saída tende a ser contígua. Isso é uma descrição de como uma faixa se forma, não uma declaração de que sua faixa particular é um falso positivo.

Um bloco sólido de realce significa que cada sentença nele foi julgada como IA? Não, e a descrição publicada é a razão. Uma sentença carrega uma pontuação que herdou dos segmentos em que está, possivelmente mais de um, agrupados. Ler uma faixa como uma lista de veredictos individuais é o erro que leva a planos de edição sentença por sentença.

Minha seção de metodologia é principalmente passos numerados e uma tabela de parâmetros. Por que a porcentagem ainda está alta? Esses podem não estar na análise de jeito nenhum. A Turnitin analisa texto qualificado, significando prosa escrita em sentenças gramaticais padrão, e afirma que a porcentagem não é necessariamente a porcentagem da submissão inteira. Excluir os passos e tabelas deixa os parágrafos convencionais para trás como a amostra que o número descreve.

Devo adicionar variedade à minha seção de metodologia para parecer menos repetitiva? Isso é uma questão sobre os padrões de relatório da sua disciplina antes de ser uma questão sobre um detector, e a repetição numa seção de metodologia geralmente está fazendo um trabalho. O próprio conselho da fornecedora sobre texto com essas propriedades é dirigido à pessoa lendo o relatório, não à pessoa que escreveu.

Passei o capítulo por um verificador sozinho e peguei um número muito alto. É esse número que meu orientador vê? Não necessariamente, porque é uma submissão diferente. A Turnitin diz que previsões em documentos de algumas centenas de palavras saem principalmente tudo ou nada, já que tem um único segmento sem sobreposição, e que conteúdo misto nessa situação pode ser marcado como inteiramente gerado por IA. Um capítulo também é um denominador diferente de um arquivo inteiro.

Posso citar a lista de falsos positivos da fornecedora como defesa? É uma declaração publicada sobre os modos de erro da ferramenta e é direcionada a quem lê a porcentagem, então é justo saber que existe. Não é evidência sobre seu documento, e levar um mecanismo para uma conversa de má conduta como argumento tende a funcionar contra você. Traga os rascunhos e o protocolo.