Quem executa a verificação de similaridade do seu manuscrito e com o que ele é comparado

Os autores costumam imaginar a verificação como um mecanismo de busca procurando as suas frases na web aberta. O arranjo por trás dela é mais específico do que isso, e alguns dos seus detalhes mudam o que uma passagem correspondente realmente significa.

Equipe HumanPen

· 7 min de leitura

A resposta curta

Se o seu periódico faz parte da Crossref e usa o Similarity Check, a verificação é um serviço que a Crossref presta aos seus membros com tarifas reduzidas, rodando sobre o iThenticate, da Turnitin. Se o seu manuscrito passa ou não por essa verificação específica depende de a editora participar — portanto, é esse o fato a estabelecer primeiro. Onde ela vale: o editor envia o manuscrito e recebe um relatório, você não a executa e normalmente não a vê, a menos que a enviem a você. E a Crossref afirma que os membros participantes têm acesso somente de leitura ao texto completo dos artigos no banco de dados do Similarity Check para fins de comparação, descrevendo esse banco como detentor de mais de 78 million itens de conteúdo acadêmico em texto completo.

Quem a executa de fato

A Crossref descreve o serviço em uma única linha: "A service provided by Crossref and powered by iThenticate—Similarity Check provides editors with a user-friendly tool to help detect plagiarism." (Um serviço fornecido pela Crossref e executado com o iThenticate: o Similarity Check oferece aos editores uma ferramenta fácil de usar para ajudar a detectar plágio.)

Duas palavras dessa frase carregam a maior parte do significado para um autor.

Editores. A ferramenta é descrita como feita para editores, que «enviam um artigo» e recebem de volta "a report highlighting potential matches and indicating if and how the paper overlaps with other work" (um relatório que destaca correspondências potenciais e indica se e como o artigo se sobrepõe a outros trabalhos). A finalidade declarada é "assess the originality of the work before they publish it" (avaliar a originalidade do trabalho antes de publicá-lo). Você não é usuário deste software; você é o objeto dele.

Membros. O Similarity Check é um serviço para membros da Crossref. A Crossref diz que o acordo dá aos membros "reduced-rate access to the iThenticate text comparison software from Turnitin" (acesso com tarifa reduzida ao software de comparação de textos iThenticate, da Turnitin), e que "Only Similarity Check members benefit from this tailored iThenticate experience" (apenas os membros do Similarity Check se beneficiam dessa experiência de iThenticate feita sob medida). Portanto, se o seu manuscrito passa ou não por essa verificação depende de a editora participar — o que é um fato sobre a editora, não sobre a sua área.

Isso também significa que a frase «o periódico fez uma verificação de plágio» descreve pelo menos duas situações diferentes: uma editora dentro desse esquema e uma editora usando algo totalmente distinto. Se lhe derem um número, é justo perguntar qual deles o produziu.

Uma coisa a ter em mente ao ler tudo acima: a Crossref é a organização que presta esse serviço aos seus membros, com taxas de verificação com desconto. As suas descrições são precisas quanto ao que o acordo é, e não são uma avaliação independente de se a verificação vale a pena. Todas as citações neste artigo são descrições do mecanismo, não avaliações dele.

Com o que ele é comparado

O conjunto de comparação é a parte que os autores mais vezes calculam errado.

A Crossref descreve o banco de dados como contendo "over 78 million full-text scholarly content items" (mais de 78 million itens de conteúdo acadêmico em texto completo), e descreve o que a associação proporciona como incluindo "read-only access to the full text of articles in the Similarity Check database for comparison purposes" (acesso somente de leitura ao texto completo dos artigos no banco de dados do Similarity Check para fins de comparação).

Texto completo, não resumos nem metadados. A documentação do iThenticate descreve os alvos de busca de forma ainda mais ampla — dependendo das configurações escolhidas, eles podem incluir "billions of pages of active (and archived) internet information, previously submitted works" (bilhões de páginas de informações ativas e arquivadas da internet e trabalhos já submetidos) e "tens of thousands of periodicals, journals, and publications" (dezenas de milhares de periódicos, revistas e publicações).

Duas consequências que vale guardar:

  • Um artigo atrás de paywall está dentro do conjunto de comparação. O fato de você não conseguir ler algo não diz nada sobre se as suas frases serão comparadas com ele.
  • O conjunto é escolhido a cada verificação. Os alvos de busca são descritos como selecionados para a tarefa, então dois editores avaliando o mesmo manuscrito podem compará-lo com alvos diferentes. Um número de um não é previsão do número do outro.

Para que serve o relatório e para que não serve

A orientação do iThenticate começa avisando que um destaque é uma afirmação sobre sobreposição de texto e nada mais — espera-se que se acenda uma passagem citada corretamente ou uma entrada da sua bibliografia.

A porcentagem em si é aritmética, e a documentação diz isso: conte as palavras que corresponderam a algo e divida pelo número de palavras do manuscrito. A fórmula não dá desconto nenhum por a fonte estar atribuída.

O que não é o mesmo que dizer que a sua bibliografia vai inflá-la necessariamente. O que decide isso é um filtro, e o guia de filtros do iThenticate descreve uma configuração de excluir bibliografia que "automatically identifies and ignores reference lists or bibliographic sections so they don't inflate the similarity percentage" (identifica e ignora automaticamente listas de referências ou seções bibliográficas, para que não inflem a porcentagem de similaridade), além de chaves separadas para o texto entre aspas e para o texto citado. O mesmo manuscrito pode produzir uma porcentagem com a bibliografia dentro ou uma porcentagem com a bibliografia fora, e o número em si não lhe diz qual das duas você tem na mão. É a primeira coisa a perguntar sobre qualquer número que alguém lhe citar.

É por isso que o relatório agrupa as correspondências conforme tenha detectado aspas e uma citação no texto ao redor delas — um passo de reconhecimento com os seus próprios limites documentados, e a razão pela qual dois manuscritos com a mesma porcentagem podem significar coisas completamente diferentes.

O lugar do seu próprio trabalho publicado

O banco de dados é construído a partir do conteúdo registrado pelos membros. A Crossref não detalha a consequência para os autores em nenhuma das suas duas páginas do Similarity Check, portanto trate o passo seguinte como inferência, não como citação: se você publicou com um membro participante, é de se esperar que os seus próprios artigos estejam no corpus com o qual os manuscritos posteriores são comparados, incluindo o seu próximo.

Essa é a explicação comum para um quebra-cabeça com o qual os autores se deparam na segunda vez: um trecho do seu novo artigo corresponde a um artigo que você escreveu. Não é um defeito da verificação. É a verificação funcionando sobre um corpus em que você está.

Nada disso decide se reutilizar o seu próprio texto é aceitável na sua área. Significa apenas que o relatório vai mostrá-lo, e que você deve esperar explicá-lo em vez de se surpreender com ele.

A questão da versão, em resumo

A documentação da Crossref lista caminhos de configuração para o iThenticate v1 e o iThenticate 2.0, incluindo usar o 2.0 diretamente no navegador e por meio da integração com um sistema de acompanhamento de manuscritos, além de um caminho para atualizar do v1 para o 2.0.

O que significa que o relatório que lhe mostram pode vir de uma entre várias interfaces, com diferentes recursos de relatório disponíveis. Se alguém lhe citar um número de um «relatório do Similarity Check», tanto a versão quanto as configurações de exclusão por trás dele são perguntas justas, e são perguntas que mudam o que o número significa.

O que um autor pode realmente fazer com isso

  1. Descubra se o periódico que você tem como alvo participa e do quê. É um fato no nível da editora e costuma constar nas diretrizes para autores.
  2. Conte com texto completo, não com resumos. Tudo o que você parafrasear de perto a partir de um artigo do qual só consegue ver o resumo continua no conjunto de comparação.
  3. Espere que o seu trabalho anterior apareça e esteja pronto para dizer quais partes foram reutilizadas e por quê.
  4. Pergunte quais foram as configurações antes de tratar qualquer porcentagem como uma propriedade do seu manuscrito. Ela é propriedade de uma comparação, e a comparação tem parâmetros.
  5. Não trate o número como a conclusão. A orientação é explícita ao dizer que uma correspondência não é, por si só, uma conclusão; o objeto útil é a lista de correspondências e como cada uma é atribuída.

Se o relatório traz um segundo número

Alguns manuscritos voltam com um indicador de escrita por IA ao lado da cifra de similaridade, quando a licença da editora o inclui. É uma medição separada com um significado separado, e nenhuma quantidade de trabalho de citação a move.

A ferramenta HumanPen cuida apenas desse segundo número. Dê a ela o manuscrito e o relatório, e tudo o que foi destacado é a totalidade do trabalho.

Para o lado da similaridade, o conselho honesto é o sem graça. Atribua, cite corretamente, pergunte quais foram as configurações de exclusão e esteja pronto para explicar a reutilização. Nenhum produto de reescrita deve ser vendido a você como solução para uma lista de referências que deu correspondência.

Perguntas frequentes

Posso executar o Similarity Check no meu próprio manuscrito? Por essa via, não. A Crossref descreve o serviço como destinado a membros, fornecendo aos editores uma ferramenta para verificar artigos; o acesso está vinculado a organizações membros, e não a autores individuais.

Ele compara apenas com artigos de acesso aberto? Não. A Crossref descreve que os membros têm acesso somente de leitura ao texto completo dos artigos no banco de dados do Similarity Check para fins de comparação, e afirma que o banco contém mais de 78 million itens de conteúdo acadêmico em texto completo.

O meu artigo anterior vai aparecer como correspondência? Pode aparecer. O corpus de comparação é construído a partir do conteúdo registrado pelos membros, então os trabalhos já publicados — incluindo os seus — fazem parte daquilo com que um novo manuscrito é comparado.

Dois editores me deram porcentagens diferentes para o mesmo manuscrito. Qual está certo? Potencialmente, os dois. Os alvos de busca são selecionados a cada verificação e o relatório tem configurações de exclusão, então a porcentagem descreve uma comparação específica, e não uma propriedade fixa do seu arquivo.

Continue lendo