영어 논문에서 AI 비율을 낮추려면? Turnitin 이 무엇을 검사하는지부터 이해하세요

AI 비율을 낮추려면 먼저 탐지기가 무엇을 보는지 알아야 합니다. Turnitin 은 일반적인 산문 문장만 분석합니다. 단어 확률을 기준으로 분류하며, burstiness 나 perplexity 를 쓰지 않습니다. 구조가 단조롭거나 반복적인 텍스트는 오탐지될 가능성이 더 높습니다.

HumanPen 팀

· 4분

어떤 텍스트가 잘못 탐지될까

고치기 전에 한 가지는 명확히 해두세요. 탐지된 텍스트가 모두 AI 가 쓴 것은 아닙니다. 어떤 특징이 오탐지를 부르는 겁니다. Turnitin FAQ 에 이렇게 나와 있습니다:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (구조적 다양성이 부족하거나, 글자 그대로 반복되거나, 새로운 아이디어 없이 paraphrase 된 텍스트는 오탐지될 수 있습니다)
"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (이러한 텍스트에서 AI 작성 비율이 높게 나왔다면, 표시된 퍼센트를 해석할 때 이 점을 고려하시기 바랍니다)

즉, 글의 구조 변화가 적거나, 글자 그대로 반복되거나, 새 아이디어 없이 고쳐쓴 경우 탐지기가 AI 비율을 높게 잡을 수 있습니다. AI 를 썼다는 뜻이 아니라, 이런 특징들이 AI 생성 텍스트의 통계적 패턴과 겹친다는 뜻입니다.

그 FAQ 문장은 초고를 스스로 점검할 세 가지를 줍니다. 완성된 단락의 속성만 따집니다: 구조가 변화하는가, 반복되는가, 앞 단락이 다루지 않은 논지를 각 단락이 새로 전개하는가. 거기에 이르기까지 어떤 편집을 썼는지는 말하지 않습니다. 실제로 통계를 바꾸는 편집은 여기 에 손으로 직접 해보는 시도로 정리해 두었습니다.

Turnitin 은 산문 문장만 분석합니다

논문 전체가 다 분석되는 건 아닙니다. FAQ 에 이렇게 나와 있습니다:

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (이 조건은 산문 문장에만 적용됩니다. 즉, 표준 문법적 문장으로 쓰인 텍스트 블록만 분석하며, 목록, 불릿 포인트 (짧은 비문장 구조) 등 다른 유형의 글쓰기는 포함하지 않습니다)

목록, 불릿 포인트, 짧은 비문장 구조는 분석 범위를 벗어납니다. 리포트에 퍼센트가 떴다면, 그건 문서 전체가 아니라 산문 문장만 기준으로 매긴 겁니다.

여기서 전략도 나옵니다: 주장이 담긴 산문 단락이 바로 탐지기의 대상입니다. 고칠 때는 그 단락에 집중하세요. 목록이나 표는 AI 탐지를 걱정할 필요 없습니다. 그 단락 안에서 어떤 문장은 그대로 둬야 하는지는 별개 문제입니다: 어디까지 고쳐도 되고, 어디는 그대로 둬야 하는지 를 따로 확인하세요.

분류기가 점수를 매기는 방식

탐지기가 어떻게 점수를 매기는지 알면, 왜 어떤 편집은 먹히고 어떤 건 안 되는지 이해가 됩니다. Turnitin 은 이렇게 설명합니다:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (論文이 Turnitin 에 제출되면, 제출된 텍스트에서 문장이 추출되어 예측 분석을 위해 중복되는 구간으로 나뉩니다. 각 구간은 AI 탐지 모델로 분류되며, 0 에서 1 사이의 값을 받아 텍스트가 인간 작성 또는 AI 생성일 확률을 나타냅니다)

각 구간은 0 에서 1 사이 값을 받습니다. AI 생성 확률을 나타내죠. 그런데 이 모델은 블로그에서 흔히 보는 지표로 작동하지는 않습니다:

"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions." (우리 모델은 공개적으로 논의되곤 하는 'burstiness', 'perplexity'나 기타 개별 지표를 평가하도록 명시적으로 프로그래밍되지 않았습니다)
"Instead, it learns statistical patterns from our training data." (대신 학습 데이터에서 통계적 패턴을 배웁니다)

핵심 신호는 단어 확률입니다:

"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (우리의 분류기는 이러한 단어 확률 차이를 탐지하도록 훈련되었으며, 인간 작가의 특유한 단어 확률 시퀀스를 식별하는 데 능숙합니다)

앞서 본 오탐지 설명을 여기에 붙이면: 구조가 단조롭고 반복적인 텍스트가 잡히는 건 겉모습이 AI 같아서가 아니라, 단어 확률 시퀀스가 AI 생성 텍스트와 닮았기 때문입니다. 인간 글은 단어 선택에서 예측 불가능성이 더 크고, AI 글은 확률이 높은 단어를 고르는 경향이 있습니다. perplexity 와 burstiness 넘어 AI 탐지기가 실제로 재는 것 에서 더 길게 설명합니다.

AI 비율을 낮추는 실전 방법

여기까지 정리하면:

  1. 목록 말고 산문 단락을 고치세요. 탐지기는 일반 산문 문장만 분석합니다. 목록, 불릿 포인트, 표 안의 짧은 구조는 분석 범위 밖입니다.
  2. 구조 변화를 늘리세요. 구조 변화 부재는 오탐지의 흔한 원인입니다. 단락마다 길이와 문장 구조가 비슷하다면, 문장 길이와 통사 패턴을 다양하게 바꿔보세요.
  3. 반복을 줄이세요. 글자 그대로의 반복은 AI 점수를 올립니다. 두 단락이 같은 말을 한다면 합치거나, 두 번째 단락이 논지를 실제로 앞으로 나가게 만드세요.
  4. 단어 말고 아이디어를 발전시키세요. FAQ 가 지적하는 건 '새 아이디어 없이' 개작한 경우입니다. 즉 검사 기준은 단락이 전에 없던 무엇을 이제 갖게 되었는가입니다. 그 과정에 어떤 편집을 썼는지는 말하지 않으며, 더 명확한 단어를 고르는 건 어떤 고치기에서도 자연스러운 일입니다.
  5. 점수 단위를 이해하세요. 각 구간이 따로 채점되므로, 한 단락이 잡혔다고 논문 전체가 AI 라는 뜻은 아닙니다. 리포트는 전체 판단이 아니라 구간별 확률을 줍니다.

이게 당신에게 의미하는 것

AI 비율을 낮추는 건 맞갖은 툴이나 프롬프트 찾기가 아닙니다. 탐지기가 무엇을 검사하는지 이해하는 데서 시작합니다. Turnitin 은 산문 문장만 분석합니다. 목록과 짧은 구조는 범위 밖입니다. 모델은 burstiness 나 perplexity 가 아니라 단어 확률 시퀀스로 분류하며, 각 구간이 따로 채점됩니다. 구조 변화가 거의 없고, 글자 그대로 반복되며, 새 아이디어 없이 개작한 텍스트일수록 오탐지되기 쉽습니다.

리포트를 받으면 어떤 산문 단락이 잡혔는지 확인하고, 그 부분에 집중하세요: 구조를 다양하게, 반복을 줄이고, 실체 있는 논지를 전개하세요. 목록이나 표, 인용문은 손댈 필요 없습니다. 안 건드린 텍스트는 그대로 두는 것—이게 Turnitin 리포트에서 잡힌 단락만 고치기 의 핵심입니다.

계속 읽기