Turnitin은 복사해서 붙여넣은 글을 잡아냅니까
이 질문은 서로 다른 두 보고서를 뒤섞고 있습니다. 각각이 실제로 무엇을 찾는지, 사람이 쓴 글을 복사해 붙여넣으면 왜 유사도는 올라가는데 AI 판정은 올라가지 않는지, 그리고 두 점수가 모두 걱정될 때 무엇을 확인해야 하는지를 구분해서 살펴봅니다.
HumanPen 팀
· 9분
짧은 답
Turnitin은 서로 독립적인 두 시스템을 돌립니다. 복사해서 붙여넣은 글을 잡아내는 쪽은 Similarity Report입니다. 제출한 글을 공개된 콘텐츠, 다른 학생의 과제물, 웹 출처로 이루어진 데이터베이스와 비교해 일치하는 문자열을 표시합니다. 복사해 온 출처가 데이터베이스에 있으면 Similarity Report에 그 사실이 나타납니다. AI Writing Report는 복사해서 붙여넣은 글을 잡아내지 않습니다. 이쪽은 산문에서 단어 확률 패턴을 분석해 글이 AI로 작성되었는지를 추정합니다. 책이나 논문에서 복사한, 사람이 쓴 글은 AI 탐지기를 작동시키지 않습니다. 사람의 글은 AI가 만든 글과 확률 패턴이 다르기 때문입니다.
이 두 점수는 서로에게 영향을 주지 않습니다. 각 시스템이 어떻게 작동하는지, 그리고 어딘가에서 글을 붙여넣었다면 그것이 무엇을 뜻하는지를 함께 살펴보겠습니다.
Similarity Report는 복사해 붙여넣은 글을 어떻게 찾아냅니까
대부분의 사람이 "Turnitin이 복사해서 붙여넣은 글을 잡아낼까요"라고 물을 때 실제로 염두에 두는 일을 하는 보고서는 Similarity Report입니다. 이 보고서는 제출한 문서를 가져와 Turnitin의 콘텐츠 모음과 비교합니다. 그 모음에는 공개된 저작물, 웹 페이지, 이전에 Turnitin에 제출된 다른 학생의 과제물이 포함되며, 무엇과 비교되는지에서 이를 더 자세히 풀어 놓았습니다. 시스템이 문서 안에서 데이터베이스의 문자열과 일치하는 문자열을 찾으면 그 일치를 강조 표시하고 유사도 백분율에 반영합니다.
작동 방식은 문자열 일치입니다. 웹사이트에서 문단을, 디지털화되어 색인된 책에서 한 문장을, 또는 이전에 제출된 친구의 과제물에서 한 부분을 붙여넣었다면, 출처가 데이터베이스에 있을 때 Similarity Report가 그 일치를 찾아냅니다. 보고서에는 어떤 문자열이 일치했고 그 문자열이 어느 출처에서 왔는지가 정확히 표시됩니다.
Turnitin의 AI 작성 탐지 기능 FAQ는 이 구분을 직접적으로 밝히고 있습니다:
"The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (유사도 점수와 AI 작성 탐지 비율은 완전히 독립적이며 서로에게 영향을 주지 않습니다.)
같은 페이지의 다음 문장은 이렇습니다:
"The Similarity score indicates the percentage of matching-text found in the submitted document when compared to Turnitin's comprehensive collection of content for similarity checking." (유사도 점수는 제출된 문서를 Turnitin의 유사성 검사용 포괄적 콘텐츠 모음과 비교했을 때 발견된 일치 텍스트의 비율을 나타냅니다.)
이 두 번째 문장은 Similarity Report가 하는 일을 정확히 설명합니다. 일치하는 텍스트를 찾습니다. 그 텍스트를 사람이 썼는지 AI가 썼는지는 평가하지 않습니다. 누가 썼는지는 관심 대상이 아닙니다. 관심 있는 것은 동일한 문자열이 데이터베이스 어딘가에 존재하는지입니다. 그것이 인용 부호와 출처를 제대로 표기한 텍스트도 Similarity Report에 계속 나타나는 이유이기도 합니다.
AI Writing Report의 작동 방식과 복사 붙여넣기를 잡지 못하는 이유
AI Writing Report는 전혀 다른 원리로 작동합니다. 텍스트를 문자열 데이터베이스와 비교하지 않습니다. 모델에 통과시켜 산문 구간에 확률 점수를 매깁니다. FAQ는 그 작동 방식을 이렇게 설명합니다:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (논문이 Turnitin에 제출되면 제출물에서 문장이 추출되어 예측 분석을 위해 겹치는 구간으로 분할됩니다. 각 구간은 AI 탐지 모델이 분류하고 0과 1 사이의 값을 받으며, 이는 텍스트가 사람이 쓴 것인지 AI가 생성한 것인지에 대한 확률을 나타냅니다. 이 구간 안에 있는 대상 문장 각각은 구간의 점수를 물려받습니다. 구간이 겹치기 때문에 여러 개의 점수를 갖는 문장도 있고, 이 점수들은 하나의 점수로 합쳐집니다. 이 문장 점수들은 다시 집계되어 문서 전체의 AI 작성 점수를 계산하는 데 사용됩니다.)
핵심 구절은 "the probability of the text being likely human or AI-generated." (해당 텍스트가 사람이 쓴 것인지 AI가 생성한 것인지에 대한 확률)입니다. 모델은 단어가 어떻게 선택되고 어떻게 배열되는지를 봅니다. AI가 생성한 텍스트는 앞선 맥락을 고려할 때 예측 가능성이 높은 단어를 만들어내는 경향이 있습니다. 언어 모델이 확률이 가장 높은 다음 토큰을 고르기 때문입니다. 사람의 글은 단어 선택에서 예측이 덜 되는 경향이 있습니다. 모델이 읽어내는 것은 바로 이 확률 패턴의 차이입니다.
그래서 복사해 온 사람의 글은 AI 탐지기를 작동시키지 않습니다. 공개된 책에서 문단을 과제물에 붙여넣었다면 그 문단은 사람이 쓴 것입니다. 단어 확률 패턴은 AI가 생성한 텍스트가 아니라 사람의 글처럼 보입니다. 모델은 그것을 사람이 쓴 것으로 분류합니다. AI Writing Report는 표시하지 않습니다.
반대도 마찬가지입니다. AI 도구로 문단을 만들어 과제물에 붙여넣었다면 AI Writing Report는 그것을 표시할 수 있습니다. 그 문단의 확률 패턴이 AI 출력처럼 보이기 때문입니다. 그러나 Similarity Report는 표시하지 않습니다. 그 정확한 문자열은 Turnitin의 공개 콘텐츠 데이터베이스에 없을 가능성이 높기 때문입니다. AI는 새로운 텍스트를 만들어냈습니다. 기존 출처에서 복사한 것이 아닙니다.
이것이 핵심적인 구분입니다. Similarity Report는 이미 다른 곳에 존재하는 텍스트를 잡아냅니다. AI Writing Report는 기계가 만든 것처럼 읽히는 텍스트를 잡아냅니다. 복사 붙여넣기는 유사성의 문제이고, AI 생성은 확률의 문제입니다. 그 확률에 무엇이 들어가는지는 별개의 질문이며, Turnitin이 퍼플렉서티와 버스티니스를 사용하는지는 많은 사람이 그 질문을 던지는 형태입니다.
AI 모델이 실제로 읽는 것과 건너뛰는 것
AI Writing Report의 작동 방식에는 두 번째 층이 있고, 복사 붙여넣기 상황에서는 그것이 중요합니다. 모델은 문서 안의 모든 것을 분석하지 않습니다. FAQ는 이렇게 말합니다:
"The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (이 모델은 산문이 아닌 형태나 코드 형태의 AI 생성 텍스트를 안정적으로 탐지하지 못하며, 글머리 기호처럼 짧은 형식이나 비정형의 글, 즉 문장이 아닌 짧은 구조도 탐지하지 않습니다.)
다음 문장은 이렇습니다:
"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (이는 여러 가지 서로 다른 글쓰기 유형을 담은 문서에서는 백분율과 강조 표시 사이에 불일치가 생긴다는 뜻입니다.)
FAQ는 무엇이 분석 대상인지도 명시합니다:
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (이 대상 텍스트에는 산문 문장만 포함됩니다. 즉, 표준적인 문법을 갖춘 문장으로 쓰인 텍스트 덩어리만 분석하며, 목록, 글머리 기호, 즉 문장이 아닌 짧은 구조, 또는 그 밖의 문장이 아닌 구조와 같은 다른 유형의 글은 포함하지 않습니다.)
다음 문장은 이렇습니다:
"This percentage is not necessarily the percentage of the entire submission." (이 백분율이 반드시 제출물 전체의 백분율인 것은 아닙니다.)
실질적인 의미는 이렇습니다. 글머리 기호 목록, 데이터 표, 코드 블록을 복사해 붙여넣었다면 AI 모델은 그것을 아예 읽지 않을 수도 있습니다. 분석을 실행하기 전에 산문이 아닌 내용을 걸러내기 때문입니다. 반면 Similarity Report는 모든 것을 읽습니다. 문서 전체를 대상으로 문자열 일치를 수행하기 때문에, 붙여넣은 목록이나 붙여넣은 코드 블록도 붙여넣은 문단과 마찬가지로 쉽게 잡아냅니다.
따라서 출처에서 산문이 아닌 내용을 붙여넣으면 결과는 비대칭적입니다. Similarity Report는 잡아냅니다. AI Writing Report는 잡아내지 못합니다. 애초에 보지 못하기 때문입니다.
복사해 온 사람의 글이 한 보고서에는 나타나고 다른 보고서에는 나타나지 않는 이유
두 작동 방식을 합치면 학생들이 가장 자주 묻는 상황이 설명됩니다. 웹사이트나 책에서 문단을 찾았습니다. 그것을 과제물에 붙여넣었습니다. 유사도 점수도 AI 점수도 걱정됩니다. 이때 일어나는 일은 다음과 같습니다.
Similarity Report는 출처가 데이터베이스에 있다면 붙여넣은 문단을 표시합니다. 문자열이 일치합니다. 백분율이 올라갑니다. 출처가 특정됩니다. 보고서가 자기 일을 하고 있는 것입니다.
AI Writing Report는 원문이 사람이 쓴 것이라면 붙여넣은 문단을 표시하지 않습니다. 모델은 그 문단을 산문으로 읽고 구간에 확률 점수를 매긴 뒤 단어 선택이 사람의 글처럼 보인다고 판단합니다. 문단은 사람이 쓴 것으로 분류됩니다. AI 표시는 없습니다.
이는 붙여넣은 텍스트가 길어도 마찬가지입니다. AI 모델은 텍스트가 어디에서 왔는지에는 관심이 없습니다. 관심 있는 것은 텍스트가 어떻게 읽히는지입니다. 1990년대 학술 논문에서 복사한 문단은 1990년대 사람의 학술 산문이 가진 단어 확률 패턴을 갖고 있습니다. AI가 생성한 텍스트는 그렇게 보이지 않습니다.
FAQ는 이 독립성을 분명히 밝힙니다. Turnitin은 이렇게 말합니다: "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (유사도 점수와 AI 작성 탐지 비율은 완전히 독립적이며 서로에게 영향을 주지 않습니다.) 붙여넣은 텍스트로 인한 높은 유사도 점수가 AI 점수를 끌어올리지는 않습니다. 생성된 텍스트로 인한 높은 AI 점수가 유사도 점수를 끌어올리지도 않습니다. 둘은 서로 다른 것을 찾는 서로 다른 시스템이 계산합니다. 그것이 두 점수를 같은 것으로 읽어서는 안 되는 이유입니다.
두 점수가 모두 걱정될 때 이것이 뜻하는 바
어딘가에서 텍스트를 붙여넣고 두 보고서를 함께 보고 있다면, 이렇게 읽으시면 됩니다.
붙여넣은 텍스트가 Similarity Report에 나타난다면 그것은 예상된 일입니다. 시스템이 일치를 찾아낸 것입니다. 자신의 말로 바꿔 쓰거나, 인용 부호와 출처를 붙여 제시하거나, 삭제해야 합니다. 인용 부호와 출처를 붙이는 방식은 붙여넣은 텍스트가 정당해지는 유일한 경우입니다. Turnitin은 여전히 일치를 보여주겠지만, 담당 교수는 그것이 제대로 출처 표기되었다는 것을 알 수 있습니다.
붙여넣은 텍스트가 사람이 쓴 것인데 AI Writing Report를 확인하고 있다면, 거기에는 표시가 없어야 합니다. 표시가 있는데 그 텍스트가 실제로 사람의 출처에서 온 것이라면 그것은 오탐입니다. AI 모델은 확정이 아니라 확률을 추정하는 도구입니다. 잘못 분류할 수도 있습니다. 하지만 더 흔한 설명은, 표시된 것이 붙여넣은 텍스트가 아니라는 것입니다. 실제로 강조 표시된 텍스트를 읽어 보십시오. 붙여넣은 부분 자체가 아니라 그 옆에 있는 자신의 글일 수 있습니다.
AI 도구로 텍스트를 만들어 붙여넣었다면 상황은 뒤집힙니다. Similarity Report는 아마 표시하지 않을 것입니다. 문자열이 새 것이기 때문입니다. AI Writing Report는 표시할 수 있습니다. 확률 패턴이 모델이 인식하도록 학습된 것이기 때문입니다.
무엇을 해야 합니까
Turnitin이 복사해서 붙여넣은 글을 잡아내는지 궁금해하는 분들을 위한 요약입니다:
- Similarity Report는 복사 붙여넣기를 잡아냅니다. 데이터베이스와 문자열 일치를 수행합니다. 출처가 데이터베이스에 있으면 붙여넣은 텍스트는 일치로 나타납니다.
- AI Writing Report는 복사 붙여넣기를 잡아내지 않습니다. 산문의 단어 확률 패턴을 분석합니다. 복사해 온 사람의 글은 사람의 글로 읽히므로 표시되지 않습니다.
- 두 점수는 서로 독립적입니다. 유사도 점수가 높다고 해서 AI 점수가 높아지는 것은 아니며, 그 반대도 마찬가지입니다.
- 목록, 코드, 표처럼 산문이 아닌 내용을 붙여넣었다면 Similarity Report는 그것을 잡아낼 수 있지만, AI 모델은 분석조차 하지 않을 수 있습니다. 산문 문장만 읽기 때문입니다.
- AI가 생성한 텍스트를 붙여넣었다면 Similarity Report가 잡아내지 않더라도 AI Writing Report는 그것을 표시할 수 있습니다. 문자열은 새 것이지만 확률 패턴은 알아볼 수 있기 때문입니다.
각 시스템이 무엇을 찾는지 알고 나면 이 구분은 더 이상 미묘하지 않습니다. 유사성 검사는 이미 존재하는 문자열을 찾습니다. AI 탐지는 산문의 확률 패턴을 찾습니다. 복사 붙여넣기는 문자열의 문제이고, AI 생성은 패턴의 문제입니다.
계속 읽기