왜 내 논문의 섹션마다 AI 비율이 다르게 뜨나요? Turnitin 의 감지 파이프라인 설명
AI Writing Report 를 열어보면 한 섹션은 60% 로 뜨는데 다른 섹션은 0% 일 수 있습니다. 아니면 3 페이지 일부에만 강조 표시가 되고 5 페이지에는 아무것도 표시되지 않을 수도 있습니다. 처음엔 보고서에 문제가 생긴 줄 알겠지만, 실제로는 그렇지 않습니다. Turnitin 은 문서를 문장 단위로 점수를 매긴 후 이 점수들을 합산하여 전체 비율을 계산합니다. 섹션마다 길이와 문장 밀도가 다르기 때문에 결과가 달라지는 것이 당연합니다. 이 글에서는 Turnitin 의 공식 작동 방식과 강조 표시의 실제 의미, 그리고 AI 비율이 유사성 점수와 일치하지 않는 이유를 설명합니다.
HumanPen 팀
· 5분
간단한 답변
같은 논문 내에서도 섹션마다 AI 점수가 다른 이유는 Turnitin 이 문서를 문장 단위로 점수 매긴 뒤 그 점수들을 합산하여 전체 비율을 산출하기 때문입니다. Turnitin 의 안내서에 따르면 이 과정은 제출된 문장에서 문장을 추출하고 중복되는 섹션으로 나눈 뒤 각 섹션을 점수화하고 각 문장에 점수를 할당하며 문장 점수들을 종합하여 문서 전체 점수를 계산하는 방식입니다. 짧고 밀도 있는 섹션과 길고 회화적인 섹션은 Submission Breakdown 에서 서로 다르게 나타나는데 이는 보고서의 오류가 아니라 의도된 작동 방식입니다.
감지기가 실제로 논문을 읽는 방식
공식 "Using the AI Writing Report" 가이드에서는 감지 작동 방식을 이렇게 설명합니다:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis."(논문이 Turnitin 에 제출되면 제출문의 문장들이 추출되어 예측 분석을 위해 겹치는 섹션들로 분할됩니다.)
"Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated."(각 세그먼트는 AI 감지 모델에 의해 분류되며 텍스트가 인간이 작성했거나 AI 가 생성했을 확률을 나타내는 0 에서 1 사이의 값이 부여됩니다.)
Turnitin 공식 블로그에서는 세분화 세부사항을 이렇게 덧붙입니다:
"The submission is first broken into segments of text that are roughly a few hundred words (about five to ten sentences). Those segments are then overlapped with each other to capture each sentence in context."(제출문은 먼저 대략 수백 단어 (약 5~10 문장) 분량의 텍스트 세그먼트로 나뉩니다. 그런 다음 각 세그먼트는 서로 겹쳐져서 각 문장이 문맥 안에서 포착됩니다.)
즉, 현재 보고 있는 보고서는 가장 작은 단위인 문장 수준의 점수부터 시작해 섹션별 뷰로 통합되고 최종적으로 상단의 단일 비율로 종합되는 방식으로 구성되었습니다.
섹션마다 결과가 다르게 나오는 이유
공식 가이드는 이어 이렇게 설명합니다:
"Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score."(이들 세그먼트 내의 각 자격 있는 문장은 세그먼트의 점수를 물려받습니다. 세그먼트가 겹치기 때문에 일부 문장은 여러 점수를 가질 수 있으며 이를 단일 점수로 통합합니다. 이들 문장 점수는 다시 집계되어 문서 전체 AI 글쓰기 점수를 계산하는 데 사용됩니다.)
이러한 메커니즘에서 세 가지 결과가 나옵니다:
- 각 섹션의 점수는 포함된 문장들의 특성에 따라 결정됩니다. 짧고 템플릿 같은 문장이 많은 섹션은 길고 다양한 문장이 있는 섹션과 다른 점수를 받게 됩니다.
- 섹션 길이도 중요합니다. Submission Breakdown 은 각 영역이 얼마나 많은 자격 있는 텍스트를 포함하는지에 따라 음영을 다르게 표시합니다. 5 페이지 섹션은 문장별 패턴이 비슷하더라도 1 페이지 섹션보다 훨씬 더 많은 하이라이트된 텍스트를 보여줄 수 있습니다.
- 겹치기 풀링 방식 때문에 두 섹션의 경계에 있는 문장은 통합된 점수를 가질 수 있으므로 하이라이트의 정확한 경계가 엄격한 판정 경계는 아닙니다.
이 모든 것은 보고서 오류가 아닙니다. 이는 Turnitin 이 설명하는 방식으로 집계 시스템이 정상적으로 작동하고 있는 것입니다.
AI 비율과 유사성 점수는 서로 독립적입니다
가장 흔한 오해 중 하나는 AI '점수'를 유사성 비율과 마치 동일한 것을 나타내는 두 가지 측정치인 것처럼 비교한다는 점입니다. Turnitin 가이드는 이 둘이 완전히 별개임을 명확히 합니다:
"The percentage generated by Turnitin's AI writing detection model is different from and independent of the similarity score."(Turnitin 의 AI 글쓰기 감지 모델이 생성한 비율은 유사성 점수와 다르며 독립적입니다.)
"AI writing highlights are not visible in the Similarity Report."(AI 글쓰기 하이라이트는 Similarity Report 에 표시되지 않습니다.)
유사성 40% 에 AI 점수 0% 인 섹션이라 해서 모순되지 않습니다. 한 숫자는 일치하는 텍스트를 세는 것이고 다른 숫자는 감지 모델의 문장별 판단을 반영합니다. 문서의 서로 다른 섹션이 AI 비율에서 차이를 보일 수 있는 것은 바로 AI 비율과 유사성 비율이 서로 다른 질문에 답하기 때문입니다.
Submission Breakdown 과 하이라이트 읽기
공식 가이드는 보고서 상단의 인터랙티브 바를 이렇게 설명합니다:
"The overall percentage of text likely detected as AI is detailed in the Submission Breakdown."(AI 로 감지되었을 가능성이 있는 텍스트의 전체 비율은 Submission Breakdown 에 자세히 나와 있습니다.)
"The bar is interactive and allows you to select each highlight to bring the corresponding text and page of the submission into focus."(이 바는 인터랙티브하며 각 하이라이트를 선택하여 제출문의 해당 텍스트와 페이지로 이동할 수 있습니다.)
자신의 보고서를 읽을 때 참고할 두 가지 실용적인 사항:
- 하이라이트 색상이 2026 년 8 월에 변경되었습니다. Turnitin 은 AI 생성 및 AI-paraphrased 카테고리를 하나의 파란색으로 통합했으므로 새로운 보고서에서는 기존 두 가지 색상이 하나의 파란색으로 표시됩니다.
- 자격 있는 산문만이 계산에 포함됩니다. 목록, 불릿 포인트, 표, 시, 스크립트, 코드는 포함되지 않습니다. 공식 가이드는 이렇게 명시합니다: "The model does not reliably detect AI-generated text in the form of non-prose, such as poetry, scripts, or code, nor does it detect short-form/unconventional writing such as bullet points, tables, etc."(이 모델은 시, 스크립트, 코드 등 산문이 아닌 형태의 AI 생성 텍스트를 일관되게 감지하지 못하며 불릿 포인트, 표 등 짧은 형식이나 비전통적인 글쓰기는 감지하지 못합니다.)
따라서 '비어 있는' 섹션은 실제로 텍스트가 없는 것이 아니라 자격 있는 산문이 없는 것입니다. 보고서는 불릿 포인트나 표에 대해 아무 정보도 제공하지 않습니다. 이러한 요소들은 애초에 계산에 포함되지 않기 때문입니다.
섹션을 과도하게 해석하기 전에 알아야 할 세 가지 상태
Turnitin 의 지표 상태 가이드에서는 일반 숫자처럼 작동하지 않는 비율에 대해 설명합니다:
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores above 0% and below the 20% threshold in the report. When this occurs, it is now indicated with an asterisk (%) and no percentage is attributed."(위양성 발생을 방지하기 위해 AI 감지 점수가 0% 보다 크고 20% 미만인 경우 보고서에 점수나 하이라이트가 부여되지 않습니다. 이 경우 별표 (%) 로 표시되며 실제 비율은 표시되지 않습니다.)
"0% detected as AI … our testing has found that there is a higher incidence of false positives when the percentage is between 0 and 19."(AI 로 감지된 비율 0%... 당사의 테스트에서 비율이 0~19% 사이일 때 위양성 발생률이 더 높다는 것을 확인했습니다.)
이는 섹션 간 차이를 해석하는 방식을 바꿉니다. 0% 를 표시하는 섹션은 실제 0 일 수도 있고 20% 미만이라 보고서에 표시되지 않는 점수일 수도 있습니다. 보고서 자체로는 이 둘을 구분할 수 없습니다. 이는 우연이 아니라 의도된 설계입니다.
핵심 요약
섹션마다 다른 비율을 보이는 Turnitin AI 보고서는 감지기가 의도한 대로 작동하고 있음을 나타냅니다. 각 문장이 개별적으로 점수를 받고, 겹치는 세그먼트가 점수들을 풀링하며, 전체 수치가 산출되는 것입니다. 문서 전반에 걸쳐 균일한 판정이 내려지는 것이 아닙니다. 섹션별 차이는 문장의 특성과 길이 차이에서 비롯되며, AI 비율은 유사성 점수와 무관합니다. 하이라이트는 자격 있는 산문에만 적용되므로 불릿 포인트, 표, 코드는 계산에서 완전히 제외됩니다. 보고서를 검토할 때는 하이라이트를 각 단락에 고정된 라벨로 보기보다는 조사할 대상으로 접근해야 합니다.
계속 읽기