Scribbr AI 탐지기와 Turnitin: 공식 문서가 실제로 밝힌 내용
Scribbr은 누구나 사용할 수 있는 무료 AI 탐지기를 제공합니다. Turnitin의 AI 작성 탐지는 라이선스를 계약한 기관에서만 이용할 수 있습니다. 두 도구는 서로 다른 모델을 사용하므로 같은 텍스트에서도 다른 점수가 나옵니다. 여기서는 Turnitin 문서가 자사 시스템에 대해 무엇이라고 말하는지, 그리고 왜 점수가 서로 맞지 않는지 살펴봅니다.
HumanPen 팀
· 5분
Scribbr과 Turnitin은 별개의 시스템입니다
Scribbr의 AI 탐지기는 누구나 쓸 수 있는 무료 도구입니다. Turnitin의 AI 작성 탐지는 기관 전용이며, 본인 학교가 이 기능을 켰는지는 별개의 문제입니다. 이 점은 대학은 AI 탐지기를 사용할까에서 다룹니다. 두 도구는 서로 다른 팀이 서로 다른 모델로 만들었습니다. 각각 자체 데이터로 학습했고, 자체 방식으로 텍스트를 분류합니다. 탐지기가 서로 다른 모델을 쓰면 같은 텍스트에서도 점수가 달라집니다. Scribbr이 AI 65%로 표시한 부분을 Turnitin은 30%로 평가할 수도 있고, 그 반대가 될 수도 있습니다. 둘 중 하나가 틀렸다는 뜻은 아닙니다. 서로 다른 데이터셋으로 학습한 서로 다른 모델이 내놓은 확률 추정값일 뿐입니다.
모든 도구가 수렴하는 보편적인 AI 탐지 점수는 없으며, 그 이유는 같은 텍스트가 탐지기마다 다르게 평가되는 이유에 정리되어 있습니다. 각 탐지기는 자체 추정값을 냅니다. 서로 다른 도구의 점수를 같은 대상을 같은 단위로 잰 값처럼 다루면 혼란만 생깁니다.
어느 도구가 더 정확한지를 주장하려는 것이 아닙니다. Turnitin 문서가 자사 시스템에 대해 무엇이라고 말하는지, 그리고 왜 그 시스템이 Scribbr과는 맞지 않는 점수를 내는지를 설명하고 있을 뿐입니다.
Turnitin의 점수 산정 방식
Turnitin은 AI 작성 점수를 산출하는 구체적인 절차를 문서로 제시합니다:
“When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.” (논문이 Turnitin에 제출되면 제출물에서 문장이 추출되어 예측 분석을 위해 겹치는 섹션으로 분할됩니다. 각 섹션은 AI 탐지 모델이 분류하고 0에서 1 사이의 값을 받으며, 이 값은 해당 텍스트가 사람이 썼을 확률 또는 AI가 생성했을 확률을 나타냅니다. 이 섹션에 속한 대상 문장 각각은 섹션의 점수를 그대로 물려받습니다. 섹션이 겹치므로 여러 점수를 갖는 문장도 있고, 이 점수들은 하나로 합쳐집니다. 이렇게 구한 문장 점수는 다시 집계되어 문서 전체의 AI 작성 점수를 계산하는 데 쓰입니다.)
이 절차는 문장을 추출해 겹치는 단위로 나누고, 각 단위에 점수를 매기고, 문장 점수를 모은 뒤 문서 전체 비율로 집계합니다. Scribbr을 포함한 다른 탐지기는 분할 전략이나 예측 단위, 집계 방식이 다를 수 있습니다. 두 도구가 같은 텍스트에서 같은 수치를 내지는 않습니다.
Turnitin 문서는 AI 작성 탐지 비율과 유사도 점수가 별개라는 점도 분명히 합니다. “The Similarity score and the AI writing detection percentage are completely independent and do not influence each other.” (유사도 점수와 AI 작성 탐지 비율은 완전히 독립적이며 서로에게 영향을 주지 않습니다.) 유사도는 높고 AI 비율은 낮은 문서가 있을 수도 있고, 그 반대일 수도 있습니다. 두 수치는 서로 영향을 주지 않습니다.
Turnitin이 밝힌 오탐률
Turnitin은 오탐과 관련해 구체적인 목표치를 공개합니다:
“We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing.” (저희는 탐지기의 효과를 최대화하는 한편, 사람이 온전히 쓴 텍스트를 AI 생성으로 잘못 판정하는 비율, 즉 오탐률을 AI 작성 비율이 20%를 넘는 문서에서는 1% 미만으로 유지하려고 노력합니다.)
여기서 단서가 중요합니다. 그 목표치는 AI 작성 비율이 20%를 넘는 문서에 대해 명시적으로 제시된 것이며, 이 기준값은 사람들이 흔히 생각하는 의미가 아닙니다. 이 점은 AI 20%는 너무 높은가에서 짚어 봅니다. 이것이 Turnitin이 자사 시스템에 대해 말하는 내용입니다. Scribbr은 정확도 목표가 다르거나 검증 절차가 다를 수 있고, 비교할 만한 수치를 아예 공개하지 않을 수도 있습니다. 정확도를 직접 비교할 수는 없습니다. Turnitin 문서에 적힌 내용을 전할 수 있을 뿐입니다.
짧은 문서에서의 동작
문서 길이는 Turnitin 탐지기가 텍스트를 처리하는 방식에 영향을 줍니다. 짧은 문서에서는 점수 산정 구조가 다르게 작동합니다. 문서에는 다음과 같이 나와 있습니다:
“In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.” (몇백 단어에 불과한 짧은 문서에서는 겹침을 만들 여지 없이 단일 세그먼트에 대해 예측하므로, 예측값은 대체로 ‘전부 아니면 전무’가 됩니다.)
“This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.” (이는 AI가 생성한 내용과 직접 쓴 내용이 섞인 텍스트가 전체가 AI 생성으로 표시될 수 있다는 뜻입니다.)
긴 문서에서 점수를 평균 내 주는 겹침 구조는 텍스트가 단일 세그먼트가 되면 작동하지 않습니다. 사람이 쓴 내용과 AI가 쓴 내용이 섞인 몇백 단어가 100%로 돌아올 수 있으며, 이는 Turnitin이 내 과제를 100% AI로 판정하는 이유에서 설명하는 경로 가운데 하나입니다. 짧은 입력에서 나타나는 구조적인 동작입니다. Scribbr은 짧은 문서를 다른 구조로 처리해 같은 텍스트에서도 다른 결과를 낼 수 있습니다.
낮은 점수의 표시 방식
Turnitin은 20% 미만의 수치 점수를 표시하지 않습니다. 문서에는 다음과 같이 나와 있습니다:
“To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed.” (오탐이 발생할 가능성을 피하고자 AI 탐지 점수가 1%에서 19% 구간일 때는 점수도 강조 표시도 부여하지 않습니다. 보고서에서 AI가 20% 기준값 아래로 탐지되면 이제는 별표(*%)로 표시하고 백분율은 부여하지 않습니다.)
Turnitin 모델이 AI 10%로 추정한 문서에는 숫자 10%가 아니라 별표가 표시됩니다. 텍스트에는 강조 표시도 적용되지 않습니다. 신뢰도가 낮은 구간에서 오탐이 드러나지 않게 하려는 취지이며, 이 부분은 Turnitin AI 점수의 별표(*%)가 의미하는 것에서 더 자세히 다룹니다.
Scribbr은 이 구간의 점수를 온전한 백분율로 표시할 수 있습니다. 다른 도구는 값이 0이 아니면 어떤 수준이든 강조 표시를 할 수 있습니다. Turnitin은 20% 미만에서 숫자와 강조 표시를 모두 의도적으로 숨깁니다. 이런 표시 관례 때문에 AI 비율이 낮은 같은 문서라도 두 도구의 결과는 매우 다르게 보입니다.
내게 어떤 의미인가
같은 문서에서 Scribbr과 Turnitin의 결과를 비교하고 있다면, 요약은 다음과 같습니다:
- 모델이 다르면 점수도 다릅니다. Scribbr과 Turnitin은 서로 다른 탐지 모델을 씁니다. 점수가 일치하리라고 기대할 수 없습니다.
- Turnitin은 분할과 집계로 점수를 매깁니다. 문장을 추출해 겹치는 단위로 나누고, 점수를 매기고, 모은 뒤 집계합니다. AI 점수와 유사도 점수는 완전히 독립적입니다.
- Turnitin은 오탐률 1% 미만을 목표로 합니다. 단, AI 작성 비율이 20%를 넘는 문서에 한합니다.
- 짧은 문서는 전부 아니면 전무 점수를 받습니다. 내용이 섞여 있어도 몇백 단어가 0% 또는 100%로 돌아올 수 있습니다.
- 20% 미만 점수는 별표로 표시됩니다. 1-19% 구간에서는 숫자 비율도 강조 표시도 나타나지 않습니다.
조건을 충족하는 부분은 무료로 다시 실행할 수 있습니다.
계속 읽기