Winston AI와 Turnitin: AI 탐지 점수가 다른 이유
학생들 중에는 Turnitin에 제출하기 전에 Winston AI로 논문을 먼저 돌려보는 경우가 있습니다. 두 도구는 모델이 다르고, 나오는 점수도 다릅니다. Turnitin FAQ에는 탐지 방식, 오탐 목표치, 별표(*) 규칙이 나와 있습니다. 왜 도구끼리 점수를 비교할 수 없는지 정리했습니다.
HumanPen 팀
· 4분
짧게 답하면
Winston AI와 Turnitin은 서로 다른 AI 탐지기입니다. 모델도, 학습 데이터도, 판정 기준값도 다릅니다. 한쪽 점수로 다른 쪽 점수를 예측할 수는 없습니다. Turnitin FAQ는 방식을 이렇게 설명합니다. 텍스트를 겹치는 구간으로 나누고, 각 구간에 0에서 1 사이의 확률값을 매긴다고 합니다. 같은 FAQ에는 AI 작성 비중이 20%를 넘는 문서에 대해 오탐률을 1% 미만으로 유지한다는 목표와, 1~19% 구간 점수에는 별표를 쓴다는 규칙도 있습니다. Winston AI도 자체 정확도 수치를 공개하지만, 업체가 스스로 밝힌 수치라 Turnitin 문서와 대조해 확인할 수는 없습니다. 결국 중요한 점수는 내 소속 기관이 쓰는 도구의 점수입니다. 학교가 Turnitin을 쓴다면, 어떤 외부 도구 점수도 내 Turnitin 점수를 알려주지 못합니다.
Turnitin 탐지기는 어떻게 작동하나
FAQ에는 탐지 과정이 이렇게 나와 있습니다.
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (논문이 Turnitin에 제출되면 제출물에서 문장이 추출되어 예측 분석을 위해 겹치는 구간으로 나뉩니다. 각 구간은 AI 탐지 모델이 분류하고 0에서 1 사이의 값을 받으며, 이 값은 해당 텍스트가 사람이 썼을지 AI가 만들었을지의 확률을 나타냅니다.)
구간이 겹치기 때문에 한 문장이 여러 점수를 받을 수 있고, 이 값들이 모여 문서 전체 비율이 됩니다. Winston AI는 자체 분류 방식을 쓰는데, Turnitin 자료에는 그 내용이 없습니다. 두 시스템은 구조가 다르고, 텍스트를 보는 방식도 다릅니다.
Turnitin이 목표로 하는 오탐률
FAQ에는 구체적인 목표치가 나와 있습니다.
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (우리는 탐지기의 효과를 최대한 끌어올리는 한편, 오탐률, 즉 사람이 직접 쓴 텍스트를 AI가 만든 것으로 잘못 판정하는 비율을 AI 작성 비중이 20%를 넘는 문서에서 1% 미만으로 유지하려 노력합니다.)
바로 다음 문장입니다. "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (다시 말해, 사람이 직접 쓴 문서 100건 가운데 1건은 AI가 쓴 것으로 표시될 수 있다는 뜻입니다.)
이 목표치는 Turnitin에만 해당하고, AI 작성 비중이 20%를 넘는 문서에 적용됩니다. Winston AI는 다른 오탐률을 내세울 수도 있습니다. 다만 두 수치를 비교하려면 각 업체가 오탐을 어떻게 정의하고 측정하는지부터 알아야 합니다. 우리는 외부 탐지기의 정확도에 대해 단정하지 않습니다.
별표 규칙
Turnitin에는 낮은 점수에 대한 별도의 표시 규칙이 있습니다.
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (오탐 발생 가능성을 피하기 위해 AI 탐지 점수가 1%에서 19% 구간일 때는 점수나 강조 표시를 부여하지 않습니다. 리포트에서 20% 기준값 아래로 AI가 탐지되면, 이제는 별표(*)로 표시하고 백분율은 부여하지 않습니다.)
Winston AI는 이 규칙을 쓰지 않고, 이 구간에서도 구체적인 비율을 보여줍니다. Turnitin에서 "*%"로 표시되는 논문이 Winston AI에서는 "14%"로 나올 수 있습니다. 그렇다고 어느 쪽이 더 정확하다는 뜻은 아닙니다. 확신이 낮은 구간을 다루는 방식이 다를 뿐입니다. Turnitin AI 점수에서 별표(*)가 뜻하는 것에서 Turnitin 쪽 이야기를 다뤘습니다.
짧은 문서와 전부 아니면 전무 식 판정
FAQ에는 짧은 문서에서 어떤 일이 생기는지 나와 있습니다.
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (몇백 단어뿐인 짧은 문서에서는 겹칠 기회 없이 구간 하나만으로 예측하기 때문에, 판정은 대체로 '전부 아니면 전무'가 됩니다.)
바로 다음 문장입니다. "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (즉, AI가 만든 내용과 직접 쓴 내용이 섞인 텍스트도 전체가 AI 작성으로 표시될 수 있다는 뜻입니다.)
이건 Turnitin의 구간 분할 방식에서 비롯됩니다. Winston AI가 짧은 텍스트에서 같은 방식으로 작동하는지는 알 수 없습니다. 짧은 발췌문을 Winston AI에 돌려 0%가 나왔다 해도, Turnitin이 어떻게 나올지는 전혀 알 수 없습니다. 이 현상의 반대편 끝은 Turnitin이 내 과제를 100% AI로 판정한 경우에서 다룹니다.
결국 중요한 점수
Turnitin에서 AI 점수와 유사도 점수는 서로 독립적입니다. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (유사도 점수와 AI 작성 탐지 비율은 완전히 독립적이며 서로 영향을 주지 않습니다.) 어떤 탐지기는 AI와 유사도를 하나의 숫자로 합치는데, 그렇게 되면 Turnitin이 따로 보여주는 AI 비율과는 구조상 비교할 수 없습니다. 제출할 때 중요한 점수는 내 소속 기관이 쓰는 도구가 만든 점수뿐입니다. 같은 텍스트가 탐지기마다 다르게 나오는 이유에서 이 격차가 왜 구조적인지 설명합니다.
그래서 당신에게는 무슨 뜻인가
지금까지 이야기를 정리하면 다음과 같습니다.
- Winston AI와 Turnitin은 모델이 다른 별개의 탐지기입니다. 점수는 맞지 않습니다.
- Turnitin 탐지기는 텍스트를 겹치는 구간으로 나누고 확률값을 매깁니다.
- Turnitin의 오탐 목표치는 AI 작성 비중이 20%를 넘는 문서에서 1% 미만입니다.
- Turnitin은 1~19% 점수에 별표를 써서, 정확도를 과장하지 않으려 합니다.
- 짧은 문서에서는 Turnitin의 판정이 전부 아니면 전무 식으로 나옵니다.
- 중요한 점수는 내 소속 기관이 쓰는 도구의 점수뿐입니다.
Turnitin AI 리포트를 받아서 지적된 부분을 손보고 싶다면, 리포트를 불러와 작업하세요. 대상이 되는 부분은 추가 비용 없이 다시 실행할 수 있습니다.
계속 읽기