GPTZero vs Turnitin: 점수가 일치하지 않는 이유와 각 도구가 실제로 측정하는 것
같은 텍스트를 GPTZero 와 Turnitin 에 각각 넣으면 결과는 흔히 다릅니다. 어느 한쪽이 고장 난 게 아닙니다. 각 검출기는 서로 다른 모델, 서로 다른 학습 데이터, 서로 다른 점수 산출 규칙을 사용하니까요. Turnitin 공식 문서는 자사 검출기가 어떻게 작동하는지 이렇게 설명하며, 서로 다른 도구를 바로 비교하는 건 신뢰할 수 없다고 덧붙입니다.
HumanPen 팀
· 5분
서로 다른 검출기는 서로 다른 모델을 쓴다
GPTZero 와 Turnitin 은 각기 다른 팀이 만든 완전히 별개의 시스템입니다. 기반 모델도, 학습 데이터도, 텍스트를 분류하는 방식도 다릅니다. 모델이 다르면 같은 문서를 넣어도 결과는 맞지 않습니다. GPTZero 가 60% 라고 찍은 텍스트가 Turnitin 에서는 30% 로 나올 수도 있고, 그 반대일 수도 있어요. 둘 다 틀린 건 아닐 수 있습니다. 각기 다른 데이터로 학습된 다른 모델이 내놓은 확률 추정치일 뿐이니까요.
모든 도구가 수렴하는 보편적인 AI 검출 점수는 없습니다. [\[왜 같은 텍스트가 검출기마다 다르게 점수가 나오는지\]](/blog/why-detectors-disagree) 에서 다루는 문제의 핵심이 바로 이겁니다. 각 도구는 각자의 추정치를 내놓습니다. 점수를 똑같은 단위로 똑같은 걸 재는 것처럼 여기고 서로 비교하면 혼란만 커집니다.
어느 한쪽이 더 정확하다고 주장하려는 게 아닙니다. Turnitin 문서에서 자사 검출기의 작동 방식을 서술하고 있을 뿐이며, 그 메커니즘은 다른 도구들과 다릅니다.
Turnitin 검출기는 문서 점수를 어떻게 매기는가
Turnitin 공식 문서는 문서 수준의 AI 작성 점수를 산출하는 구체적인 절차를 이렇게 설명합니다:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (논문이 Turnitin 에 제출되면 제출문에서 문장이 추출되어 예측 분석을 위해 겹치는 구간으로 분할됩니다. 각 구간은 AI 검출 모델에 의해 분류되며 0 에서 1 사이의 값을 받아 텍스트가 인간 작성일 확률과 AI 생성일 확률을 나타냅니다. 이 구간 내의 각 적격 문장은 구간의 점수를 상속받습니다. 구간이 겹치기 때문에 일부 문장은 여러 점수를 가질 수 있으며, 이는 하나의 점수로 풀링됩니다. 이 문장 점수들은 추가로 집계되어 전체 문서 AI 작성 점수를 계산하는 데 사용됩니다.)
점수는 구간 단위 예측을 집계한 결과입니다. 구간은 서로 겹치고, 문장 점수는 집계 전에 풀링됩니다. 다른 검출기는 텍스트를 다르게 분할하거나 다른 예측 단위를 사용하거나 점수를 다른 방식으로 집계할 수 있습니다.
Turnitin 문서는 AI 작성 감지 비율과 Similarity 점수가 별개의 측정치라고도 명시합니다. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (Similarity 점수와 AI 작성 감지 비율은 완전히 독립적이며 서로 영향을 주지 않습니다.) Similarity 점수는 Turnitin 의 포괄적인 콘텐츠 컬렉션과 비교하여 제출된 문서에서 발견된 일치 텍스트의 비율을 나타냅니다. Similarity 점수가 높다고 AI 점수도 높은 건 아니며, 그 반대도 마찬가집니다. Turnitin AI Writing Report 와 Similarity Report 의 차이 에서 두 리포트를 나란히 비교해 놓았습니다.
Turnitin 의 위양성 목표
Turnitin 은 공식 문서에서 구체적인 위양성 목표를 이렇게 밝힙니다:
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (저희는 탐지기 효율을 극대화하면서도 위양성률, 즉 완전히 인간이 쓴 텍스트를 AI 생성으로 잘못 식별하는 비율을 AI 작성이 20% 를 초과하는 문서의 경우 1% 미만으로 유지하기 위해 노력합니다.)
문서는 이 내용을 이렇게 다시 풀기도 합니다: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (다시 말해, 완전히 인간이 쓴 문서 100 개 중 1 개는 인간이 쓴 문서를 AI 작성으로 플래그할 수 있습니다.) 이 다시 쓴 버전은"AI 작성이 20% 초과"라는 조건을 빼먹었습니다. 20% 기준이 들어간 버전이 더 정확한 표현입니다.
Turnitin 은 이 비율을 검증하기 위해 테스트 절차를 이렇게 설명합니다: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (테스트 프레임워크를 강화하고 위양성의 통계적 추이를 진단하기 위해, 매 업데이트나 새로운 모델 출시 전에 ChatGPT 출시 이전에 작성된 70 만 편 이상의 추가 학술 논문을 대상으로 테스트를 수행하여 1% 미만의 위양성률을 더욱 검증합니다.)
이것은 Turnitin 이 밝힌 목표와 검증 절차입니다. 대학이 제출하는 규모에서 1% 가 실제로 어떤 비용을 치르는지는 [\[1% 위양성률이 의미하는 것\]](/blog/what-a-one-percent-false-positive-rate-means) 에서 계산해 봅니다. 다른 검출기는 다른 목표를 가질 수 있고, 다른 검증 방법을 쓰거나, 비교 가능한 수치를 공개하지 않을 수도 있습니다. 이 정보만으로는 도구 간 정확도를 직접 비교할 수 없습니다. Turnitin 문서가 무엇을 말하고 있는지만 보고할 따름입니다.
짧은 문서는 다르게 작동한다
문서 길이는 Turnitin 검출기의 작동에 영향을 줍니다. 짧은 텍스트의 경우 점수 산출 메커니즘이 극단적인 결과를 낼 수 있습니다:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (수백 단어만 있는 짧은 문서에서는 예측이 대부분'전부 아니면 전무'가 됩니다. 겹칠 기회 없이 단일 구간에서만 예측하기 때문입니다.)
"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (즉, AI 생성 콘텐츠와 인간이 쓴 콘텐츠가 섞인 텍스트 중 일부는 완전히 AI 생성으로 플래그될 수 있습니다.)
긴 문서에서 점수를 부드럽게 만드는 겹침 메커니즘이 예측할 구간이 하나뿐일 때는 작동하지 않습니다. 인간과 AI 가 섞인 텍스트도 수백 단어에 불과하면 100% AI 로 나올 수 있습니다. [\[Turnitin 이 내 작업을 100% AI 라고 하는 이유\]](/blog/turnitin-says-100-percent-ai) 에서 다루는 경로 중 하나죠. 이건 짧은 입력에서의 한계일 뿐, 텍스트의 구성을 단정하는 판결이 아닙니다.
GPTZero 가 짧은 문서를 다르게 점수 매긴다면, 이'전부 아니면 전무'현상이 한 가지 설명입니다. 두 도구는 점수 구조가 달라서 짧은 텍스트를 다르게 처리합니다.
1~19% 별표 구간
Turnitin 은 AI 감지 결과가 1% 에서 19% 사이일 때 숫자 점수를 표시하지 않습니다. 문서는 이렇게 적습니다:
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (%) and no percentage is attributed." (위양성 발생 가능성을 피하기 위해 AI 감지 점수가 1% 에서 19% 범위일 때는 점수나 하이라이트를 부여하지 않습니다. 리포트에서 AI 가 20% 기준 미만으로 감지되면 이제 별표 (%) 로 표시하며 백분율은 부여하지 않습니다.)
즉, Turnitin 모델이 AI 콘텐츠를 12% 로 추정해도 리포트에는 숫자 대신 별표가 뜹니다. 하이라이트도 들어가지 않습니다. 이유는 신뢰도가 낮은 구간에서 잠재적 위양성을 띄우지 않으려는 것이며, [\[Turnitin AI 점수에서 별표 (*%) 가 의미하는 것\]](/blog/what-does-the-asterisk-mean-on-turnitin-ai-score) 에서 더 자세히 설명합니다.
GPTZero 와 다른 도구들은 이 구간을 다르게 표시할 수 있습니다. 어떤 도구는 0 이 아닌 모든 결과에 전체 백분율을 보여줍니다. Turnitin 은 20% 미만에서는 숫자를 감춥니다. 점수가 일치하지 않는 또 다른 이유입니다. 한쪽은 숫자를 보여주는데 다른 쪽은 별표만 띄울 수 있으니까요.
여러분에게 이것이 의미하는 것
같은 문서를 GPTZero 와 Turnitin 에서 비교한다면 다음을 기억하세요:
- 모델이 다르면 점수도 다르다. GPTZero 와 Turnitin 은 별개의 데이터로 학습된 별개의 검출 모델을 사용합니다. 점수가 일치할 것으로 기대하지 마세요.
- Turnitin 은 구간을 집계해서 점수를 매긴다. 텍스트를 구간으로 나누고 구간별로 점수를 매긴 뒤 집계합니다. AI 점수와 Similarity 점수는 완전히 독립적입니다.
- Turnitin 은 위양성 1% 미만을 목표로 한다. AI 작성이 20% 를 초과하는 문서를 대상으로 하며, ChatGPT 출시 전에 작성된 70 만 편 이상의 학술 논문으로 검증했습니다.
- 짧은 문서는 전부 아니면 전무 점수가 나온다. 수백 단어는 텍스트가 섞여 있어도 0% 나 100% 결과가 나올 수 있습니다.
- 20% 미만 점수는 별표로 표시된다. 1~19% 구간에서는 숫자 백분율도 하이라이트도 표시되지 않습니다.
조건에 맞는 문장은 무료로 다시 검사할 수 있습니다.