코파일랙스 대 터니틴 AI 감지: 왜 다른 감지 도구들이 서로 다른 결과를 내놓는가

학생들이 논문을 여러 AI 감지 도구에 돌려보면 결과가 제각각인 경우가 많습니다. 터니틴은 20% 라고 나오는데 코파일랙스는 80% 라고 나올 수도 있습니다. 이유는 간단합니다. 모델이 다르고, 학습 데이터가 다르며, 분류 기준치도 다르기 때문입니다. 감지 도구들이 왜 서로 다른 결과를 내는지 이해하면, 각 점수가 어떤 맥락에서 나온 것인지 올바르게 읽을 수 있습니다.

HumanPen 팀

· 4분

한마디로

AI 감지 도구마다 점수가 다른 이유는 각기 다른 모델이고, 학습 데이터도 다르며, 분류 기준도 다르기 때문입니다. 코파일랙스와 터니틴은 서로 다른 팀에서 만든 별개의 제품입니다. 각자 모델도 다르고, 학습 코퍼스도 다르며, 세그먼트 단위 예측을 문서 전체 점수로 집계하는 방식도 다릅니다. 같은 텍스트를 코파일랙스에 돌리면 80%, 터니틴에 돌리면 20% 가 나와도 어느 쪽이 틀렸다고 단정할 수 없습니다. 두 도구가 측정하는 통계적 패턴이 다르고, 적용하는 판단 기준선도 다르기 때문입니다. 실제로 신경 써야 할 점수는 소속 기관이 실제로 쓰는 도구의 점수입니다. 학교에서 터니틴을 쓴다면, 코파일랙스 점수는 참고는 될 뿐 공식적인 효력은 없습니다.

터니틴 감지기는 어떻게 작동하는가

터니틴 FAQ 는 자사의 처리 파이프라인을 이렇게 설명합니다:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score."(논문이 Turnitin 에 제출되면 제출된 텍스트에서 문장을 추출하여 중복되는 섹션으로 나눈 뒤 예측 분석을 수행합니다. 각 섹션은 AI 감지 모델로 분류되며, 0 에서 1 사이의 값으로 점수가 매겨집니다. 이 값은 텍스트가 인간이 작성했을 확률인지 AI 가 생성했을 확률인지를 나타냅니다. 해당 섹션에 포함된 각 문장은 그 섹션의 점수를 물려받습니다. 섹션이 서로 겹치기 때문에 어떤 문장은 여러 점수를 가질 수 있고, 이들은 하나로 통합됩니다. 이렇게 산출된 문장 단위 점수를 다시 집계하여 문서 전체의 AI 작성 점수를 계산합니다.)

터니틴은 위양성 목표율도 공개하고 있습니다: "We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing."(저희는 탐지기의 효율성을 극대화하되, 인간이 완전히 작성한 텍스트를 AI 생성으로 잘못 판단하는 위양성 비율을 AI 작성 비율이 20% 이상인 문서에서 1% 미만으로 유지하려 노력합니다.) 이 목표치는 모델이 애매한 텍스트를 얼마나 적극적으로 AI 로 분류할지 결정합니다. 위양성을 최소화하도록 튜닝된 모델은 불확실한 세그먼트를 인간 작성으로 분류하는 경향이 있어, 혼합 텍스트에서 AI 점수를 낮추는 결과를 낳을 수 있습니다.

코파일랙스와 터니틴이 다른 결과를 내는 이유

코파일랙스는 자체 AI 감지 모델을 따로 쓰며, 학습 데이터와 분류 기준도 독자적입니다. 코파일랙스 모델의 세부 사항은 터니틴 FAQ 와 달리 공개되어 있지 않기 때문에 두 메커니즘을 정면 비교할 수는 없습니다. 하지만 결과가 달라지는 구조적 이유는 명확합니다. 서로 다른 데이터로 학습한 두 모델은 같은 텍스트를 다르게 분류합니다. 터니틴 모델이 AI 확률 0.3 으로 분류한 문장을 코파일랙스 모델은 0.7 로 분류할 수도 있습니다. 이렇게 세그먼트 단위에서 생긴 차이가 문서 전체로 집계되면 최종 백분율은 크게 벌어질 수 있습니다. 왜 같은 텍스트가 감지 도구마다 다르게 나오는지 에서 이 문제를 일반적으로 풀어 설명합니다.

표시상의 차이도 있습니다. 터니틴은 1%~19% 구간 점수를 아예 숫자로 띄우지 않고 별표 () 로만 표시합니다. FAQ 는 이렇게 설명합니다: "To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range."(위양성 발생 가능성을 막기 위해 AI 감지 점수가 1% 에서 19% 사이일 때는 점수나 하이라이트를 표시하지 않습니다.) 코파일랙스에서 15% 가 나온 텍스트를 터니틴에서는 별표로만 보여준다면, 그 차이는 단순히 분류 알고리즘 탓만이 아니라 표시 방식의 문제이기도 합니다. [터니틴 AI 점수의 별표 (%) 는 무엇을 의미하는가](/blog/what-does-the-asterisk-mean-on-turnitin-ai-score) 에서 자세히 다룹니다.

문서가 짧으면 차이가 더 커진다

터니틴 FAQ 는 짧은 문서일수록 예측 신뢰도가 낮아진다고 명시합니다:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap."(단어가 수백 개밖에 없는 짧은 문서는 단일 세그먼트로만 예측하게 되며 겹치는 구간이 없어서 예측 결과가 대부분 '올 올 아니면 전무'로 나옵니다.)

이어서 이렇게 설명합니다: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated."(즉, AI 생성 내용과 인간이 쓴 오리지널 콘텐츠가 섞인 텍스트도 전부가 AI 생성인 것으로 적발될 수 있다는 뜻입니다.)

짧은 문서에서는 한 감지기가 텍스트 전부를 AI 로 분류해 100% 를 내는 반면, 다른 감지기는 인간 작성으로 분류해 0% 를 낼 수도 있습니다. 올 올 아니면 전무 방식 때문에 단일 세그먼트를 각 모델이 어떻게 처리하느냐에 따라 최종 점수가 극단적으로 갈릴 수 있습니다. 여러 감지기의 점수를 비교할 때는 문서 길이도 변수입니다. 300 단어 분량의 초록은 도구마다 점수가 크게 벌어질 수 있지만, 3,000 단어 분량의 논문은 상대적으로 점수가 근접하게 나옵니다.

어떤 점수가 중요한가

중요한 점수는 소속 기관이 실제로 쓰는 도구의 점수입니다. 재학 중인 대학이 터니틴을 쓴다면, 터니틴 AI 점수가 학적에 직접 영향을 줍니다. 코파일랙스 점수가 5% 로 나와도 터니틴 점수가 80% 라면 소용없습니다. 반대로 코파일랙스 점수가 80% 로 나와도 학교에서 코파일랙스를 쓰지 않는다면 아무 문제가 없습니다. 논문을 여러 감지기에 돌려보면 텍스트에 AI 같은 패턴이 있는지 대략적으로 감을 잡을 수는 있지만, 소속 기관이 쓰는 감지기가 무엇을 말할지는 알려주지 않습니다. 실제 점수를 아는 유일한 방법은 소속 기관이 쓰는 도구에서 나온 리포트를 직접 확인하는 것뿐이며, 터니틴 AI 인디케이터는 교수진이나 관리자만 볼 수 있습니다. 학교가 이 기능을 아예 돌리는지도 무엇을 구매했는지에 따라 다르 습니다.

이것이 당신에게 어떤 의미인가

지금까지 다룬 내용을 정리하면 다음과 같습니다:

  • AI 감지 도구는 각기 다른 모델, 학습 데이터, 분류 기준을 쓴다. 따라서 결과가 달라지는 것은 당연하다.
  • 터니틴은 위양성 목표치 (AI 작성 비율이 20% 이상인 문서를 기준으로 1% 미만) 와 작동 메커니즘 (중복 세그먼트 분류) 을 공개하고 있다.
  • 터니틴은 1%~19% 구간 점수를 별표로 숨기는데, 이 때문에 다른 도구와 비교했을 때 차이가 더 두드러져 보일 수 있다.
  • 짧은 문서는 올 올 아니면 전무 방식으로 예측되므로 감지기 간 차이가 극단적으로 벌어질 수 있다.
  • 실제로 중요한 점수는 소속 기관이 실제로 쓰는 도구의 점수이다.

터니틴 리포트에서 어느 구간이 적발되었는지 확인했다면, 리포트를 업로드 하여 해당 구간만 집중적으로 작업하십시오. 적합 판정을 받은 구간은 무료로 다시 검수할 수 있습니다.

계속 읽기