Originality.ai vs Turnitin AI 탐지: 공식 문서가 밝히는 내용

학생들이 Originality.ai 로 논문을 검사했는데 Turnitin 결과와 달라 의아해하는 경우가 많습니다. 하지만 이는 지극히 당연한 일입니다. 각 탐지기는 서로 다른 모델로, 다른 데이터셋을 기반으로 학습되었기 때문입니다. Turnitin FAQ 에 작동 원리, 오검출률 목표, 저점수 구간 별표 처리 규약이 설명되어 있습니다. 공식 문서에서 어떤 내용을 확인해 보겠습니다.

HumanPen 팀

· 4분

핵심만 말씀드리면

Originality.ai 와 Turnitin 은 모델 구조도, 학습 데이터도, 분류 기준도 완전히 다른 별도의 AI 탐지 시스템입니다. 따라서 한쪽 점수로 다른 쪽 점수를 예측할 수 없습니다. Turnitin FAQ 에 따르면, 텍스트는 겹치는 구간으로 나뉘어 각각 0~1 사이의 확률 점수로 분류됩니다. 또한 AI 작성 비율 20% 이상 문서에서 오검출률 1% 미만을 목표로 하며, 1~19% 구간에서는 별표 (*%) 로만 표시한다는 규약도 명시되어 있습니다. Originality.ai 는 자체 정확도 수치를 공개하지만, 이는 벤더 측 주장일 뿐 Turnitin 문서와 직접 비교할 수 있는 근거가 없습니다. 중요한 건 귀교에서 사용하는 도구의 점수입니다. 학교가 Turnitin 을 쓴다면, 제 3 자 점수로 Turnitin 결과를 알 수 있는 방법은 없습니다.

Turnitin 탐지기는 어떻게 작동하나

FAQ 는 탐지 프로세스를 이렇게 설명합니다:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (논문이 Turnitin 에 제출되면, 문장이 추출되어 예측 분석을 위해 겹치는 구간으로 분할됩니다. 각 구간은 AI 탐지 모델에 의해 분류되며, 0 에서 1 사이의 값이 부여됩니다. 이는 텍스트가 인간 작성일 가능성과 AI 생성일 가능성을 나타냅니다.)

구간이 겹치기 때문에 하나의 문장이 여러 번 점수를 매겨지고, 이 값들이 종합되어 최종 문서 점수가 산출됩니다. 이러한 풀링 방식은 개별 예측 오차를 완화하는 역할을 합니다. Originality.ai 는 Turnitin 문서에 나와 있지 않은 자체 분류 방식을 사용합니다. 두 시스템은 아키텍처도, 텍스트 평가 방법도 다릅니다.

Turnitin 의 오검출 목표치

FAQ 는 구체적인 목표 수치를 명시합니다:

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (우리는 탐지 효율성을 극대화하면서도, 완전한 인간 작성 텍스트를 AI 작성을 오검출하는 비율을 AI 작성 비율 20% 초과 문서에서 1% 미만으로 유지하기 위해 노력합니다.)

이어서 다음과 같이 덧붙입니다: "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (다시 말해, 완전히 인간이 작성한 문서 100 개 중 1 개는 AI 작성으로 잘못 플래그될 수 있습니다.)

이 목표치는 Turnitin 고유의 기준이며, AI 작성 비율 20% 초과 문서에만 적용됩니다. Originality.ai 는 오검출률이 다를 수 있으나, 두 수치를 비교하려면 각 벤더가 오검출을 어떻게 정의하고 측정하는지 먼저 이해해야 합니다. 당사는 제 3 자 탐지기의 정확도에 대해 장담하지 않습니다. 분명한 건 Turnitin 이 자사 모델에 대해 이 목표를 공식 밝혔다는 점입니다. 이 목표치가 대학规模为提交될 때 어떤 의미를 갖는지는 대학에서 75,000 편의 논문을 제출할 때 1% 오검출률이 의미하는 것 에서 다루었습니다.

별표 (*%) 처리 규약

Turnitin 은 낮은 점수 구간에 특별한 표시 규칙을 적용합니다:

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (%) and no percentage is attributed." (오검출 가능성을 줄이기 위해, AI 탐지 점수가 1%~19% 구간일 경우 점수나 하이라이트를 표기하지 않습니다. 보고서에서 AI 가 20% 기준 미만으로 탐지되면 별표 (%) 로만 표시하며 백분율 수치는 부여하지 않습니다.)

즉, Turnitin 보고서에 "%"가 떴다는 건 20% 미만 AI 가 탐지되었지만, 오검출이 빈번한 저신뢰 구간에서 정확도를 과장하지 않기 위해 수치를 숨긴 것입니다. Originality.ai 는 이 규약을 따르지 않으므로 이 구간에서도 구체적 백분율을 표시합니다. Turnitin 에서 "%"로 나온 논문이 Originality.ai 에서는 "15%"로 나올 수 있습니다. 그렇다고 한쪽이 더 정확하다는 뜻은 아닙니다. 저신뢰 구간을 처리하는 방식이 다를 뿐입니다. Turnitin AI 점수의 별표 (*%) 가 의미하는 것 에서 Turnitin 측 규약을 자세히 설명했습니다.

도구마다 점수가 다른 이유

서로 다른 AI 탐지기가 동일 텍스트에서 상이한 점수를 내는 이유는 모델, 학습 데이터, 임계값이 모두 다르기 때문입니다. Turnitin FAQ 는 자사 모델이 겹치는 구간 점수를 풀링하여 문서 전체 백분율로 aggregates 한다고 설명합니다. 다른 탐지기는 구간 나누기 전략, 점수 척도, 집계 방법에서 차이가 있을 수 있습니다. FAQ 는 또한 짧은 문서에서는 All-or-nothing 방식 예측이 나온다고 명시합니다: "In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (수백 단어しかない 짧은 문서에서는 겹침 구분이 어렵기 때문에 대체로 '전부 아니면 전무' 식 예측이 나옵니다.)Originality.ai 도 짧은 문서에서 같은 방식을 쓰는지는 알려져 있지 않습니다.

Turnitin 에서 AI 점수와 유사도 점수는 서로 독립적입니다: "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (유사도 점수와 AI 작문 탐지 백분율은 완전히 독립적이며 서로 영향을 주지 않습니다.)AI 와 유사도를 단일 점수로 통합하는 탐지기는 Turnitin 의 별도 AI 백분율과 비교할 수 없습니다. 왜 동일 텍스트가 탐지기마다 다르게 점수 매겨지는가 에서 그 이유를 정리했습니다.

이용자님께 이는 어떤 의미인가

지금까지 살핀 내용을 정리하면 다음과 같습니다:

  • Originality.ai 와 Turnitin 은 모델이 다른 별개의 탐지기이므로 점수는 일치하지 않습니다.
  • Turnitin 탐지기는 텍스트를 겹치는 구간으로 나누어 0~1 사이 확률 점수를 부여합니다.
  • Turnitin 의 오검출 목표치는 AI 작성 비율 20% 초과 문서에서 1% 미만입니다.
  • Turnitin 은 1~19% 구간에서 정확도 과장을 막기 위해 별표 (*%) 를 사용합니다.
  • 짧은 문서는 단일 구간 평가이므로 Turnitin 에서 '전부 아니면 전무' 식 예측이 나옵니다.
  • 중요한 건 귀교에서 사용하는 도구의 점수입니다.

Turnitin AI 보고서를 받아 flagged 된 부분을 수정하고 싶으시면 보고서를 업로드 한 후 작업하시면 됩니다. 자격 요건을 갖춘 구간은 무료로 재검사가 가능합니다.

계속 읽기