피어 리뷰어가 내 논문을 AI 라고 신고했다. Turnitin 의 입장은
피어 리뷰어가 논문이 AI 가 작성한 것처럼 보인다는 통보를 해왔습니다. Turnitin 자사는 AI 감지 지표의 한계에 대해 뭐라고 밝히고 있을까요? FAQ 는 그 점수를 단독으로 조치를 취하거나 평가의 근거로 삼아서는 안 된다고 명시합니다. 이는 여러 데이터 포인트 중 하나일 뿐입니다. 특정 유형의 텍스트는 잘못된 양성 (false positive) 이 나올 수 있습니다. 오직 담당 교수와 관리자만 그 점수를 볼 수 있습니다. 전체 문서의 20% 이상이 AI 생성인 경우, 잘못된 양성률은 1% 미만을 목표로 합니다. 공식 문서에는 이렇게 기록되어 있습니다.
HumanPen 팀
· 4분
점수는 단독 근거가 될 수 없다
Turnitin FAQ 는 AI 작성 지표의 사용 한계를 이렇게 명시합니다:
"Hence, we must emphasize that the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors."(따라서 AI 작성 지표의 백분율을 교수가 조치를 취하거나 최종적인 채점 기준으로 삼아서는 안 된다는 점을 강조해야 합니다.)
이건 Turnitin 자체가 한 말입니다. 백분율은 신호일 뿐 결론이 아닙니다. 피어 리뷰어가 Turnitin 점수를 근거로 논문을 지적했더라도, 공식 문서는 애초에 그 점수가 최종 판단이 되어서는 안 된다고 말합니다. 저널이 제출된 논문에 실제로 어떤 검토를 수행하는지는 별개의 문제입니다: 저널들은 논문의 AI 작성 여부를 확인하는가.
단 하나의 데이터 포인트일 뿐이다
FAQ 는 이 점수를 여러 입력값 중 하나로 위치시킵니다:
"It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy."(이 점수는 단독으로 최종적인 답을 내리도록 설계되지 않았습니다. 어떤 도구보다 중요한 것은, 이 점수를 보되 학생과 그 학생의 작업, 기관 정책에 대한 개인적 지식과 함께 종합적으로 판단하는 교육자입니다.)
이 점수는 도구가 알지 못하는 맥락을 가진 교육자가 해석하도록 설계되었습니다. 이 도구는 당신의 집필 과정, 초고 이력, 글쓰기 스타일을 알지 못합니다. 공식 문서는 점수를 읽는 사람 자체가 점수보다 더 중요하다고 말합니다.
백분율만으로 논문을 지적하는 피어 리뷰어는 FAQ 가 지양하는 방식으로 도구를 사용하고 있는 것입니다. 그 점수는 학생과 그 작업에 대한 개인적 지식과 균형을 이루도록 설계되었습니다.
잘못된 양성이란 어떤 모습인가
FAQ 는 잘못된 양성을 유발할 수 있는 구체적인 텍스트 특징을 설명합니다:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas."(때때로 잘못된 양성 (인간이 작성한 텍스트를 AI 생성으로 잘못 표시하는 것) 은 구조적 변화가 거의 없는 내용, 문자 그대로 반복되는 텍스트, 또는 새로운 아이디어 없이 요약된 텍스트를 포함할 수 있습니다.)
논문이 지적되었다면, 이러한 특징이 있는지 점검해보세요. 구조적 변화가 부족하거나 같은 표현이 반복되거나, 새로운 분석 없이 출처를 요약한 텍스트는 본인이 모든 단어를 직접 썼더라도 지적될 수 있습니다. 이들은 추측이 아니라 문서화된 잘못된 양성 패턴입니다.
이 점은 주목할 가치가 있습니다. 왜냐하면 이러한 특징은 학술 작문에서 흔히 나타납니다. 문헌 검토, 방법론 섹션, 결과 기술은 본질적으로 구조적 변화가 적거나 표현이 반복될 수 있습니다. 잘못된 양성이라는 것은 텍스트가 AI 가 생성했다는 뜻이 아닙니다. 그 텍스트가 모델이 AI 출력과 연관시키는 패턴을 공유한다는 뜻입니다. Turnitin 이 내 방법론 섹션 전체를 지적했습니다 는 해당 사례를 상세히 다룹니다.
잘못된 양성 목표치
FAQ 는 구체적인 잘못된 양성 목표치를 명시합니다:
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing."(우리는 탐지기의 효과를 극대화하면서도 잘못된 양성률 (완전히 인간이 작성한 텍스트를 AI 생성으로 잘못 식별하는 비율) 을 AI 작성이 20% 이상인 문서의 경우 1% 미만으로 유지하기 위해 노력합니다.)
그 다음 문장은 이렇습니다: "즉, 완전히 인간이 작성한 문서 100 건 중 1 건은 AI 작성으로 잘못 표시될 수 있습니다."
목표치는 AI 작성이 20% 이상인 문서에 대해 1% 미만입니다. 이는 Turnitin 이 잘못된 양성이 발생한다는 점을 공식 인정한 것이며, 얼마나 자주 발생해야 하는지에 대한 기준을 설정했다는 뜻입니다. 이 기준은 목표일 뿐 보장은 아닙니다. 잘못된 양성은 시스템 설계 파라미터의 일부입니다. 1% 잘못된 양성률이 대학에서 75,000 편의 논문을 제출할 때 어떤 의미인가 는 이 목표치를 실제 인원수로 환산합니다.
실제로 점수를 볼 수 있는 사람은 누구인가
FAQ 는 AI 지표에 대한 접근 권한이 제한되어 있음을 밝힙니다:
"Please note, only instructors and administrators are able to see the indicator."(참고로, 오직 강사와 관리자만이 이 지표를 볼 수 있습니다.)
학생은 이 점수를 볼 수 없습니다. 많은 저널 편집 워크플로우에서 피어 리뷰어도 Turnitin AI 지표에 직접 접근하지 못할 수 있습니다. 피어 리뷰어가 논문을 AI 라고 지적했을 경우, similarity report 나 다른 감지 도구, 혹은 자신의 작성력 평가를 근거로 했을 가능성이 있습니다. 어떤 도구가 그 지적을 생산했는지, 누가 어떤 보고서에 접근할 수 있었는지 확인해 볼 필요가 있습니다. 저널 측이라면 보통 iThenticate 를 사용합니다: iThenticate 는 AI 작성을 감지하는가.
당신에게 이것이 무엇을 의미하는가
공식 문서가 말하는 내용을 요약하면:
- AI 작성 지표의 백분율을 조치의 단독 근거 또는 최종적인 채점 기준으로 삼아서는 안 됩니다.
- 이 점수는 단독으로 최종적인 답을 내리도록 설계되지 않았습니다. 학생에 대한 교육자의 지식과 기관 정책이 더 중요합니다.
- 잘못된 양성은 구조적 변화가 없는 내용, 반복되는 텍스트, 새로운 아이디어 없이 요약된 텍스트에서 발생할 수 있습니다.
- 잘못된 양성 목표치는 AI 작성이 20% 이상인 문서에 대해 1% 미만입니다. 잘못된 양성은 시스템에 문서화된 부분입니다.
- 오직 강사와 관리자만이 AI 지표를 볼 수 있습니다. 학생은 볼 수 없습니다.
피어 리뷰어가 논문을 지적했고 해당 구절을 수정하고 싶다면, 보고서를 가져오세요. 대상 구절은 추가 비용 없이 재검토할 수 있습니다.
계속 읽기