고급 어휘가 AI 표절로 걸린다고? 그 이유
많은 학생들이 훌륭한 어휘와 정제된 문장으로 쓴 글이 오히려 AI 표절로 의심받는다고 경험합니다. 문제는 훌륭한 글쓰기 자체가 AI 같아 보여서가 아닙니다. 표절 검사기가 단어 확률 패턴을 분석하는데 특정 학술적 산문체는 AI 생성 텍스트와 통계적 특징이 겹칠 수 있기 때문입니다.
HumanPen 팀
· 4분
간단한 답변
고급 어휘 자체만으로 AI 표절이 결정되는 것은 아닙니다. 검사기는 어휘의 수준을 평가하지 않습니다. 단어 시퀀스의 통계적 확률을 분석할 뿐입니다. 일관된 문장 구조와 정형화된 연결 어구, 예측 가능한 어휘 패턴을 사용하는 학술적 산문은 AI 생성 텍스트에서 학습한 단어 확률 프로파일과 겹칠 수 있습니다. 문제는 어휘가 지나치게 뛰어나서가 아닙니다. 균일한 구조와 형식적 어휘 패턴이 만들어내는 텍스트의 통계적 프로파일이 기계 생성 글쓰기와 닮을 수 있다는 것입니다. Turnitin FAQ 는 '구조적 변화가 많지 않은 내용'을 오진하기 쉬운 사례로 꼽습니다. 고급 어휘에 균일한 구조가 결합되면 바로 그 설명에 해당합니다.
검사기는 독자의 단어를 어떻게 분석하는가
Turnitin FAQ 는 이렇게 설명합니다:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score."(논문이 Turnitin 에 제출되면 제출된 문서의 문장들이 추출되어 예측 분석을 위해 겹치는 구간으로 나뉩니다. 각 구간은 AI 검사 모델로 분류되고 0 에서 1 사이의 값이 부여되어 텍스트가 인간이 썼는지 AI 가 생성했는지의 확률을 나타냅니다. 이 구간들 안의 해당 문장들은 구간의 점수를 그대로 이어받습니다. 구간이 겹치기 때문에 일부 문장은 여러 점수를 가질 수 있으며 이는 단일 점수로 통합됩니다. 이 문장 점수들이 다시 집계되어 전체 문서의 AI 글쓰기 점수를 산출합니다.)
모델이 독자의 어휘를 분석해 너무 난해하다고 판단하는 것이 아닙니다. 단어 확률 패턴으로 구간을 분류할 뿐입니다. FAQ 의 두 문장이 모델이 무엇을 측정하는지 설명해줍니다: "Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions."(우리 모델은 공개적 논의에서 언급되곤 하는 'burstiness', 'perplexity' 또는 기타 개별 지표를 평가하도록 명시적으로 프로그래밍되지 않았습니다.) 그리고 "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers."(저희 분류기는 단어 확률의 차이를 감지하도록 훈련되어 있으며 인간 작가가 만들어내는 특정 단어 확률 시퀀스를 잘 식별합니다.)
모델이 perplexity 라는 지표를 계산하는 것은 아닙니다. 다만 단어 확률 데이터를 기반으로 훈련됩니다. 동일한 연결어, 동일한 문장 시작부, 동일한 어휘 패턴을 일관되게 사용하는 학술적 산문은 자연스러운 인간 글쓰기의 다양하고 예측하기 어려운 패턴보다 AI 생성 텍스트의 단어 확률 시퀀스와 더 흡사할 수 있습니다. AI 검사기가 perplexity 와 burstiness 외에도 무엇을 측정하는가 에서 더 자세히 다루었습니다.
정제된 글쓰기가 오진 프로파일과 일치하는 이유
FAQ 는 오진하기 쉬운 텍스트를 이렇게 소개합니다:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas."(오진, 즉 인간이 쓴 텍스트를 AI 생성으로 잘못 표시하는 경우는 구조적 변화가 적은 내용, 말 그대로 자기 반복을 하는 텍스트, 또는 새로운 아이디어 전승 없이 각색된 텍스트일 수 있습니다.)
다음 문장은 이렇게 덧붙입니다: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated."(해당 텍스트에서 AI 글쓰기 비중이 높게 나온 경우 표시된 백분율을 해석할 때 이를 고려하시길 권장합니다.)
잘 다듬어진 학술적 산문은 첫 번째 항목에 해당할 수 있습니다. 글쓰기를 정제하다 보면 문장 구조가 표준화되고 연결어가 일관되며 형식적 어휘가 전체에 적용될 수 있습니다. 이는 '구조적 변화가 적은' 텍스트를 만들어냅니다. 문학적 관점에서 글쓰기를 향상시키는 정제 작업은 통계적 관점에서 더 균일하게 만들 수 있으며 바로 이 균일성이 오진 사례가 지적하는 특징입니다. 왜 AI 검사기가 잘 쓴 에세이를 표절로 의심하는가 에서 이 전체 논점을 다뤘습니다.
점수는 글쓰기 수준에 대한 평가가 아닙니다
FAQ 는 또한 명시합니다:
"Hence, we must emphasize that the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors."(따라서 AI 글쓰기 지표의 백분율을 교수가 조치를 취하거나 성적을 매기는 유일한 근거로 삼으면 안 된다는 점을 강조해야 합니다.)
AI 점수는 글쓰기 품질에 대한 평가가 아닙니다. 글쓰기가 지나치게 훌륭하거나 정제되었거나 형식적이라는 의미가 아닙니다. 특정 단어 확률 패턴 분류 결과 특정 백분율이 나왔다는 뜻일 뿐입니다. 어휘가 풍부하고 잘 쓴 텍스트에서 높은 점수가 나왔다고 해서 작업물의 가치가 떨어지는 것은 아닙니다. 텍스트의 통계적 프로파일이 모델이 AI 와 연관시킨 패턴과 겹친다는 의미입니다. 그렇다고 해서 글쓰기 방식을 바꿔야 하는지는 별개의 문제입니다. AI 표절을 피하기 위해 글쓰기 방식을 바꿔야 하는가 를 확인하세요.
이제 무엇을 해야 하는가
지금까지 설명한 내용을 정리하면 다음과 같습니다:
- 고급 어휘 자체만으로 AI 표절이 결정되지는 않습니다. 검사기는 어휘 수준이 아니라 단어 확률 패턴을 분석합니다.
- 구조가 균일한 학술적 산문은 AI 생성 텍스트와 통계적 특징을 공유할 수 있습니다.
- Turnitin 은 '구조적 변화가 많지 않은 내용'을 오진하기 쉬운 항목으로 나열했습니다.
- 정제 작업은 구조적 변화를 줄여 통계적 관점에서 텍스트를 더 균일하게 만들 수 있습니다.
- 점수는 글쓰기 품질에 대한 평가가 아니며 조치를 취하는 유일한 근거로 삼아서는 안 됩니다.
표절로 의심된 구간을 보여주는 Turnitin 리포트가 있다면 리포트 가져오기 를 통해 해당 구간만 집중적으로 수정하세요. 조건에 맞는 구간은 무료 재검토가 가능합니다.
계속 읽기