Perplexity와 Burstiness 신화: Turnitin이 실제로 사용하는 것

Turnitin은 perplexity와 burstiness를 이름 있는 지표로 사용하지 않는다고 분명히 부인합니다. 문서에 실제로 적혀 있는 내용을 정리하고, 이 구분이 여러분의 글쓰기에 왜 중요한지 설명합니다.

HumanPen 팀

· 5분

이 신화와 그 출처

“Turnitin은 AI 글을 어떻게 감지하는가”를 검색하면 같은 주장을 되풀이하는 글이 수십 개씩 나옵니다. Turnitin이 AI가 만든 텍스트를 찾아내려고 perplexity와 burstiness를 사용한다는 것입니다. 이 주장은 aihumaniser.pro, blog.aibusted.com, humanizethisai.com 같은 사이트와 sohu.com의 중국어 글에도 등장합니다. 이들은 두 지표를 정의하고 그것을 Turnitin의 것이라고 단정한 뒤, 감지를 통과하려고 “perplexity 점수를 낮추는” 방법을 조언합니다.

문제는 이 주장이 사실과 다르다는 점입니다. Turnitin의 자체 문서는 정반대를 말합니다. 저희는 공식 FAQ를 읽었고, 그 내용은 경쟁 사이트들이 조언의 토대로 삼아 온 perplexity·burstiness 서사를 정면으로 반박합니다. 이 신화가 너무 널리 퍼진 나머지, 이제 많은 학생과 필자는 Turnitin이 계산하지 않는 지표에 맞춰 글을 최적화해야 한다고 믿고 있습니다.

이것이 중요한 이유는, 잘못된 전제 위에 세운 전략은 잘못된 판단으로 이어지기 때문입니다. Turnitin이 perplexity 점수를 계산한다고 믿으면, 존재하지 않는 지표를 움직여 보려고 무작위한 단어를 끼워 넣는 데 집중하게 될 수 있습니다. 실제 메커니즘은 다릅니다.

Turnitin 문서에 실제로 적혀 있는 내용

Turnitin의 공식 FAQ는 perplexity와 burstiness 문제를 직접 다룹니다. 문서에는 이렇게 적혀 있습니다. “Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions.” (저희 모델은 'burstiness', 'perplexity' 또는 공개적인 논의에서 간혹 언급되는 다른 개별 지표 같은 특정 신호를 평가하도록 명시적으로 프로그래밍되지 않았습니다.) 다음 문장은 이렇게 이어집니다. “Instead, it learns statistical patterns from our training data.” (대신, 학습 데이터에서 통계적 패턴을 학습합니다.)

이는 명백한 부인입니다. Turnitin은 여러분의 텍스트를 두고 perplexity 계산을 수행하지 않습니다. 모델이 burstiness 점수를 보고 문장 길이가 충분히 다양한지 확인하는 것도 아닙니다. 이 시스템은 이름 있는 소수의 지표를 계산해 공식에 넣는 방식으로 작동하지 않습니다.

문서는 한 걸음 더 나아가 그 이유를 설명합니다. Turnitin은 이렇게 밝힙니다. “As a result, its outputs are generated by many learned patterns working together rather than by a small set of transparent, human-readable rules. For that reason, individual predictions may not always be explainable in simple feature-by-feature terms.” (그 결과, 이 모델의 출력은 소수의 투명하고 사람이 읽을 수 있는 규칙이 아니라, 함께 작동하는 수많은 학습된 패턴에 의해 생성됩니다. 따라서 개별 예측이 항상 특성 단위로 단순하게 설명될 수 있는 것은 아닙니다.) 모델의 판단 과정은 지표 목록으로 축약할 수 있는 것이 아닙니다. 분류기는 학습 데이터에서 패턴을 학습했고, 그 패턴은 개별 특성으로 설명할 수 없는 방식으로 함께 작동합니다.

이것이 “Turnitin은 단어 확률을 무시한다”는 말과 같지 않은 이유

공식 입장을 지나치게 확대 해석할 위험이 있습니다. Turnitin이 perplexity를 사용하지 않는다고 하고, perplexity가 단어 확률의 척도라면, Turnitin이 단어 확률을 전혀 무시한다는 뜻일까요? 아닙니다. 같은 FAQ 페이지가 결정적인 반론을 제시합니다. “Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers.” (저희 분류기는 단어 확률에서 이러한 차이를 감지하도록 학습되었으며, 사람 필자에게 나타나는 특유의 단어 확률 순서에 능합니다.)

이 문장 때문에 단순한 해석은 성립하지 않습니다. Turnitin이 부인하는 것은 burstiness와 perplexity를 이름 있는 지표로 명시적으로 프로그래밍했다는 점입니다. 단어 확률이 분류기가 하는 일의 중심에 있다는 점을 부인하는 것은 아닙니다. 같은 문서가 단어 확률이야말로 분류기가 학습하는 대상이라고 확인합니다. 차이는 “perplexity”라는 이름의 지표를 계산하는 것과 학습 데이터를 통해 단어 확률 패턴을 익히는 것 사이에 있습니다.

perplexity는 단어 확률의 척도입니다. perplexity가 낮다는 것은 그 문맥에서 단어들이 예측 가능하다는 뜻입니다. 높다는 것은 예측하기 어렵다는 뜻입니다. Turnitin의 분류기는 단어 확률 패턴을 학습하므로, perplexity가 측정하는 개념은 이 모델이 하는 일과 관련이 있습니다. Turnitin이 부인하는 것은 단일 perplexity 점수를 이름 있는 특성으로 명시적으로 계산한다는 점입니다. transformer 기반 모델은 학습 데이터에서 복잡한 통계적 패턴을 학습하며, 그 패턴에는 단어 확률 정보가 담겨 있지만 단일한 이름 있는 지표로 환원되지는 않습니다.

반면 GPTZero는 perplexity와 burstiness를 이름 있는 지표로 사용한다고 공개적으로 밝히고 있습니다. 이는 두 탐지기 사이의 실제 차이입니다. 둘을 혼동하면 잘못된 조언으로 이어집니다. GPTZero에서 통하는 요령이 Turnitin에도 반드시 적용되는 것은 아닙니다. 두 도구가 서로 다른 방식을 쓰기 때문입니다.

실제 메커니즘은 어떻게 작동하는가

Turnitin이 perplexity와 burstiness를 계산하지 않는다면, 실제로는 무엇을 하고 있을까요? 문서는 경쟁 사이트의 글이 설명하는 지표 기반 접근과는 상당히 다른 처리 과정을 기술합니다. Turnitin은 이렇게 밝힙니다. “When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.” (논문이 Turnitin에 제출되면, 제출물에서 문장이 추출되어 예측 분석을 위해 겹치는 구간으로 분할됩니다. 각 구간은 AI 탐지 모델이 분류하고 0에서 1 사이의 값을 부여받으며, 이 값은 해당 텍스트가 사람이 쓴 것인지 AI가 생성한 것인지의 확률을 나타냅니다. 이 구간에 포함된 자격을 갖춘 각 문장은 구간의 점수를 물려받습니다. 구간이 겹치므로 여러 점수를 갖는 문장도 있고, 그 점수들은 하나로 합쳐집니다. 이 문장 점수들은 다시 집계되어 문서 전체의 AI 작성 점수를 계산하는 데 사용됩니다.)

여러분의 논문은 하나의 덩어리로 평가되지 않습니다. 문장이 추출되어 겹치는 구간으로 나뉩니다. 각 구간은 0에서 1 사이의 점수를 받습니다. 구간이 겹치기 때문에 하나의 문장이 여러 구간에 등장해 여러 점수를 물려받을 수도 있습니다. 그 점수들은 합쳐진 뒤 문서 수준의 최종 비율로 집계됩니다.

이 메커니즘은 perplexity 점수와 burstiness 점수를 계산해 결합하는 것과는 근본적으로 다릅니다. 분류기는 구간 수준에서 텍스트를 평가하고, 사람의 글과 AI가 생성한 글을 구분하는 통계적 패턴을 학습합니다. 그 패턴에는 단어 확률 정보가 담겨 있지만, 이는 이름 있는 지표로 프로그래밍된 것이 아니라 학습 데이터에서 익힌 것입니다.

이것을 제대로 이해하는 것이 왜 중요한가

실제 메커니즘을 이해하면 따라야 할 조언도 달라집니다. Turnitin이 perplexity를 계산한다고 믿으면 예측하기 어려운 단어를 끼워 넣게 될 수 있습니다. burstiness를 계산한다고 믿으면 문장 길이를 일부러 다양하게 만들게 될 수 있습니다. 두 전략 모두 올바른 표적을 겨냥하고 있지 않습니다.

Turnitin의 분류기는 학습 데이터에서 통계적 패턴을 학습합니다. 여러분의 텍스트를 두고 perplexity 점수를 계산하지는 않습니다. 학습한 패턴은 복잡해서, 문서가 말하듯 항상 특성 단위로 단순하게 설명할 수 있는 것은 아닙니다. 단일 지표를 최적화해 탐지기를 “이기는” 간단한 공식은 없습니다.

여러분이 할 수 있는 것은 진짜 사람의 저작임이 드러나는 방식으로 쓰는 것입니다. 사람의 글에는 AI 모델이 만들어 내는 통계적 패턴과는 다른 단어 선택과 표현이 담기는 경우가 많습니다. 분류기는 사람 필자에게 특징적인 단어 확률의 순서를 인식하도록 학습되어 있습니다. 자기 목소리로, 그 자연스러운 변화를 담아 쓰는 것, 바로 그것이 분류기가 사람의 글로 인식하도록 설계된 방식입니다.

perplexity·burstiness 신화는 노력을 엉뚱한 데 쓰게 만듭니다. 필자는 Turnitin이 계산하지 않는 지표를 최적화하는 데 시간을 씁니다. GPTZero(perplexity와 burstiness를 실제로 사용함)와 Turnitin(사용하지 않음)의 차이 때문에, 한 도구에 맞춰 조정된 조언이 다른 도구에는 무관할 수 있습니다.

조건을 충족하는 부분은 무료로 다시 실행할 수 있습니다. 여기에서 HumanPen 도구를 사용해 보실 수 있습니다.

계속 읽기