의미 변경 없이 AI 텍스트 인간화하기: 메커니즘은 이렇게 말합니다
'의미를 바꾸지 않고 (without changing meaning)'라는 표현은 탐지기가 의미를 읽는다고 전제합니다. 하지만 그렇지 않습니다. Turnitin 의 FAQ 에는 겹치는 텍스트 세그먼트를 의미론이 아니라 단어 확률로 분류하는 파이프라인이 설명되어 있습니다. 이 차이를 이해하는 것이 첫걸음입니다.
HumanPen 팀
· 5분
간단한 답변
'의미를 바꾸지 않고 AI 텍스트를 인간화한다 (humanize AI text without changing meaning)'는 문구에는 숨겨진 전제가 하나 있습니다. 바로 탐지기가 애초에 의미를 읽는다는 생각이죠. 하지만 Turnitin 의 공식 문서를 보면 그렇지 않다는 걸 알 수 있습니다. 제출된 텍스트는 겹치는 세그먼트로 나뉘어 각각 인간 또는 AI 생성 텍스트일 확률이 할당되고, 그 확률들이 풀링 (pooling) 과 집계를 거쳐 문서 수준의 점수로 통합됩니다. 탐지기는 단어 선택의 확률적 패턴을 읽을 뿐, 단어가 무엇을 mean 하는지는 읽지 않습니다. 그러니 '의미를 바꾸지 않는 것'과 '탐지기가 읽는 패턴을 바꾸지 않는 것'은 서로 다른 두 가지 조건입니다. 한 문단의 아이디어를 모두 그대로 유지해도 통계가 충분히 달라져 점수가 바뀔 수 있습니다. 두 지표가 서로 다른 것을 측정하기 때문입니다.
탐지기는 텍스트를 어떻게 읽는가
Turnitin 의 FAQ 에는 이런 식으로 설명되어 있습니다:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score."(논문이 Turnitin 에 제출되면 제출된 문장들이 추출되어 예측 분석을 위해 겹치는 섹션으로 분할됩니다. 각 세그먼트는 AI 탐지 모델에 의해 분류되며, 텍스트가 인간 또는 AI 생성일 확률을 나타내는 0 에서 1 사이의 값을 부여받습니다. 이러한 세그먼트 내의 각 적격 문장은 세그먼트 점수를 물려받습니다. 세그먼트가 겹치므로 일부 문장은 여러 개의 점수를 가질 수 있으며, 이는 단일 점수로 풀링됩니다. 이러한 문장 점수들은 더 집계되어 전체 문서의 AI 작성 점수를 계산하는 데 사용됩니다.)
이를 하나의 파이프라인으로 이해하면 됩니다. 텍스트가 입력되면 겹치는 조각으로 나뉘고, 각 조각에 확률이 할당되며, 문장은 해당 세그먼트의 점수를 물려받고, 겹치는 점수들이 풀링되어 하나의 숫자로 집계됩니다. 이 과정에서 모델이 문단의 주제를 파악하는 단계는 없습니다. 단어 시퀀스의 통계적 특징을 처리하며, 바로 그 특징들이 점수를 만들어냅니다.
단어 확률이 핵심입니다
FAQ 에서 看似 모순되는 두 진술이 실제로는 그렇지 않습니다. 첫 번째는 다음과 같습니다:
"Our model is not explicitly programmed to evaluate specific signals such as "burstiness," "perplexity," or other individual metrics sometimes referenced in public discussions."(우리 모델은 퍼블릭 디스커션에서 종종 언급되는 "burstiness", "perplexity" 등의 개별 공식을 명시적으로 평가하도록 프로그래밍되어 있지 않습니다.)
다음 문장은 이렇게 이어집니다: "Instead, it learns statistical patterns from our training data."(대신 학습 데이터에서 통계적 패턴을 학습합니다.)
두 번째 진술은 같은 페이지의 다른 질문에서 나온 것입니다: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers."(우리의 분류기는 이러한 단어 확률의 차이를 탐지하도록 훈련되어 있으며, 인간 작가의 특정 단어 확률 시퀀스를 잘 구분합니다.)
첫 번째 진술은 모델이 두 가지 명시된 공식을 계산하도록 설계되어 있지 않다고 말합니다. 두 번째 진술은 모델이 단어 확률 패턴을 기반으로 훈련된다고 말합니다. 이 둘은 모순되지 않습니다. 모델이 "perplexity"라는 숫자를 계산하여 임계값과 비교하는 것은 아니지만, 단어 확률 패턴으로부터 학습은 합니다. 이 차이가 중요한 이유는 많은 리라이팅 조언이 특정 공식을 움직이기만 하면 된다는 전제에 기반하기 때문입니다. 모델이 그 공식을 계산하지 않는다면, 그것을 움직이는 것은 사람들이 생각하는 만큼 효과적이지 않습니다. 이에 대해 더 자세히 알고 싶다면 perplexity 와 burstiness 이상으로 AI 탐지기가 측정하는 것 을 참조하세요.
의미와 통계가 갈라지는 이유
탐지기가 의미가 아니라 단어 확률 패턴을 읽는다면, 의미를 보존하는 리라이팅이 자동으로 점수를 바꾸는 리라이팅이 되는 것은 아닙니다. 두 목표는 서로 다른 차원에서 작동합니다.
예를 들어 어떤 문단이 "The results indicate a significant correlation between variables X and Y."라고 되어 있다면, 이를 "The findings show a meaningful link between X and Y."로 다시 쓸 수 있습니다. 의미는 동일합니다. 하지만 새로운 문장의 단어 확률 프로파일은 원문과 다릅니다. 그 차이가 점수를 올리든 내리든, 새로운 단어 시퀀스가 AI 생성 텍스트와 더 비슷해 보이는지 덜 비슷해 보이는지에 달려 있으며, 이는 문장만 보고 알 수 없습니다.
이것이 바로 '의미를 바꾸지 않고 (without changing meaning)'가 인간에게는 타당한 목표이지만 탐지기가 측정하는 것과 직접적으로 대응되지 않는 이유입니다. 탐지기는 논점이 보존되는지에는 무관심합니다. 완전히 다른 것을 읽고 있을 뿐입니다. 실제로 통계를 바꾸는 편집 은 이 문제를 수동으로 다룬 버전입니다.
리라이트가 역효과를 낼 때
Turnitin 의 FAQ 는 false positive 에 포함될 수 있는 텍스트를 다음과 같이 열거합니다:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas."(때때로 false positive(인간이 작성한 텍스트를 AI 생성으로 잘못 표시)에는 구조적 다양성이 부족한 콘텐츠, 문자 그대로 반복되는 텍스트, 새로운 아이디어 없이 패러프레이즈된 텍스트가 포함될 수 있습니다.)
다음 문장이 이어집니다: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated."(이러한 텍스트에서 AI 작성량이 높게 표시된다면, 표시된 백분율을 볼 때 이를 고려할 것을 권장합니다.)
위 목록의 세 번째 항목을 주의 깊게 읽어야 하며, 그렇게 읽으면 사람들이 생각하는 것보다 덜 제한적이라는 걸 알 수 있습니다. Turnitin 이 설명하는 것은 완성된 텍스트가 처한 상태일 뿐입니다. 마치 첫 두 항목이 구조적 변화 부족, 문자적인 반복, 아이디어가 발전하지 않은 상태를 설명하는 것처럼요. 텍스트를 그 상태로 만든 편집 작업에 대해서는 아무 말도 하지 않습니다. 더 나은 단어로 교체하는 것은 일반적인 교정이며, 모든 리라이트 도구 (저희 도구 포함) 가 이를 수행합니다. 목록에서 이를 반대하는 내용은 없습니다. 목록이 실제로 말해주는 것은 문단이 리라이트 후에도 여전히 들어갈 때와 똑같은 말을 할 수 있으며, Turnitin 이 그러한 상태의 텍스트를 false positive 에 취약하다고 본다는 점입니다. 이는 결과에 대한 주장이므로 직접 문단을 다시 읽어 확인해볼 수 있습니다. 의미를 정말로 변경해서는 안 되는 경우, 무엇을 고쳐 쓸 수 있고 무엇을 정확히 유지해야 하는지 가 섹션별로 선을 그어줍니다.
리라이트에 대한 함의
지금까지 다룬 내용을 요약하면 다음과 같습니다:
- 탐지기는 의미가 아니라 겹치는 세그먼트의 파이프라인을 통해 단어 확률 패턴을 읽습니다.
- 모델은 'burstiness'나 'perplexity'를 명시된 공식으로 계산하지는 않지만, 분류기는 단어 확률로 훈련됩니다.
- 의미를 보존하는 것과 탐지기가 읽는 통계를 바꾸는 것은 하나일 것 같지만 사실 두 개의 별개 조건입니다.
- 새 아이디어를 개발하지 않고 단순히 문장을 바꾼 텍스트는 Turnitin 이 false positive 위험이 있다고 명시한 목록에 포함되어 있습니다.
- AI 점수와 유사도 점수는 독립적이며 서로 영향을 주지 않습니다.
실무적으로 중요한 점은 좋은 리라이팅이 동시에 두 가지를 수행해야 한다는 것입니다: 아이디어는 그대로 유지하면서 플래그가 지정된 부분의 단어 확률 프로파일을 변경해야 합니다. Turnitin 보고서가 있다면 보고서를 가져와서 플래그가 지정된 특정 부분만 수정하세요. 조건에 맞는 부분은 추가 요금 없이 다시 실행할 수 있습니다.