프롬프트로 AI 점수를 안정적으로 낮출 수 없는 이유
'AI 점수 낮추는 지침'을 찾는 사람들은 올바른 프롬프트만 있으면 감지기가 읽는 수치를 바꿔놓을 수 있을 거라고 생각합니다. 하지만 프롬프트는 AI 모델에 의해 처리되고, 모델은 자체 단어 확률 패턴을 가진 텍스트를 만들어냅니다. Turnitin FAQ 는 패러프레이저나 우회 도구 (bypasser) 로 수정된 텍스트도 감지할 수 있다고 명시합니다. 이 원리 때문에 프롬프트만으로는 믿을 만한 해결책이 될 수 없습니다.
HumanPen 팀
· 4분
간단 명료하게
프롬프트란 AI 모델이 처리하는 텍스트 명령입니다. "이거 사람처럼 들리게 다시 써줘"라든가 "burstiness 와 perplexity 를 넣어줘"라고 시키면, 모델은 그 명령을 바탕으로 새 텍스트를 만들어냅니다. 그런데 이렇게 나온 텍스트도 결국 단어 확률 패턴을 가지고 있고, 바로 이 패턴을 Turnitin 분류기가 읽습니다. 감지기는 당신의 프롬프트를 보지 못합니다. 결과물만 보죠. 결과물의 점수가 더 낮아질지는, 그 단어 확률 프로필이 AI 가 쓴 것으로 학습된 패턴과 충분히 다른지에 달려 있는데, 이건 더 나은 명령을 쓴다고 통제할 수 있는 게 아닙니다. 단어 선택을 결정하는 건 모델이고, 감지기가 포착하도록 훈련된 것도 바로 그 모델의 단어 선택입니다.
감지기가 실제로 보는 것
Turnitin FAQ 에 이 프로세스가 설명되어 있습니다:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score."(논문이 Turnitin 에 제출되면, 제출된 문서에서 문장들을 추출하여 예측 분석을 위해 겹치는 섹션으로 분할합니다. 각 세그먼트는 AI 감지 모델에 의해 분류되며, 텍스트가 인간 작성 또는 AI 생성일 확률을 나타내는 0 에서 1 사이의 값을 부여받습니다. 이 세그먼트 내의 각 해당 문장은 세그먼트의 점수를 물려받습니다. 세그먼트가 겹치기 때문에 일부 문장은 여러 점수를 가질 수 있으며, 이들은 단일 점수로 통합됩니다. 이러한 문장 점수들은 더욱 집계되어 전체 문서의 AI 작성 점수를 계산하는 데 사용됩니다.)
감지기는 텍스트 속 단어 시퀀스의 통계적 특징을 읽습니다. 당신이 쓴 프롬프트는 보지 못합니다. 그 텍스트가 생성된 것인지, 재작성된 것인지, 인간이 편집한 것인지도 알 수 없습니다. 최종 단어 시퀀스만 보고 분류할 뿐입니다.
"burstiness 조절"이 레버가 아닌 이유
흔히 쓰는 명령 중 하나가 AI 에게 "burstiness 를 높여라" 아니면 "perplexity 를 다양하게 해라"라고 지시하는 것입니다. Turnitin FAQ 는 이렇게 밝히고 있습니다:
"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions."("저희 모델은 'burstiness', 'perplexity' 등 공개 논의에서 종종 언급되는 특정 신호나 개별 지표를 평가하도록 명시적으로 프로그래밍되어 있지 않습니다.")
바로 다음 문장은 이렇습니다: "Instead, it learns statistical patterns from our training data."("대신 훈련 데이터에서 통계적 패턴을 학습합니다.")
동일 페이지에서 이런 설명도 있습니다: "Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers."("저희 분류기는 이러한 단어 확률의 차이를 감지하도록 훈련되어 있으며, 인간 작성자의 특정 단어 확률 시퀀스를 능숙하게 파악합니다.")
모델은 burstiness 라는 지표를 계산해서 임계값과 비교하지 않습니다. 그러니 AI 에게 "burstiness 를 높여라"라고 지시하는 건, 감지기가 당신이 생각하는 방식으로 측정하지 않는 것을 조정하라고 부탁하는 셈입니다. 감지기가 실제로 측정하는 건 훈련 데이터에서 학습된 단어 확률 패턴입니다. "더 많은 burstiness"를 가진 AI 生成 텍스트가 실제로 유리한 방향으로 패턴을 옮기는지는 출력만 보고 검증할 수 없습니다. Turnitin 은 perplexity 와 burstiness 를 사용할까 에서 이 질문에 대해 더 자세히 다뤘습니다.
AI 가 AI 를 재작성하면 감지 가능한 텍스트가 나옵니다
여기엔 더 근본적인 문제가 있습니다. AI-generated 로 플래그가 뜬 텍스트를 AI 로 재작성한다면, 그건 AI 도구에 의해 수정된 텍스트를 만들어내는 겁니다. Turnitin FAQ 는 이렇게 말합니다:
"Furthermore, it can also identify instances where AI-generated text may have been modified by AI paraphraser or bypasser (also called humanizers) tools to evade detection."("또한 탐지를 회피하기 위해 AI 패러프레이저나 바이패서 (휴머나이저라고도 함) 도구로 수정된 AI 生成 텍스트의 사례도 식별할 수 있습니다.")
감지기는 단순히 raw AI-generated 텍스트만 찾는 게 아닙니다. 패러프레이저나 바이패서 도구를 거친 텍스트도 함께 찾고 있습니다. 한 AI 에게 다른 AI 의 결과물을 재작성하라고 프롬프트를 쓰면, 그 결과는 기능적으로 패러프레이저 출력과 같습니다. 감지기는 바로 그런 종류의 텍스트를 식별하도록 훈련되어 있습니다. 그런 결과에 대해서는 별도 글이 있습니다: 다른 AI 로 AI 텍스트를 고쳐썼는데도 Turnitin 이 여전히 flagged 했다.
재작성이 잘못될 때
Turnitin FAQ 는 거짓 양성 (false positive) 이 발생하기 쉬운 텍스트 유형도 나열하고 있습니다:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas."("가끔 거짓 양성 (인간이 쓴 텍스트를 AI 生成으로 잘못 표시하는 경우) 에는 구조적 변화가 거의 없는 콘텐츠, 문자 그대로 반복되는 텍스트, 새로운 아이디어를 발전시키지 않고 패러프레이즈된 텍스트가 포함될 수 있습니다.")
바로 다음 문장: "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated."("우리 지표가 이러한 텍스트에서 더 많은 AI 작성을 표시한다면, 표시된 백분율을 볼 때 이를 고려하시기를 권장합니다.")
세 번째 항목이 특히 주목할 만합니다. "새로운 아이디어를 발전시키지 않고 패러프레이즈됨"이라는 표현은 AI 가 실질적인 내용을 추가하지 않고 단어만 짜맞춰 텍스트를 재작성할 때 어떤 일이 벌어지는지를 설명합니다. 감지기는 균일한 구조와 기계 생성 패러프레이즈를 연상시키는 단어 패턴을 포착합니다. 그래서 표면적인 단어만 바꾸고 구조는 그대로 유지하는 AI 재작성은 텍스트를 거짓 양성 프로파일에서 멀어지게 하는 게 아니라, 오히려 더 가깝게 만들 수 있습니다. 실제로 수치를 바꾸는 편집 에서 수동으로 작업할 때의 대안적인 방식을 보여줍니다.
실제로 점수를 바꾸는 것
지금까지 다룬 내용을 정리하면:
- 프롬프트는 AI 모델에 의해 처리되며, 이 모델은 자체 단어 확률 패턴을 가진 텍스트를 만들어냅니다. 감지기는 명령이 아니라 결과물을 봅니다.
- 모델은 burstiness 나 perplexity 를 명시적 지표로 계산하지 않으므로, AI 에게 이를 "조정"하라고 지시해도 감지기가 읽는 내용에 영향이 없을 수 있습니다.
- Turnitin 은 패러프레이저와 바이패서 도구로 수정된 텍스트를 적극적으로 감지합니다. 바로 이것이 AI 가 AI 를 재작성할 때 생산되는 것입니다.
- 실질적인 내용을 추가하지 않고 단어만 짜맞추는 재작성은 텍스트를 거짓 양성 프로파일에 더 가깝게 만들 수 있습니다.
- 점수를 바꾸는 건 더 나은 프롬프트를 쓰는 게 아니라, 플래그가 뜬 구절들의 단어 확률 프로필을 바꾸는 것입니다.
어떤 구절이 플래그가 떴는지 보여주는 Turnitin 리포트가 있다면, 리포트를 가져와서 해당 구절들에 집중적으로 작업하세요. 조건을 충족하는 구절은 무료로 다시 실행할 수 있습니다.
계속 읽기