Notion이나 QuillBot으로 에세이를 다듬었는데 AI로 표시되었다면

중요한 것은 어떤 앱을 썼는지가 아니라 그 안에서 어떤 기능을 썼는지입니다. 맞춤법 검사와 패러프레이즈는 서로 다른 흔적을 남기며, Turnitin의 FAQ는 한 도구에 대해서만 이 경계를 분명히 긋고 있습니다.

HumanPen 팀

· 5분

짧은 답

문법 검사기에 에세이를 돌렸다가 AI로 표시되었다면, 질문은 그 도구가 대체로 "안전한가"가 아닙니다. 어떤 기능을 사용했는가입니다. Turnitin의 FAQ는 한 제품에 대해 직접 답합니다. Grammarly의 맞춤법, 문법, 문장부호 교정은 "in most cases," (대부분의 경우) 표시되지 않지만, 초안 생성, 패러프레이즈, 요약 등 Grammarly의 생성 기능이 만든 콘텐츠는 "will likely be flagged as AI-generated." (AI가 생성한 것으로 표시될 가능성이 높습니다)라고 합니다. Notion, QuillBot 등 다른 도구에 대해 Turnitin은 도구별 목록을 공개하지 않습니다. FAQ는 자사 탐지기가 주요 패러프레이즈 및 우회 도구를 탐지하도록 학습되고 시험되었지만, 어떤 도구인지는 공개할 수 없다고 말합니다. 도구 목록은 없어도 원칙상 경계는 분명합니다. 교정과 생성적 재작성은 다른 범주이며, 탐지기가 이를 다르게 읽는다는 점입니다.

Grammarly에 대해 Turnitin이 말하는 것

FAQ에는 Grammarly에 관한 자세한 답변이 있습니다. 해당 문단은 길고, 모든 절이 중요합니다.

"No. Our detector is not tuned to target Grammarly-generated spelling, grammar, and punctuation modifications to content but rather, other AI content written by LLMs such as GPT-3.5. Based on tests we conducted on human-written documents with no AI-generated content in them, in most cases, changes made by Grammarly (free & premium) and/or other grammar-checking tools were not flagged as AI-written by our detector. Please note that this excludes content generated by Grammarly's generative AI-powered features, including draft generation, paraphrasing, summarizing, and other features. Content produced using these features will likely be flagged as AI-generated by our detector." (아니요. 당사 탐지기는 Grammarly가 만든 맞춤법, 문법, 문장부호 수정을 겨냥한 것이 아니라, GPT-3.5와 같은 LLM이 쓴 다른 AI 콘텐츠를 겨냥합니다. AI 생성 콘텐츠가 전혀 없는 사람이 쓴 문서로 실시한 시험에서, Grammarly(무료 & 유료) 또는 다른 문법 검사 도구가 변경한 부분은 대부분의 경우 당사 탐지기에 AI가 쓴 것으로 표시되지 않았습니다. 다만 이는 초안 생성, 패러프레이즈, 요약 등 Grammarly의 생성형 AI 기능이 만든 콘텐츠에는 적용되지 않습니다. 이러한 기능으로 만들어진 콘텐츠는 당사 탐지기에 의해 AI가 생성한 것으로 표시될 가능성이 높습니다.)

이 문장은 둘로 나누어 읽어야 합니다. 앞부분은 면제 규정입니다. 탐지기가 겨냥한 것은 맞춤법·문법·문장부호 교정이 아니며, 시험한 사례에서는 표시되지 않았다는 뜻입니다. 여기서 "in most cases" (대부분의 경우)라는 단서가 실제로 중요한 역할을 합니다. 면제가 보장은 아니라는 뜻이기 때문입니다. 뒷부분은 경계입니다. 생성 기능은 다른 범주이며, 거기서 나온 콘텐츠는 표시될 가능성이 높습니다. 문단 전체는 Turnitin은 Grammarly를 AI 작성으로 탐지하는가에서 조목조목 살펴봤습니다.

앱보다 기능이 더 중요한 이유

Turnitin의 FAQ가 제품 이름으로 언급하는 도구는 Grammarly 하나뿐입니다. Notion, QuillBot 등 그 밖의 도구에 대해서는 공개된 입장이 없습니다. FAQ가 말하는 것은 다음과 같습니다.

"Our AI writing detector has been trained and tested to detect leading paraphraser and bypasser tools. However, to safeguard the integrity of our solution and its effectiveness in maintaining academic honesty, we're unable to disclose the names of these tools." (당사의 AI 작성 탐지기는 주요 패러프레이즈 도구와 우회 도구를 탐지하도록 학습되고 시험되었습니다. 다만 솔루션의 무결성과 학문적 정직성 유지에 대한 효과를 지키기 위해, 이러한 도구의 이름은 공개할 수 없습니다.)

저희는 특정 도구가 안전하다거나 안전하지 않다고 말할 수 없으며, 말하지도 않겠습니다. Turnitin이 목록을 공개하지 않고, 저희는 탐지 여부를 단정하는 일을 하지 않기 때문입니다. 말씀드릴 수 있는 것은 Grammarly FAQ가 하나의 틀을 세운다는 점입니다. 교정(맞춤법, 문법, 문장부호)이 한쪽에 있고, 생성 작업(초안 작성, 패러프레이즈, 요약)이 다른 쪽에 있습니다. 사용한 도구에 두 종류 기능이 모두 있다면, 어떤 앱을 열었는지보다 어떤 버튼을 눌렀는지가 더 중요합니다. 같은 틀 때문에 Turnitin은 AI 휴머나이저를 탐지하는가에도 도구 목록 형태의 답은 없습니다.

다듬기가 패러프레이즈로 보일 때

여기에는 함정이 있습니다. FAQ는 오탐에 포함될 수 있는 콘텐츠로 "paraphrased without developing new ideas" (새로운 생각을 전개하지 않고 패러프레이즈된) 텍스트를 꼽습니다. 전문은 다음과 같습니다.

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (때때로 오탐, 즉 사람이 쓴 텍스트를 AI가 생성한 것으로 잘못 표시하는 일은 구조적 변화가 거의 없는 콘텐츠, 말 그대로 반복되는 텍스트, 또는 새로운 생각을 전개하지 않고 패러프레이즈된 텍스트에서 발생할 수 있습니다.)

그리고 이어지는 문장입니다. "If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (그러한 텍스트에서 당사 지표가 AI 작성 비중을 높게 보여준다면, 표시된 비율을 볼 때 그 점을 고려하시기를 권합니다.)

즉, 패러프레이즈 도구는 이중의 문제를 만들 수 있습니다. 첫째, Turnitin이 탐지하도록 학습된 도구 가운데 하나라면 그 결과물이 직접 표시될 수 있습니다. 둘째, 특정 도구의 흔적으로 탐지되지 않더라도, 만들어진 텍스트가 오탐이 몰리는 글쓰기 유형에 들어맞을 수 있습니다. 균일한 구조, 말 그대로의 반복, 실질을 더하지 않고 단어만 섞은 패러프레이즈가 그렇습니다. 첫 번째 위험은 탐지이고, 두 번째 위험은 닮음입니다.

같은 텍스트, 두 개의 다른 점수

혼란을 더하는 요소가 하나 더 있습니다. AI 점수와 유사도 점수는 서로 독립적이라는 점입니다. Turnitin은 이렇게 밝힙니다. "The Similarity score and the AI writing detection percentage are completely independent and do not influence each other." (유사도 점수와 AI 작성 탐지 비율은 완전히 독립적이며 서로 영향을 주지 않습니다.) 패러프레이즈 도구는 유사도 점수를 낮추면서(텍스트가 기존 자료와 단어 단위로 일치하지 않게 되므로) 동시에 AI 점수를 높일 수 있습니다(결과물이 AI 생성 텍스트나 패러프레이즈된 텍스트와 닮게 되므로). 이 두 움직임은 모순되지 않습니다. 서로 다른 신호를 읽는 두 개의 별개 시스템에서 나온 결과입니다.

이 패턴을 여러 번 확인한 끝에 패러프레이즈로 유사도는 낮아졌는데 AI 점수가 올라간 경우에 무슨 일이 일어나는지에 관한 별도의 글을 썼습니다.

이미 표시된 경우의 대처법

지금까지의 내용을 정리하면 다음과 같습니다.

  • Grammarly의 맞춤법, 문법, 문장부호 교정은 "in most cases," (대부분의 경우) 표시되지 않지만, 생성 기능(패러프레이즈, 요약, 초안 생성)은 표시될 가능성이 높습니다.
  • Turnitin은 어떤 다른 도구를 탐지하는지 공개하지 않으므로, 검증된 "안전 목록"을 줄 수 있는 사람은 아무도 없습니다.
  • 앱 이름보다 사용한 기능이 중요합니다. 교정과 생성적 재작성은 다른 범주입니다.
  • 새로운 생각을 전개하지 않은 패러프레이즈 텍스트는 Turnitin이 직접 꼽은 오탐 취약 콘텐츠 목록에 있습니다.
  • AI 점수와 유사도 점수는 독립적이므로, 패러프레이즈 도구는 하나를 낮추면서 다른 하나를 높일 수 있습니다.

이미 표시되었다면 생산적인 질문은 "도구 탓인가"가 아니라 "which passages are flagged and why." (어떤 부분이 표시되었고 그 이유는 무엇인가)입니다. Turnitin 리포트 가져오기에서 표시된 특정 부분만 작업하세요. 요건을 충족하는 부분은 무료로 다시 실행할 수 있습니다.