Turnitin이 인용한 인터뷰·설문 응답을 AI로 표시했다면? 실제로 무슨 일이 있었는지 짚어드립니다

인터뷰나 설문 조사를 다루는 부분에 참여자의 답변을 그대로 인용했는데, Turnitin이 그 부분을 AI가 쓴 것으로 표시했습니다. 분명 실제 사람이 쓴 답변인데, 탐지기는 왜 AI라고 판단했을까요. Turnitin의 공식 설명에 따르면 AI 탐지기는 언어 모델로 문장을 분석합니다. 그리고 인용문을 예외로 둔다는 이야기는 문서 어디에도 없습니다. 직접 인용문도 다른 문장과 똑같이 분석되기 때문에, 매끄럽게 다듬어진 참여자 답변이 표시될 수 있습니다. 이 페이지에서는 공식적인 판단 방식, 분석에서 제외되는 문장의 형태, 그리고 지금 취할 수 있는 구체적인 대응을 정리했습니다.

HumanPen 팀

· 4분

핵심부터 말하면

Turnitin의 AI 탐지는 인용문을 건너뛰지 않습니다. 공식 문서를 보면, 탐지기는 제출물에서 문장을 추출해 언어 모델로 분석합니다. 공식 페이지 어디에도 따옴표를 예외로 취급한다는 내용은 없습니다.

참여자의 답변을 인용한 문장이 유려한 산문처럼 읽힌다면, 원고의 다른 문장과 같은 방식으로 분석됩니다. 실제 사람이 한 말이 AI로 표시되는 이유가 여기에 있습니다. 탐지기는 문장 구조와 단어의 확률을 볼 뿐, 누가 그 말을 했는지는 보지 않습니다.

공식적인 판단 기준: 인용문이 아니라 문장입니다

탐지가 어떻게 이루어지는지 설명한 Turnitin FAQ에는 분석 단위가 분명히 적혀 있습니다.

When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1. (논문이 Turnitin에 제출되면 제출물에서 문장이 추출되어, 예측 분석을 위해 서로 겹치는 구간으로 나뉩니다. 각 구간은 AI 탐지 모델이 분류하고 0에서 1 사이의 값을 부여받습니다.)

단위는 문장입니다. AI 작성 보고서에 관한 공식 페이지도 같은 내용을 반대 방향에서 보충합니다. 비율은 장문 형식의 산문 문장을 기준으로 산출되며, "the model does not reliably detect AI-generated text in the form of non-prose, such as poetry, scripts, or code, nor does it detect short-form/unconventional writing such as bullet points, tables, or annotated bibliographies." (모델은 시, 대본, 코드처럼 산문이 아닌 형태의 AI 생성 텍스트는 안정적으로 탐지하지 못하며, 불릿 포인트, 표, 주석이 달린 참고문헌 목록처럼 짧거나 비표준적인 형식의 글도 탐지하지 않습니다.)

이 설명들 어디에도 "인용 텍스트"라는 분류는 없습니다. 따옴표로 묶인 문장도 탐지기에게는 그저 하나의 문장일 뿐입니다.

인용한 답변이 표시되는 이유

참여자 데이터를 인용할 때 취약해지는 지점은 두 가지입니다.

답변이 글이 아니라 말로 주어졌다는 점. 구술 답변을 전사하면 대개 짧고, 같은 말이 반복되거나 구어체로 남습니다. 그 형태를 그대로 두면 탐지기가 제외하는 단문 또는 비산문 텍스트로 취급될 수 있습니다. 하지만 대부분의 논문은 인용문을 흐르는 산문에 녹여 넣습니다. 참여자를 소개하고, 답변을 인용하고, 거기에 해설을 붙이는 식입니다. 그렇게 되면 인용문은 문단 속의 한 문장이 되고, 문장으로서 분석됩니다.

인터뷰 답변은 유독 일정한 형태를 띠는 경우가 있습니다. 구조화된 설문에 답한 참여자는 완결되고 구조가 고른 문장을 만들어내는 경향이 있습니다. 공식 문서의 표현을 빌리면, 탐지기는 사람과 AI 작성자의 "word probability sequences" (단어 확률의 배열)을 구분하도록 학습되었습니다. 그런데 지나치게 규칙적인 문장은 AI 생성 텍스트가 흔히 취하는 형태이기도 합니다. 인용문이 모델이 찾도록 학습된 대상과 닮아 보인다는 뜻입니다.

결국 어긋남이 생깁니다. 말은 실제 사람의 것인데, 통계적인 형태는 생성된 텍스트를 닮은 것입니다.

문서에서 제외한다고 밝힌 것과, 밝히지 않은 것

공식 문서의 제외 목록은 글의 출처가 아니라 형태에 관한 것입니다.

The model does not reliably detect AI-generated text in the form of non-prose, such as poetry, scripts, or code, nor does it detect short-form/unconventional writing such as bullet points, tables, or annotated bibliographies. (모델은 시, 대본, 코드처럼 산문이 아닌 형태의 AI 생성 텍스트는 안정적으로 탐지하지 못하며, 불릿 포인트, 표, 주석이 달린 참고문헌 목록처럼 짧거나 비표준적인 형식의 글도 탐지하지 않습니다.)

짧은 참여자 답변을 불릿이나 한 줄짜리 목록 항목으로 남겨 두면 분석 대상에서 벗어날 수 있습니다. 그런데 같은 답변을 본문에서 문장으로 풀어 쓰면 분석 대상에 들어갑니다. 따옴표만으로는 아무것도 달라지지 않습니다. 중요한 것은 그 문장이 장문 산문으로 읽히는지 여부입니다.

형태를 바꾸지 않고 인용문을 분석에서 "보호"할 수 있는 방법은 문서에 없습니다. 단문 형태로 남기거나, 아예 넣지 않는 것 외에는 방법이 없습니다.

보고서에서 인용문이 표시되었을 때 할 수 있는 일

유사도 보고서나 AI 보고서에서 인용한 참여자 답변이 표시되었다면, 공식 안내는 다른 표시 문장의 경우와 같습니다. 그 지표를 판결이 아니라 신호로 받아들이라는 것입니다. Turnitin FAQ는 그 비율에 대해 "should not be used as the sole basis for action or a definitive grading measure." (어떤 조치나 확정적인 성적 판단의 유일한 근거로 사용되어서는 안 됩니다.)라고 밝히고 있습니다.

취할 수 있는 선택지는 다음과 같습니다.

  • 표시된 문장 자체를 확인합니다. AI 보고서를 열어 표시된 부분을 직접 읽어보세요. 참여자의 인용문이라면 녹음이나 전사본과 대조해 확인할 수 있습니다. 그것이 곧 근거가 됩니다.
  • 인용문이 지금 형태여야 하는지 판단합니다. 분석에서 벗어나는 것은 목록 항목으로 남긴 한 줄 답변처럼 실제로 단문인 경우뿐입니다. 온전한 문장은 인용 블록으로 들여쓰든 말든 분석 대상에 남습니다. 모델은 형식과 무관하게 산문 문장을 읽기 때문입니다. 따라서 이 방법은 애초에 짧고 목록 형태였던 답변에만 통합니다.
  • 기록을 보관합니다. 전사본, 녹음 파일, 서명된 동의서는 그 말이 생성된 것이 아니라는 근거가 됩니다. 표시된 인용문과 이 기록들이 갖춰져야 지도교수와의 대화도 제대로 이어질 수 있습니다.
  • 인용문이 아니라 주변 문장만 조정합니다. 형태를 바꾸려고 참여자의 말을 다시 쓰면 데이터 자체가 달라집니다. 방어할 수 있는 대응은 인용문을 그대로 보존하고 전달 방식을 다시 살피는 것이며, 내용은 손대지 않는 것입니다.

정리하면

Turnitin의 AI 탐지기는 언어 모델로 문장을 분석하며, 공식 문서에는 인용문 예외 조항이 없습니다. 참여자의 답변도 산문 속에 녹아들면 다른 문장과 같이 분석되고, 지나치게 규칙적인 답변은 통계적으로 생성 텍스트와 닮아 보일 수 있습니다. 존재하는 제외 규정은 텍스트의 형태(단문, 목록, 비산문)에 관한 것이며 따옴표에 관한 것이 아닙니다. 인용문이 표시되었다면 그 지표는 판결이 아닌 신호입니다. 기록과 대조해 확인하고, 전달 방식을 다시 살피되 인용문의 내용은 그대로 두세요.