연구 제안서가 Turnitin 에서 AI 작성으로 표시되는 이유

연구 제안서는 짧은 분량에 구조가 정해져 있고, 방법론 용어와 기존 문헌 요약이 대부분을 차지합니다. Turnitin 공식 문서에서도 이런 특징을 가진 텍스트가 false positive(오검출) 되기 쉽다고 명시하고 있습니다. 이 글에서는 제안서가 어떻게 탐지되는지, 그동안 어떤 개선이 있었는지, 그리고 AI 점수 하나로만 판단해서는 안 되는 이유를 설명합니다.

HumanPen 팀

· 5분

간단한 답

연구 제안서는 한정된 관용적 구조를 따릅니다. 방법론 섹션은 표준 절차를 설명하고, Turnitin 에서 내 방법론 섹션 전체가 flagged 됐다에서 그 실제 사례를 확인할 수 있습니다. 문헌 고찰은 기존 연구를 요약 형태로 정리합니다. 이런 패턴은 흔하며, Turnitin 문서가 false positive 영역으로 지적하는 특징과 일치합니다. 짧은 제안서 (수백 어 수준) 는 추가 위험이 있습니다. 텍스트가 너무 적어 세그먼트 중첩이 불가능하기 때문에 탐지기가 '전부 아니면 전무'식으로 처리합니다. 그 결과 AI 를 사용하지 않고도 인간이 작성한 genuine 한 제안서가 높은 AI 점수를 받을 수 있습니다.

Turnitin 이 False Positive 에 대해 하는 말

FAQ 는 false positive 를 유발할 수 있는 구체적 텍스트 특성을 다음과 같이 설명합니다:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (때때로 false positive, 즉 인간이 쓴 텍스트를 AI 생성으로 잘못 표시하는 경우는 구조적 변화가 거의 없는 콘텐츠, 문자 그대로 반복되는 텍스트, 새로운 아이디어 개발 없이 paraphrase 된 텍스트를 포함할 수 있습니다)

이 설명은 연구 제안서와 정확히 부합합니다. purposive sampling 과 semi-structured interviews 를 기술하는 방법론 섹션은 수천 개의 제안서에서 나타나는 표현입니다. 문헌 고찰은 복잡한 연구를 요약 문장으로 압축하는데, 이는 본질상 paraphrasing 이며 paraphrasing 이 Turnitin AI 점수를 올리는 이유에서 설명하듯 점수를 불리하게 만드는 경향이 있습니다. 어느 쪽도 그 순간 새로운 아이디어를 개발하는 활동은 아닙니다. FAQ 의 다음 문장이 중요합니다:

"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (만약 이러한 텍스트에서 AI 작성 비율이 높게 표시된다면, 표시된 백분율을 볼 때 이를 감안하시기 바랍니다)

이러한 특성을 가진 문서에 대해서는 백분율만으로 충분하지 않다는 점을 명시적으로 인정한 것입니다. 따라서 제안서에서 높은 점수가 나왔다면 확정적 판결이 아니라 조사해 볼 가치가 있는 신호로 받아들여야 합니다.

탐지 메커니즘의 작동 방식

제안서가 왜 취약한지 이해하려면 Turnitin 이 제출문을 어떻게 처리하는지 살펴봐야 합니다:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score." (논문이 Turnitin 에 제출되면 제출문에서 문장을 추출하여 예측 분석을 위해 중첩되는 섹션으로 분할합니다. 각 세그먼트는 AI 탐지 모델에 의해 분류되며 0 에서 1 사이의 값을 받는데, 이는 텍스트가 인간 작성일 확률과 AI 생성일 확률을 나타냅니다. 이 세그먼트 내의 각 qualifying sentence 는 해당 세그먼트의 점수를 물려받습니다)

핵심은 'qualifying sentence'입니다. 무엇이 적격 텍스트 에 해당하는지 FAQ 가 설명합니다:

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (이 qualifying text 는 산문 문장만 포함합니다. 즉, 표준 문법적 문장으로 쓰인 텍스트 블록만 분석하며 목록, 불릿 포인트 (짧은 비문장 구조) 또는 기타 비문장 구조와 같은 다른 유형의 작성은 포함하지 않습니다)

제안서의 경우 방법론 단락, 문헌 고찰 산문, 서술적 근거 텍스트가 모두 분석 대상이 됩니다. 반면 불릿 포인트로 포맷된 연구 질문이나 짧은 항목으로 된 타임라인 표는 분석되지 않습니다. 백분율만 볼 때 점수가 매겨지는 부분과 실제 페이지에 보이는 부분의 차이가 혼란스러울 수 있습니다.

짧은 문서와 '전부 아니면 전무'문제

연구 제안서는 대부분 짧습니다. 학위 논문 제안서는 1,500~3,000 단어 정도이며, 보조금 신청서 서술 섹션은 더 짧을 수 있습니다. FAQ 는 이 문제를 직접 다룹니다:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (수백 단어밖에 없는 짧은 문서에서는 예측이 대부분 '전부 아니면 전무'가 됩니다. 중첩 기회가 없이 단일 세그먼트만으로 예측하기 때문입니다)

다음 문장이 그 결과를 명확히 합니다:

"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (이는 AI 생성 콘텐츠와 오리지널 콘텐츠가 혼합된 일부 텍스트가 전적으로 AI 생성으로 flagged 될 수 있음을 의미합니다)

수백 단어 이상인 제안서도 qualifying prose 가 몇 개의 밀집된 단락에 집중되어 있다면 영향을 받을 수 있습니다. 세그먼트가 적으면 평균화가 덜 이루어지고, 하나의 고득점 세그먼트가 전체 백분율을 크게 끌어올릴 수 있습니다.

2023 년 Turnitin 이 개선한 사항

Turnitin 은 특정 false positive 를 줄이기 위해 변경을 가했습니다. 2023 년 5 월 릴리스 노트는 하나의 수정 사항을 설명합니다:

"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way. As a result, we have changed our detection logic to help reduce these false positives." (출시 이후 문서의 처음 몇 문장이나 마지막 몇 문장에서 false positive 탐지 빈도가 더 높다는 것을 관찰했습니다. 이러한 문장은 종종 일반적 방식으로 쓰인 서론 또는 결론 콘텐츠로 구성됩니다. 결과적으로 이러한 false positive 를 줄이기 위해 탐지 논리를 변경했습니다)

이 개선은 제안서에도 관련이 있습니다. 제안서의 서론은 공식적 패턴을 따르는 경우가 많기 때문입니다. 문제를 진술하고, 간극을 설명하고, 연구 질문을 제시합니다. 같은 릴리스 노트는 또 다른 개선을 언급합니다:

"We also worked on making our segment boundaries detection more precise which could lead in some rare cases to change of boundaries compared with a previous version." (또한 세그먼트 경계 탐지를 더 정밀하게 만드는 작업도 수행했는데, 이는 드문 경우 이전 버전과 비교하여 경계 변경으로 이어질 수 있습니다)

이들은 2023 년 개선 사항이지 현재의 결함이 아닙니다. 해당 업데이트 전후로 제안서 점수를 비교했다면 감소를 목격했을 수 있습니다. 앞서 설명한 근본적 구조 패턴은 오늘날 제안서 작성에도 여전히 존재합니다.

단일 점수로는 부족합니다

FAQ 는 AI 작성 점수의 한계에 대해 명시적입니다:

"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." (우리의 AI 작성 탐지 모델이 항상 정확하지는 않을 수 있으며 (인간 작성, AI 생성, AI paraphrase 된 텍스트를 잘못 식별할 수 있음) 따라서 학생에 대한 불이익 조치의 유일한 근거로 사용되어서는 안 됩니다)

다음 문장이 이를 강조합니다:

"It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." (학술 부정행위가 발생했는지 여부를 판단하려면 추가 심층 검토와 인간적 판단이 필요하며, 이는 조직의 구체적 학술 정책 적용과 함께 이루어져야 합니다)

Turnitin 의 별도 소스에서는 점수를 여러 정보 중 하나로 규정합니다:

"It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy." (이는 고립된 상태에서 결정적 답을 제공하려는 것이 아닙니다. 어떤 도구보다 중요한 것은 점수를 보고 자신의 학생에 대한 개인적 지식, 그들의 작업, 기관 정책과 이 정보를 균형 있게 조정하여 결정을 내리는 교육자입니다)

다음 문장이 생각을 완성합니다:

"When educators look at the AI writing score and utilize it as a single data point rather than a definitive response, then it is being used as intended." (교육자들이 AI 작성 점수를 확정적 응답이 아닌 단일 데이터 포인트로 보고 활용할 때, 이것이 의도된 대로 사용되는 것입니다)

연구 제안서에 적용하면, 높은 AI 백분율은 결론이 아니라 대화를 시작하는 계기가 되어야 합니다. AI 백분율이 높을 때 지도교수가 해야 할 일 에 해당 업체의 가이드라인이 나와 있습니다.

이것이 당신에게 의미하는 바

연구 제안서가 높은 Turnitin AI 점수를 받았다면 다음 사항을 기억하세요:

  • 제안서는 FAQ 가 false positive 영역으로 지적하는 관용적, paraphrased, 구조적으로 균일한 언어를 사용합니다.
  • 프로즈가 제한된 짧은 제안서는 중첩을 위한 세그먼트가 너무 적어 '전부 아니면 전무'예측을 낼 수 있습니다.
  • 백분율은 전체 문서가 아니라 qualifying prose 만 반영합니다.
  • Turnitin 이 2023 년에 첫 문장과 마지막 문장 처리를 개선했지만, 제안서 언어의 근본적 취약점은 그대로입니다.
  • AI 점수는 판단의 유일한 근거가 아니라 단일 데이터 포인트로 활용되어야 합니다.

flagged 된 구절을 처리하고 싶다면 Turnitin 리포트 가져오기 를 사용하여 작업할 수 있습니다. 자격 요건을 충족하는 구절은 무료로 재실행할 수 있습니다.