유학생과 AI 점수: 제 2 언어로 학술 글쓰기 할 때 알아야 할 것

제 2 언어로 학술 영어를 쓰는 것만으로도 힘든데 AI 탐지까지 걱정해야 한다면 더더욱 어렵습니다. Turnitin FAQ 에 따르면 편향을 최소화하기 위해 훈련 데이터에 제 2 언어 학습자를 포함했다고 합니다. 하지만 이 탐지기는 여전히 단어 확률 패턴을 기준으로 작동하며, 특정 작성 특성은 잘못 탐지될 가능성이 있습니다. 국제 학생이라면 이것이何を 의미하는지 알아야 합니다.

HumanPen 팀

· 4분

핵심 답변

Turnitin FAQ 에 따르면 이 모델의 훈련 데이터는 "편향을 최소화하기 위해 통계적으로 과소대표된 집단, 예컨대 제 2 언어 학습자, 비영어권 국가의 영어 사용자, 다양한 학생 구성을 가진 대학의 학생들, 그리고 인류학, 지질학, 사회학과 같이 덜 일반적인 학문 분야 등을 고려했다 (took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments, and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model)" 고 합니다. 이것은 Turnitin 자체의 주장이지 독립적으로 검증된 결론이 아닙니다. 훈련 세트에 포함되었다는 것은 해당 모델이 훈련 과정에서 제 2 언어 작문 샘플을 노출받았음을 의미합니다. 하지만 탐지기는 여전히 산문 텍스트의 단어 확률 패턴을 분류하는 방식으로 작동합니다. 따라서 작성한 글이 AI 생성 영어와 통계적 패턴이 일치하면, 영어가 모국어가 아니더라도 탐지기에 걸릴 수 있습니다. 훈련 주장과 탐지 메커니즘 사이의 이 격차를 이해하는 것이 탐지 결과에 대응하는 핵심입니다.

Turnitin 이 주장하는 편향 관련 내용

FAQ 에서 편향 문제를 직접 다룹니다:

"훈련 데이터셋을 만드는 동안 우리는 통계적으로 과소대표된 집단, 예컨대 제 2 언어 학습자, 비영어권 국가의 영어 사용자, 다양한 학생 구성을 가진 대학 및 대학교의 학생들, 그리고 인류학, 지질학, 사회학 등 덜 일반적인 학문 분야 등을 고려하여 모델 훈련 시 편향을 최소화했다 (While creating our sample dataset, we also took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments, and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model)."

이것은 회사의 훈련 방법론에 대한 공식 성명입니다. 훈련 데이터에 다양한 작문 샘플을 포함했다는 뜻입니다. 하지만 편향 수준에 대한 수치나 테스트 결과, 외부 검증은 제시하지 않습니다. 제 2 언어 작문이 훈련에 포함되었다는 것이 요지입니다. 그렇다고 제 2 언어 작문이 잘못된 탐지에서 면역이라는 뜻은 아닙니다. 모델은 다양한 데이터로 훈련되었지만, 여전히 단어 확률 패턴으로 분류합니다. 왜 비원어민 영어 작가가 AI 탐지기에 더 자주 걸리는지 에서 그 차이에 관한 연구를 확인할 수 있습니다.

탐지기가 내 글을 읽는 방식

탐지 파이프라인은 누가 썼는지와 상관없이 동일한 방식으로 작동합니다:

"논문이 Turnitin 에 제출되면 submission 에서 문장이 추출되어 겹치는 섹션으로 분할된 뒤 예측 분석이 수행됩니다. 각 섹션은 AI 탐지 모델로 분류되며 0 에서 1 사이의 값을 받아 해당 텍스트가 인간이 작성한 것인지 AI 생성인지의 확률을 나타냅니다 (When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated). 이러한 섹션 내의 각 해당 문장은 섹션 점수를 상속받습니다. 섹션이 겹치므로 일부 문장은 여러 점수를 가질 수 있으며, 이들은 단일 점수로 통합됩니다 (Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score). 이 문장 점수들은 더 집계되어 문서 전체의 AI 작성 점수를 계산하는 데 사용됩니다 (These sentence scores are further aggregated and used to compute the overall document AI writing score)."

탐지기는 사용자의 언어 배경을 알지 못합니다. 영어가 모국어인지 제 2 언어인지에 따라 분류를 조정하지 않습니다. 단어 시퀀스의 통계적 특징을 읽어 분류할 뿐입니다. 만약 영어 작문 패턴이, 이를테면 특정 학술 문구와 구조를 강조하는 정규 교육의 영향으로, AI 생성 텍스트와 겹치는 패턴을 보이면 예상보다 높은 점수가 나올 수 있습니다.

잘못된 탐지와 제 2 언어 작문

FAQ 는 잘못된 탐지가 일어나기 쉬운 텍스트 특징을 나열합니다:

"때때로 잘못된 탐지, 즉 인간이 작성한 텍스트를 AI 생성으로 오류 표시하는 경우는 구조적 변이가 많지 않거나, 문자 그대로 반복되거나, 새로운 아이디어를 발전시키지 못한 채로 의역된 텍스트에서 발생할 수 있습니다 (Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas)."

그다음 문장은 이렇게 덧붙입니다: "만약 우리 탐지기가 이러한 텍스트에서 AI 작위가 더 많이 나타나는 것으로 표시되면, 표시된 백분율을 볼 때 이를 고려하기 바랍니다 (If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated)."

이러한 특성 중 일부는 제 2 언어 학술 작문에서 더 흔히 나타날 수 있습니다. 비원어민 학습자들은 종종 정형화된 템플릿과 반복되는 학술 문구를 통해 영어를 배우는데, 이는 구조적 변이가 적은 작문을 초래할 수 있습니다. 'moreover', 'furthermore', 'in addition'과 같은 접속사가 표준 연결어로 가르쳐지며, 이들을 반복 사용하면 FAQ 에서 설명하는那种 균일한 구조가 생길 수 있습니다. 그렇다고 제 2 언어 작문이 항상 탐지된다는 뜻은 아닙니다. 잘못된 탐지와 관련된 특성이 교육받은 제 2 언어 작문에서 흔한 패턴과 겹칠 수 있다는 뜻입니다. 이것을 피하기 위해 작성 방식을 바꿔야 하는지는 별개의 질문입니다: 탐지를 피하기 위해 작성 방식을 바꿔야 할까 를 참고하세요.

자신의 점수는 확인할 수 없습니다

국제 학생들이 알아야 할 또 다른 사실이 있습니다. FAQ 에 따르면 "교수진과 관리자만 탐지 지표를 확인할 수 있습니다 (only instructors and administrators are able to see the indicator)". 학생들은 자신의 AI 점수를 확인할 수 없습니다. FAQ 는 이렇게 계속됩니다: "하지만 PDF 다운로드 기능을 통해 교수진이 AI 리포트를 다운로드하여 학생들과 공유할 수 있습니다 (However, with the PDF download feature, instructors can download and share the AI report with students)." 점수가 걱정된다면 교수진에게 PDF 보고서를 공유해 달라고 요청해야 합니다. 학생 계정으로는 동일한 검사를 직접 실행할 수 없습니다. PDF 를 받은 후에는 Turnitin AI 작성 리포트를 읽는 방법 이 다음 단계입니다.

탐지되었을 때 대처법

지금까지 다룬 내용을 요약하면:

  • Turnitin 은 편향을 줄이기 위해 훈련 데이터에 제 2 언어 학습자를 포함했다고 주장하지만, 이를 검증할 수 있는 실제 수치는 제시하지 않습니다.
  • 탐지기는 텍스트 작성자나 모국어를 고려하지 않고 단어 확률 패턴만을 읽습니다.
  • 낮은 구조적 변이와 같은 오 탐지 특성이 제 2 언어 학술 작문에서 흔히 나타나는 패턴과 겹칠 수 있습니다.
  • 학생은 자신의 AI 점수를 볼 수 없습니다. 교수진만 접근할 수 있으며, PDF 형태로 공유할 수 있습니다.
  • AI 점수와 유사성 점수는 서로 독립적으로 측정됩니다.

만약 어떤 부분이 탐지되었는지 표시된 Turnitin 리포트가 있다면, 리포트를 가져와서 해당 부분만 집중적으로 작업하세요. 조건을 만족하는 부분은 무료로 다시 검사할 수 있습니다.

계속 읽기