Turnitin이 내 논문으로 AI를 학습시키는지: 공식 FAQ의 답변
학생들이 흔히 품는 걱정이 있습니다. "Turnitin이 내 논문을 갖고 있습니다. 이걸로 AI를 학습시키는 건 아닐까요? 삭제해 달라고 요청할 수 있을까요?" 공식 FAQ는 두 질문 모두에 대해 간단히 예 혹은 아니오로 답하지 않습니다. 문서에는 모델이 AI가 생성한 학술 텍스트와 사람이 쓴 학술 텍스트의 대표 표본, 그리고 방대한 자체 학술 데이터 코퍼스로 학습되었다고 나와 있으며, 학생 제출물이 제외된다는 말은 없습니다. 삭제에 대해서는 고객이 제출물 전체 삭제를 요청할 수 있지만 부분 삭제는 지원하지 않는다고 되어 있습니다. 이 페이지에서는 정확한 문구와, 그것이 보장하는 것과 보장하지 않는 것, 그리고 자신의 논문을 시스템에서 빼고 싶은 학생에게 이것이 무엇을 뜻하는지를 차근히 짚어 봅니다.
HumanPen 팀
· 4분
짧은 답
Turnitin의 FAQ에는 제출한 논문이 AI 탐지 모델 학습에 쓰인다는 말이 없습니다. 그렇다고 제외된다는 말도 없습니다. 공식 문구는 모델이 AI가 생성한 학술 텍스트와 사람이 쓴 학술 텍스트의 "a representative sample" (대표 표본)으로 학습되었으며, Turnitin의 모델은 "trained on our vast inhouse corpus of academic data." (당사의 방대한 자체 학술 데이터 코퍼스로도 학습되었습니다)라고 되어 있습니다.
실제로 취할 수 있는 조치는 삭제입니다. FAQ에는 기관이 제출물 전체 삭제를 요청할 수 있고, 부분 삭제는 지원하지 않는다고 나와 있습니다. FAQ는 이를 기관 차원의 요청으로 규정하며, 학생이 자기 논문을 직접 삭제해 달라고 요청하는 경로는 설명하지 않습니다. GDPR과 같은 데이터 보호법에 따라 별도의 삭제 권리를 갖는지 여부는 이 FAQ가 다루지 않는 법적 문제입니다.
학습에 관한 공식 문구
Turnitin의 AI 탐지 FAQ는 "How was Turnitin's model trained?" (Turnitin의 모델은 어떻게 학습되었나요?)라는 질문에 이렇게 답합니다.
"Our model is trained on a representative sample of data spread over a period of time, that includes both AI generated and authentic academic writing across geographies and subject areas." (당사 모델은 일정 기간에 걸쳐 분포한 데이터의 대표 표본으로 학습되며, 여기에는 여러 지역과 학문 분야의 AI 생성 학술 텍스트와 사람이 쓴 학술 텍스트가 모두 포함됩니다.)
탐지가 어떤 모델에 기반하는지를 다루는 두 번째 FAQ 답변은 한발 더 나아갑니다.
"More importantly, our models are also trained on our vast inhouse corpus of academic data." (더 중요한 점은, 당사 모델이 방대한 자체 학술 데이터 코퍼스로도 학습되었다는 것입니다.)
두 문장 모두 학습 데이터의 일부로 학생 제출물을 지목하지 않습니다. 그리고 두 문장 모두 그것을 배제하지도 않습니다. "Authentic academic writing" (사람이 쓴 학술 텍스트)와 "inhouse corpus of academic data" (자체 학술 데이터 코퍼스)는 공식 문서가 단어의 출처를 설명하는 데 가장 가까이 다가선 표현입니다. 그리고 두 표현 모두 개별 논문에 대한 질문을 열어 둡니다.
이것이 "학습" 부분의 전부입니다. FAQ는 제출된 논문이 학습 데이터에 섞여 있을 가능성을 부인하지 않습니다. 그렇다고 확인하지도 않습니다.
삭제에 관한 공식 문구
데이터 삭제에 관한 FAQ의 질문은 고객, 즉 기관의 관점에서 답변되어 있습니다.
"Yes, customers can request a full deletion of their submissions; we cannot support partial data deletion requests to delete only the AI writing component of the submission data." (예, 고객은 제출물 전체 삭제를 요청할 수 있습니다. 다만 제출 데이터에서 AI 작성 부분만 삭제하는 식의 부분 데이터 삭제 요청은 지원하지 못합니다.)
여기서 두 가지 결론이 나옵니다.
첫째, 삭제는 원칙적으로 가능하지만 요청 주체는 기관입니다. 제출물을 지우고자 하는 대학은 자기가 보유한 데이터의 전체 삭제를 요청할 수 있습니다. 둘째, AI 부분만 삭제할 수는 없습니다. "AI 점수만 지우고 논문은 남기는" 선택지는 없으며, 학생 개인이 삭제를 요청하는 경로도 FAQ에는 나와 있지 않습니다.
따라서 "내 논문을 삭제해 달라고 요청할 수 있나요?"라는 질문은, 이 FAQ가 설명하는 내용에 따라 답하면 명확합니다. 이 FAQ를 통해서는 되지 않습니다. 이 문서가 제시하는 것은 기관을 통한 경로뿐입니다. 직접 행사할 수 있는 권리가 있는지는 이 문서가 아니라 해당 관할 구역의 데이터 보호법이 정하는 문제입니다.
FAQ가 저장소에 대해 실제로 말하는 것
같은 FAQ에는 사실 많은 학생이 찾는 문장도 들어 있습니다. 바로 옆에 붙어 있는 걱정거리에 대한 문장입니다.
"No, it does not. There is no separate repository for AI writing detection, and customers retain the ability to choose whether to add their student papers into the repository or not." (아니요, 그렇지 않습니다. AI 작성 탐지를 위한 별도 저장소는 없으며, 학생 논문을 저장소에 추가할지 여부를 선택할 권한은 고객에게 있습니다.)
이것은 "AI 탐지 저장소", 즉 Turnitin이 논문을 AI 검사 전용 데이터베이스에 넣어 둔다는 생각에 대한 답변입니다. FAQ는 AI 작성 탐지를 위한 별도 저장소가 없으며, 유사도 저장소에 논문을 추가할지 결정하는 권한은 기관에 있다고 말합니다.
이 답변에는 "학습"이라는 단어가 나오지 않습니다. AI 탐지 저장소와 학습 데이터는 다른 것이며, FAQ는 둘을 분리해서 다룹니다. 탐지용 별도 저장소는 없고, 학습에 관해서는 아무런 언급도 없습니다.
이것이 나에게 뜻하는 것
논문을 제출한 뒤 그 활용 방식이 걱정되는 학생이라면, 솔직한 요약은 다음과 같습니다.
- 공식 FAQ는 내 논문이 모델을 학습시킨다고 확인하지 않습니다. 그리고 학습시키지 않는다고 약속하지도 않습니다.
- 가장 가까운 공식 서술은 학습 데이터를 "authentic academic writing" (사람이 쓴 학술 텍스트)과 "inhouse corpus" (자체 코퍼스)로 표현합니다. 둘 다 학생 제출물을 배제하지 않습니다.
- 삭제는 존재하지만, 그것은 학생 단위의 삭제가 아니라 기관 단위의 전체 삭제이며, 부분 삭제는 지원되지 않습니다.
- "별도 저장소 없음"이라는 답변은 AI 탐지를 위한 저장에 관한 것이며, 학습에 관한 것이 아닙니다.
이 정보로 할 수 있는 일은 다음과 같습니다. 내 논문의 AI 탐지 결과가 걱정된다면, 실질적인 쟁점은 데이터 소유권이 아니라 점수 해석과 재검사입니다. 걱정이 기관을 향해 있다면 창구는 대학의 Turnitin 관리자입니다. FAQ가 삭제 요청을 말할 때의 "고객"이 바로 그 사람입니다.
정리하자면
Turnitin의 FAQ는 제출된 논문이 자사 AI 모델을 학습시킨다는 점을 확인도 부인도 하지 않습니다. 공식 문서는 학습 데이터를 사람이 쓴 학술 텍스트의 대표 표본과 방대한 자체 코퍼스로 설명하며, 학생의 작업을 배제하는 말은 하지 않습니다. 삭제와 관련해 공식적으로 제시된 경로는 기관 차원의 전체 삭제 요청뿐이며, 학생 개인의 삭제는 설명되어 있지 않습니다. 학교가 무엇에 동의했는지 알고 싶다면 물어볼 사람은 대학의 Turnitin 관리자이지, Turnitin 지원팀이 아닙니다.