Turnitin은 PDF에서 AI를 감지할 수 있을까요?
대부분의 사람은 이 질문에 돌아서 도착합니다. 과제 제출 포털이 PDF를 요구하거나, 투고하려는 저널이 PDF를 요구하고, 그 과정 어딘가에서 형식 자체가 탐지기가 보는 것을 바꾸는지 궁금해지기 시작합니다. 바뀌는 부분은 생각보다 적고, 게다가 바뀌는 것은 홍보되는 부분이 아닙니다.
HumanPen 팀
· 5분
짧은 답
예. PDF는 AI Writing Report에 대해 Turnitin이 받아들이는 네 가지 파일 형식 가운데 하나이고, 나머지는 .docx, .txt, .rtf입니다. PDF로 제출한다고 해서 문서가 AI 작성 분석 대상에서 빠지지는 않습니다. 형식이 바꾸는 것은 파일의 내용이며, 그것은 제출물의 다른 지점에서 실제로 영향을 미칩니다.
받아들여지는 파일 형식 목록
AI Writing Report의 파일 요건에서 그대로 가져온 내용입니다.
"Accepted file types: .docx, .pdf, .txt, .rtf" (받아들여지는 파일 형식: .docx, .pdf, .txt, .rtf)
같은 짧은 목록이 언어 규칙도 정합니다. "File must be written in a supported language: English, Spanish, Japanese" (파일은 지원되는 언어로 작성되어야 합니다: 영어, 스페인어, 일본어). 이 문장은 제품보다 며칠 뒤처져 있습니다. 현대 표준 아랍어는 2026년 8월 18일에 추가되었는데, 요건 페이지는 그 뒤로 수정되지 않았습니다. 그러니 네 개로 보시면 됩니다. 형식이 아니라 언어 규칙이 궁금하시다면 Turnitin은 다른 언어로 된 제출물에서도 AI를 감지할 수 있을까요?에서 따로 풀어 두었습니다.
이것이 형식에 대한 답의 전부입니다. PDF만의 별도 경로도, 더 가벼운 취급도 없고, 공개된 요건 어디에도 받아들여진 형식을 서로 다르게 다루는 내용은 없습니다.
리포트는 PDF 안에서 무엇을 읽을까요
Word 파일 안에서 읽는 것과 같은 것, 즉 산문입니다. Turnitin은 이를 qualifying text라고 부르며 감지 기능 관련 FAQ 페이지에서 설명합니다.
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (이 qualifying text에는 산문 문장만 포함됩니다. 즉, 표준적인 문법을 갖춘 문장으로 쓰인 텍스트 덩어리만 분석하며, 목록이나 불릿 포인트(문장이 아닌 짧은 구조), 그 밖에 문장이 아닌 구조는 포함하지 않습니다.)
그리고 이렇게 이어집니다. "This percentage is not necessarily the percentage of the entire submission." (이 비율이 전체 제출물의 비율인 것은 아닙니다.)
즉, 학위논문 PDF에 나타나는 비율은 페이지가 아니라 그 안에 담긴 이어지는 산문에 대한 통계입니다. Turnitin은 다른 곳에서 여러 작성 유형이 섞인 문서는 "would result in a disparity between the percentage and the highlights" (비율과 강조 표시 사이에 불일치를 낳을 것입니다)라고 말하며, 이것이 강조 표시된 부분을 모두 더해도 그 숫자가 되어 보이지 않는 이유로 문서화되어 있습니다. 이 어긋남을 읽는 방법은 Turnitin AI 작성 리포트 읽는 법에서 더 보실 수 있습니다.
표와 참고문헌 목록
논문 형태를 띤 것이라면 무엇에나 중요한 구체적 사항 두 가지로, 둘 다 Turnitin의 AI 작성 감지 모델 릴리스 노트에서 가져온 것입니다.
표 안의 산문은 처리됩니다. "We are now able to process long-form prose text in tables." (이제 표 안의 긴 산문 텍스트를 처리할 수 있습니다.) 다음 줄이 자주 잊히는 조건을 덧붙입니다. "Resubmit to reprocess existing submissions that contain tables." (표가 들어 있는 기존 제출물을 다시 처리하려면 재제출하십시오.) 이미 만들어진 리포트가 스스로 갱신되지는 않습니다.
참고문헌 목록은 제외됩니다. "We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report." (참고문헌 목록에 실린 참고문헌 안에서 간혹 AI 작성을 강조 표시하던 오류를 고쳤습니다. 이제 AI 작성 리포트를 처리할 때 참고문헌 목록은 제외됩니다.) 같은 함정, 같은 표현입니다. "Resubmit to reprocess existing submissions that contain highlighted reference sections." (강조 표시된 참고문헌 부분이 들어 있는 기존 제출물을 다시 처리하려면 재제출하십시오.)
참고문헌 목록이 강조 표시된 리포트를 보고 계시다면, 참고문헌에 대해 무언가를 결론짓기 전에 그 리포트가 만들어진 날짜를 확인하십시오. 어떤 리포트를 들고 계신지도 확인하십시오. Turnitin 문서에는 AI 작성 강조 표시가 "are not visible in the Similarity Report" (Similarity Report에는 보이지 않습니다)라고 되어 있고, 반면에 참고문헌 항목이 일치하는 것은 유사도 리포트에서는 흔한 일입니다. 인용 스타일이라는 것은 모두가 같은 출처를 같은 방식으로 형식화하도록 존재하니까요.
PDF 내보내기가 실제로 바꾸는 것
감지가 아닙니다. 문서입니다.
PDF로 내보내면 Word 파일의 장치들이 납작해집니다. 필드, 자동으로 만든 목차, 상호 참조, 자동 번호는 살아 있는 개체이기를 멈추고 인쇄된 텍스트가 됩니다. 앞으로 수정이 남아 있다면 이것이 중요하고, 반대 방향으로 왕복할 때는 더 중요합니다. PDF에서 텍스트를 꺼내 문서로 되돌리는 과정이야말로 번호와 구조가 조용히 깨지는 지점이기 때문입니다(긴 문서에서 깨지는 것).
실무 규칙은 재미가 없습니다. 수정은 원본 파일에서 계속하십시오. PDF는 맨 마지막에, 실제로 제출할 버전에서 내보내십시오.
문서 크기가 동작을 바꿉니다
가져갈 만한 문장이 하나 있습니다.
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (몇백 단어뿐인 짧은 문서에서는, 겹쳐 볼 기회 없이 하나의 세그먼트에 대해 예측하기 때문에 예측은 대체로 'all or nothing', 즉 전부 아니면 전무가 됩니다.)
그리고 그 뒤에 오는 문장입니다. "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (즉, AI가 만든 내용과 직접 쓴 내용이 섞인 텍스트의 일부가 전적으로 AI가 만든 것으로 표시될 수 있습니다.) 한 페이지짜리 PDF는 같은 측정을 줄여 놓은 것이 아닙니다. 더 뭉툭한 측정입니다.
점수를 아예 볼 수 있는지
별개의 관문이 둘 있고, 둘 다 파일과는 관계가 없습니다. Turnitin은 AI 작성 감지가 "is only be available to customers that license Turnitin Originality" (Turnitin Originality를 라이선스한 고객에게만 제공됩니다)라고 하며(문법은 원문 그대로입니다), iThenticate 2.0 계정에는 애드온 경로가 있습니다. 그리고 지표를 볼 수 있는 것은 교수자와 관리자뿐이라고 하면서, "with the PDF download feature, instructors can download and share the AI report with students" (PDF 다운로드 기능을 쓰면 교수자가 AI 리포트를 내려받아 학생과 공유할 수 있습니다)라고 덧붙입니다.
이 마지막 부분이야말로 대부분의 학생이 실제로 손에 쥐게 되는 PDF입니다. 자신이 제출한 PDF가 아니라 리포트의 PDF입니다. 둘 가운데 어느 쪽에 대해 이야기하고 있는지 분명히 할 가치가 있습니다.
자주 묻는 질문
PDF로 제출하는 것이 Word 파일로 제출하는 것보다 더 안전합니까? 아닙니다. 둘 다 같은 허용 형식 목록에 있고, Turnitin 문서에 설명된 분석은 둘을 구분하지 않습니다.
스캔한 페이지 이미지만 들어 있는 PDF는 어떤가요? 이미지에서는 산문을 추출할 수 없고, 그것을 빠져나갈 길로 삼는 것은 그 자체로 나쁜 계획입니다. 페이지 이미지로 된 PDF는 읽는 사람이 검색도, 인용도, 주석 달기도 할 수 없으며, 이는 대개 서류 어딘가에 적힌 제출 요건입니다. 그리고 Turnitin 스스로의 입장은 AI 점수가 "should not be used as the sole basis for adverse actions against a student" (학생에게 불리한 조치의 유일한 근거로 쓰여서는 안 됩니다)라는 것으로, 즉 결정하는 것은 통계가 아니라 사람입니다. 통계를 없앤다고 해서 읽는 사람이 없어지지는 않습니다.
제 PDF에는 유사도 점수가 나왔는데 AI 비율이 없습니다. 둘은 서로 독립적입니다. Turnitin 문서는 유사도 점수와 AI 작성 비율이 "are completely independent and do not influence each other" (완전히 독립적이며 서로 영향을 주지 않습니다)라고 합니다. AI 수치가 없는 것은 라이선스, 언어 규칙, 지표를 볼 수 있는 사람을 가리키며, 파일을 가리키는 것이 아닙니다(차이점 전문).
PowerPoint를 PDF로 내보낸 것도 AI 리포트를 받습니까? PDF가 허용 목록에 있으니 기계적으로는 그렇습니다. 하지만 슬라이드는 대부분 불릿이고, 불릿은 qualifying text가 아니므로 리포트가 다룰 수 있는 산문은 슬라이드에 담긴 내용의 작은 일부에 그칠 수 있습니다.
계속 읽기