Turnitin이 내 참고문헌과 인용에 플래그를 표시하는 이유 — 제외가 실제로 다루는 범위
사람들이 의지하는 제외는 보고서가 어떻게 만들어지는지를 설명합니다. 그것은 파일의 속성이 아닙니다. 이 구분이 있어야 참고문헌 항목에 표시된 강조가 수수께끼인지 아니면 날짜 도장인지가 결정되고, 두 숫자 가운데 어느 쪽을 두고 논쟁할 가치가 있는지도 결정됩니다.
HumanPen 팀
· 10분
짧은 답
Turnitin의 AI Writing Report는 참고문헌 목록을 제외하고, 표준적인 문법을 갖춘 문장으로 쓰인 산문만 분석합니다. 따라서 참고문헌 목록은 AI 비율을 올리지도 않고, 그것을 희석하는 데 쓰일 수도 없습니다. 참고문헌 목록 위에 놓인 색은 대개 Similarity Report 쪽의 것입니다. 그리고 거기서 참고문헌 항목이 일치하는 것은, 공유된 인용 스타일이 원래 만들어 내는 결과입니다.
그러면 흔한 답이 건너뛰는, 더 좁은 세 가지 질문이 남습니다. 그런데도 왜 어떤 AI 보고서에는 참고문헌 항목에 색이 있는지. 주석형 참고문헌이 단순한 참고문헌 목록과 같은 경우인지. 그리고 색이 유사성 쪽에 있다면, 그것을 바꿀 수 있는 권한을 실제로 쥐고 있는 사람이 누구인지.
세 가지를 모두 관통하는 것은, 이 제외가 문서에 대한 사실이 아니라는 점입니다. 그것은 보고서가 만들어지는 과정의 단계이며, 만들어지는 그 순간에 적용됩니다. 그 순간을 바꾸면 파일의 낱말은 하나도 건드리지 않고 보고서를 바꾸게 됩니다.
제외는 버그 수정으로 들어왔고, 기존 보고서는 다시 처리되지 않았습니다
Turnitin의 AI 작성 탐지 모델 페이지에는 날짜가 표시된 릴리스 노트가 실려 있습니다. 2023년 8월 9일 항목에는 이렇게 적혀 있습니다.
"We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report." (당사는 참고문헌 목록에 나열된 참고문헌 안에서 AI 작성 부분에 간헐적으로 강조 표시를 하던 버그를 수정했습니다. 이제는 AI Writing Report를 처리할 때 참고문헌 목록이 제외됩니다.)
바로 뒤에 오는 문장은 이 노트가 인용될 때마다 빠지는 부분입니다. "Resubmit to reprocess existing submissions that contain highlighted reference sections." (강조 표시된 참고문헌 섹션이 있는 기존 제출물을 다시 처리하려면 다시 제출하십시오.) 즉 그 제외는 보고서가 만들어지는 동안 적용됩니다. 2023년 8월 9일에 이미 존재했던 보고서는 그때 가지고 있던 강조 표시를 그대로 유지했고, 누군가 그 논문을 다시 제출할 때까지 그 상태로 남아 있었습니다.
같은 노트가 표도 같은 방식으로 다루었습니다. "We are now able to process long-form prose text in tables" (이제는 표 안의 장문 산문을 처리할 수 있습니다)에 이어 "Resubmit to reprocess existing submissions that contain tables." (표가 있는 기존 제출물을 다시 처리하려면 다시 제출하십시오.)가 나옵니다. 두 가지 변경 모두, 아무도 자동으로 하지 않는 재제출에 달려 있습니다.
올해 생성된 보고서를 들고 있는 대부분의 사람에게 이 이야기는 아무것도 설명해 주지 않습니다. 이것이 쓸모가 있는 지점은 심어 주어야 할 습관입니다. 보고서가 보여 주는 것을 설명하려 하기 전에, 그것이 언제 생성되었는지부터 알아내십시오. 생성될 때 적용된 규칙이 바로 그 날짜의 규칙이기 때문입니다. 같은 파일에 대해 일 년 간격으로 생성된 두 보고서는 하나의 측정값을 두 번 읽은 것이 아닙니다. 이 문제의 일반적인 버전은 재검사 후 두 개의 Turnitin 보고서 비교하기에서 풀어 두었습니다.
이것은 플래그가 표시된 참고문헌에 관해 돌아다니는 조언이 왜 그렇게 자신감 넘치면서 동시에 낡게 들리는지도 설명합니다. 상당수가 2023년 스크린샷을 보고 쓰였습니다.
내 참고문헌 목록은 AI 비율의 어느 쪽에도 들어 있지 않습니다
두 가지 질문이 끊임없이 들어오고, 답은 하나입니다. 참고문헌이 내 AI 비율을 올렸는가, 그리고 참고문헌을 길게 만들면 그 비율이 내려가는가 하는 것입니다.
Turnitin은 모델이 살펴보는 것을 평가 대상 텍스트라고 정의하며, 탐지 FAQ에서는 모델이 "only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures" (표준적인 문법을 갖춘 문장으로 쓰였고, 목록이나 불릿 포인트(문장이 아닌 짧은 구조) 또는 그 밖의 문장 아닌 구조처럼 다른 유형의 글을 포함하지 않는 텍스트 블록만 분석합니다)라고 밝히고, 그 다음 문장에서 결과를 이렇게 적어 둡니다. "This percentage is not necessarily the percentage of the entire submission." (이 비율이 반드시 제출물 전체에 대한 비율인 것은 아닙니다.) 참고문헌 항목은 표준적인 문법을 갖춘 문장이 아니고, 참고문헌 목록은 어차피 처리 전에 제거됩니다. 따라서 참고문헌 목록은 분자에도, 분모에도 들어 있지 않습니다.
이것으로 두 가지 계획이 한꺼번에 사라집니다. 제출 전에 참고문헌을 지우는 것은 보고서가 분석하는 대상을 바꾸지 못하고, 없었던 문제를 고치겠다고 불완전한 논문을 제출하게 만듭니다. 참고문헌을 늘리는 것도 아무것도 희석하지 못합니다. 희석이 되려면 추가된 낱말이 분모에 들어가야 하는데, 이 낱말들은 들어가지 않기 때문입니다.
표와 목록이 가득한 문서에서 분모가 실제로 무엇인지 보고 싶다면, Turnitin AI Writing Report 읽는 법에서 수치 예시를 끝까지 다룹니다.
"처리에서 제외됨"과 "안정적으로 탐지되지 않음"은 서로 다른 두 진술입니다
참고문헌이라는 낱말이 이 모든 이야기에서 상당한 일을 하고 있으며, Turnitin 자체 페이지에는 참고문헌 형태의 자료에 관한 서로 다른 두 가지 주장이 담겨 있고, 사람들은 그것을 하나로 합쳐 버리곤 합니다.
한 Turnitin 도움말 문서에는 이렇게 적혀 있습니다. "The model does not reliably detect AI-generated text in the form of non-prose, such as poetry, scripts, or code, nor does it detect short-form/unconventional writing such as bullet points, tables, or annotated bibliographies." (이 모델은 시, 대본, 코드처럼 산문이 아닌 형태의 AI 생성 텍스트를 안정적으로 탐지하지 못하며, 불릿 포인트, 표, 주석형 참고문헌처럼 짧거나 비표준적인 형태의 글도 탐지하지 못합니다.)
이것을 릴리스 노트와 나란히 읽어 보십시오. 릴리스 노트는 처리 규칙을 설명합니다. 모델이 실행되기 전에 참고문헌 목록이 빠진다는 것입니다. 도움말 문서는 신뢰성의 한계를 설명합니다. 특정 유형의 글에 대해서는 모델의 결과가 Turnitin이 보증하는 것이 아니라는 뜻입니다. 둘은 같은 보장이 아니며, 두 번째 쪽이 훨씬 약합니다.
이 구분이 가장 날카롭게 작용하는 곳은 주석형 참고문헌입니다. 주석은 직접 쓴 산문 문장인데, 직접 쓰지 않은 항목 아래에 놓여 있기 때문입니다. 주석형 참고문헌에 강조 표시가 되어 돌아왔다면, 그것은 단순한 참고문헌 목록에 색이 있는 것과 같은 일이 아닙니다. 그리고 릴리스 노트는 그것을 다루는 문서가 아닙니다.
인용이 들어 있는 문장은 산문으로 채점되며, 그 자체만으로 채점되지 않습니다
Turnitin이 공개한 계산 설명은 일련의 연산을 나열합니다. 문장이 추출되고, 겹치는 세그먼트로 묶이며, 각 세그먼트는 0에서 1 사이의 값을 받고, 각 평가 대상 문장은 자신을 덮는 세그먼트의 점수를 물려받고, 그렇게 모인 문장 점수들이 문서 수치로 집계됩니다. 인용은 그 연쇄의 어느 단계에도 입력으로 들어가지 않습니다.
이 겹침에는 좀처럼 끝까지 따라가지 않는 결과가 하나 있습니다. 한 세그먼트의 경계 근처에 있는 문장은 두 세그먼트에 걸치므로, 물려받은 점수를 하나 이상 지게 됩니다. 인용을 담은 문장에 붙은 강조 표시는 양옆 문장에서 부분적으로 빌려온 것이며, 그래서 해결책이 있다고 해도 그 위치는 괄호가 아닙니다. 여기서 무엇이 따라 나오고 무엇이 따라 나오지 않는지는 플래그된 문장 하나를 다시 쓰면 점수가 내려가는가에서 추적했습니다.
이는 손이 가는 몇몇 수정에 붙잡을 대상이 아무것도 없다는 뜻이기도 합니다. 번호를 다시 매기기, 괄호 표지를 위첨자로 바꾸기, 주장 앞에 신호 구문을 붙이기, 출처 표시를 문장 끝으로 옮기기. 이 가운데 어느 것도 채점되는 속성을 바꾸지 못합니다. 어느 것도 산문을 바꾸지 않기 때문입니다.
이 질문이 "도대체 내가 무슨 보고서를 들고 있는 거지"에서 시작되는 버전이라면, Turnitin이 내 참고문헌에 플래그를 표시한 이유에서 각 갈래를 짚어 두었습니다.
Similarity Report에서는 결정권이 문서 안에 있지 않습니다
이제 다른 경우입니다. 누군가 비율 하나를 전달해 왔고, 색은 참고문헌 목록 위에 있고, 그 숫자를 내려 오라는 요청을 받았습니다. 그것을 움직일 수 있는 것은 파일 안에 있지 않습니다.
유사성 보고서는 제외 필터를 적용해 생성되며, 참고문헌이 그중 하나이고 인용문이 또 다른 하나입니다. 보고서를 설정한 사람이 어느 것을 켤지 정했고, 그 선택은 이메일에 붙여 넣어진 비율과 함께 움직이지 않습니다. 변경하지 않은 파일 하나에 대한 두 보고서가 크게 달라지는 것은 그 이유만으로도 일어납니다. 두 보고서를 나란히 놓고 보기는 필터와 그 상태를 어디서 확인할 수 있는지를 다루고, 인용되고 출처가 밝혀진 텍스트가 여전히 일치하는 이유는 아무도 그것을 켜지 않았을 때 출처가 있는 부분에 무슨 일이 생기는지를 다룹니다.
이것은 뻔한 수단에 대한 반론이기도 합니다. 참고문헌 항목이 다른 사람의 참고문헌 항목과 일치하는 것은, 스타일 가이드가 모두에게 같은 문자열을 만들라고 했기 때문입니다. 일치하지 않을 때까지 다시 쓴 항목은 스타일을 따르지 않게 된 항목이며, 어떤 도구가 그것을 목록 전체에 한꺼번에 해 버리면 채점자가 알아차릴 때까지는 알아차리지 못합니다. 다시 쓰기 도구 안에서 인용과 표에 무슨 일이 생기는가에 바로 그런 사례가 기록되어 있습니다.
따라서 그 이메일에 쓸모 있게 답하는 방법은 수정이 아니라 질문입니다. 그 보고서에서 어떤 제외가 켜져 있었는지, 그리고 참고문헌 목록 밖의 어디에 색이 있는지입니다. 뒤의 절반이야말로 답변이 필요한 부분입니다.
보고서를 앞에 두고 보내는 5분
이 가운데 어느 것에도 계정도, 이의 제기도, 전문가도 필요하지 않습니다. 필요한 것은 숫자 하나가 찍힌 스크린샷이 아니라 실제 PDF와, 5분 정도의 시간입니다.
- 먼저 생성 날짜를 확인하십시오. 어디에서 설명되었든 모든 제외와 모델 버전은 그 파일이 생성될 때 시행되던 것이며, 오늘 도움말 사이트에 적힌 것이 아닙니다.
- 색이 있는 것을 보기 전에 AI 표시부터 보십시오. Turnitin은 1%에서 19% 구간에는 점수도 강조 표시도 부여하지 않고 대신 별표를 표시합니다. 따라서 눈앞에 별표가 있다면, 강조 표시된 것은 AI 보고서에서 나온 것이 아닙니다.
- 색이 있는 부분 하나를 따라가 보며 무엇을 제공하는지 보십시오. 일치 항목이 자체 비율을 가진 이름 있는 출처로 이어진다면 그것은 Similarity Report입니다. AI 강조 표시는 거기에 나타나지 않고, 어디로도 이어지지 않습니다.
- 어떤 제외 필터가 켜져 있었는지 물어보십시오. 참고문헌과 인용문은 별개의 스위치이고, 전달된 숫자만으로는 어느 쪽 상태도 알 수 없으며, 보고서를 실행한 사람은 알고 있습니다.
- AI 보고서라면 강조 표시된 산문을 읽고 줄 수 세기를 멈추십시오. 비율은 평가 대상 텍스트를 기준으로 계산되고, 강조 표시는 나머지 모든 것도 함께 담긴 문서 안에 놓여 있습니다. 그래서 둘은 눈으로 맞아떨어지지 않습니다.
적어 놓고 보면 이것은 글에 대한 질문이 아니라 보고서에 대한 질문의 목록이며, 이 특정한 문제에 대해서는 대체로 그것이 옳은 비율입니다.
참고문헌 자료에 대해 우리가 선을 긋는 지점
HumanPen 도구는 문서 다시 쓰기 도구이며, 여기서 관련된 설계 결정은 결과가 아니라 범위에 관한 것입니다. 직접 부분을 선택하거나, 문서를 AI Writing Report와 함께 업로드해 플래그가 표시된 부분이 범위를 정하게 하거나, 둘 중 하나입니다. 보고서에서 가져온 부분만 다시 작성되고, 문서의 나머지는 그대로 보존됩니다.
이 글의 주제에 대해 이것은 구체적인 결과를 낳습니다. 참고문헌 목록은 애초에 다시 쓰기 범위에 들어갈 이유가 없습니다. AI 계산의 양쪽 모두에서 벗어나 있기 때문입니다. 그런데도 거기까지 손을 뻗는 도구는, 어차피 숫자에 도움이 되지 못했을 일에 위험을 쓰고 있는 셈입니다.
과금은 실제로 다시 작성된 낱말만 세므로, 보고서가 문서의 5분의 1을 플래그하면 비용은 대략 전체 처리의 5분의 1입니다. 조건을 충족하는 부분은 무료로 다시 실행할 수 있습니다.
우리가 말씀드리지 않는 것은 다음 보고서가 무엇을 보여 줄지입니다. 자사 페이지에는 HumanPen이 의미, 구조, 용어, 인용, 레이아웃, 스타일을 유지하면서 필요한 표현만 다시 쓰는 것을 목표로 한다고 적혀 있고, 그다음에 복잡한 문서는 다운로드 후에 검토하라고 적혀 있습니다. 그 양쪽 모두 진심입니다.
자주 묻는 질문
내 AI 보고서에는 참고문헌 항목 자체에 색이 있습니다. 그런 일이 가능하기나 한가요? 가능했습니다. 2023년 8월 9일 자 Turnitin 릴리스 노트가, 참고문헌 안의 AI 작성 부분에 강조 표시를 하던 버그가 수정되었고 이후에는 보고서 처리 시 참고문헌 목록이 제외된다고 발표하기 전까지는요. 그 노트는 기존 제출물이 다시 처리되기 전에 재제출되어야 한다고 덧붙입니다. 즉 오래된 보고서는 강조 표시를 유지했습니다. 보고서가 최근 것이라면, 들고 있는 것이 Similarity Report가 아닌지 확인해 보십시오.
참고문헌 목록을 길게 만들면 AI 비율이 희석되나요? 아닙니다. 비율은 평가 대상 산문을 기준으로 계산되고, Turnitin은 그 결과가 "not necessarily the percentage of the entire submission" (반드시 제출물 전체에 대한 비율인 것은 아닙니다)이라고 말합니다. 분모에 들어 있지 않은 낱말은 아무것도 희석할 수 없습니다.
주석형 참고문헌에 강조 표시가 되어 있습니다. 같은 제외로 다루어지나요? 같은 진술로는 다루어지지 않습니다. 릴리스 노트는 참고문헌 목록이 처리에서 제외되는 것에 관한 것입니다. 한 Turnitin 도움말 문서는 주석형 참고문헌을, 모델이 AI 작성을 안정적으로 탐지하지 못하는 글 유형의 하나로 따로 나열합니다. 이는 무엇이 제거되는지에 대한 규칙이 아니라 신뢰성에 대한 주장입니다. 게다가 주석은 직접 쓴 산문이며, 단순한 참고문헌 목록은 그렇지 않습니다.
인용 스타일을 바꾸면 두 숫자 가운데 하나가 달라지나요? AI 쪽에서는 달라지지 않습니다. 그 계산에 관해 공개된 설명에는 인용을 읽는 부분이 아예 없습니다. 유사성 쪽에서는, 출처가 밝혀진 일치를 보고서가 어떻게 분류하는지가 한계가 문서화된 인식 단계에 달려 있으며, 인용되고 출처가 밝혀진 텍스트가 여전히 일치하는 이유가 그것들을 하나씩 짚어 봅니다.
이 일로 온 이메일에 답하기 전에 무엇을 요청해야 하나요? 스크린샷이 아니라 PDF 형태의 전체 보고서, 생성된 날짜, 어떤 보고서인지, 그리고 어떤 제외 필터가 켜져 있었는지입니다. 이 네 가지 답이 있으면, 누군가 글에 대해 논의하기 전에 대부분이 정리됩니다.
계속 읽기