Turnitin 유사도 44%인데 출처는 몇 개뿐 — 높은 유사도 점수 읽는 법

보고서에는 유사도 44%라고 적혀 있는데, 그 아래 출처 목록은 거의 비어 있습니다. 이 비율은 출처의 개수가 아니라, 일치하는 단어가 차지하는 비중입니다. 이 페이지에서는 그 계산 방식과, 출처가 몇 개뿐이어도 점수가 높게 나오는 이유, 그리고 교수자 설정에 따라 점수가 달라지는 이유를 설명합니다.

HumanPen 팀

· 5분

먼저 결론부터

유사도가 44%인데 표시된 출처가 몇 개뿐이라고 해서 앞뒤가 맞지 않는 것도 아니고, 시스템 오류도 아닙니다. 이 비율은 출처가 아니라 단어를 세기 때문입니다. 즉 제출물의 단어 가운데 Turnitin 데이터베이스의 텍스트와 일치하는 단어가 차지하는 비중입니다. 많이 참고한 논문 한 편, 이전에 제출했던 자기 과제물, 심지어 정확히 인용한 문장 하나가 단어의 상당 부분을 차지할 수 있습니다.

점수는 설정에도 영향을 받습니다. 교수자는 인용문, 참고문헌, 이전 제출물을 제외하도록 설정할 수 있고, 같은 문서라도 그 설정에 따라 숫자가 달라집니다. 따라서 출처가 몇 개뿐인데 점수가 높다면, 맨 위의 비율이 아니라 일치 항목이 어떻게 분포되어 있는지를 봐야 합니다.

지금 보고 있는 것

보고서 화면에는 두 가지가 나란히 나옵니다. 위쪽의 비율과, 그 아래의 일치 출처 목록입니다. 숫자는 높은데 목록은 짧으면 뭔가 이상해 보입니다. "44%나 된다고? 겨우 7%만 일치한다는 건가?" 하는 식으로요. 두 숫자가 함께 움직여야 할 것 같은 느낌이 들기 때문입니다.

하지만 둘은 함께 움직이지 않습니다. 비율과 출처 목록은 서로 다른 측정값입니다. 비율은 문서 전체를 대상으로 계산한 하나의 숫자이고, 출처 목록은 일치하는 단어가 어디에서 왔는지를 나누어 보여 주는 목록입니다. 그리고 출처 하나가 아주 많은 단어를 제공할 수 있습니다.

헷갈리는 지점은 딱 이것입니다. 위쪽 숫자는 단어를 세고, 아래 목록은 출처를 세는데, 둘을 연결해 주는 규칙은 어디에도 없습니다.

그 비율은 정확히 무엇인가

Turnitin 자체 학생 가이드에도 이 숫자의 정의가 정확히 나와 있습니다. 유사도 점수란 제출물에 포함된 일치 텍스트의 비율, 즉 전체 유사도입니다. 계산법은 제출물의 전체 단어 수를 데이터베이스의 출처와 일치한 단어 수로 나누는 것입니다.

이 정의에서 두 가지 결론이 나옵니다.

첫째, 그 비율은 목록에 출처가 몇 개 올라와 있는지와는 아무 상관이 없습니다. 그것은 문서의 단어 가운데 차지하는 하나의 분율일 뿐입니다. 단어의 44%가 일치하는 문서라면, 출처가 하나뿐이라도 44%로 보고됩니다.

둘째, 데이터베이스는 방대하고 다양합니다. Turnitin 가이드는 이를 인터넷의 현재 및 보관된 콘텐츠, 수천 종의 정기간행물·저널·출판물, 그리고 이전에 Turnitin에 제출된 과제물이라고 설명합니다. 어느 쪽과 일치하든 세는 단어는 같습니다. 출처가 긴 논문 한 편이든 짧은 페이지 스무 개든 마찬가지입니다.

출처가 몇 개뿐이어도 점수가 높을 수 있는 이유

출처 목록이 짧은데도 비율이 높게 나오는 구체적인 경우는 다음과 같습니다.

출처 하나가 긴 경우. 논문의 상당 부분이 특정 논문 한 편을 바꿔 쓰거나 인용한 것이라면, 그 출처 하나가 일치 단어의 큰 비중을 차지합니다. 출처 목록은 짧아도, 비율은 그렇지 않습니다.

자신이 쓴 이전 초안. Turnitin의 공식 사례에는 같은 과제물을 여러 차례 초안으로 제출하는 학생이 나옵니다. 그 결과 최종 초안은 이전 버전들과 비교해 100%가 나올 수 있습니다. 출처는 하나(자기 자신)인데, 비율은 최댓값입니다.

올바르게 인용하고 출처를 밝힌 텍스트. 학생 가이드에는 제출물이 데이터베이스의 일부와 일치할 가능성이 높으며, 올바르게 사용한 인용문과 참고문헌도 일치 항목으로 표시된다고 나와 있습니다. 인용문도 실제 일치 항목이며, 비율은 그것을 다른 경우와 똑같이 셉니다.

문서 안에서의 반복. 자기 논문에서 같은 문구나 정의를 여러 번 반복했고, 그 문구가 데이터베이스에 한 번 존재한다면, 반복된 부분마다 일치 텍스트로 셀 수 있습니다.

공통된 핵심은 이것입니다. 비율은 단어의 비중이고, 그 단어는 출처 한두 개에 몰려 쌓일 수 있습니다.

점수는 설정에 따라 달라집니다

같은 문서라도 교수자가 보고서를 어떻게 설정했느냐에 따라 다른 비율이 나올 수 있습니다. 이 점은 Turnitin 자체 사례에도 나와 있습니다.

교수자는 Similarity Report에서 인용문을 제외해, 해당하는 경우 유사도 점수를 낮추도록 선택할 수 있습니다. 공식 사례 중 하나를 보면, 인용문이 많고 참고문헌도 방대한 학생 제출물은 보고서에서 인용문과 참고문헌을 제외하기 전까지 점수가 높게 나옵니다.

즉 눈에 보이는 비율은 문서 보고서 설정의 함수입니다. 인용문 제외 여부, 참고문헌 제외 여부, 이전 제출물 제외 여부에 따라 달라집니다. 바뀐 것은 교수자 측 설정이고, 문서는 그대로입니다.

이 점은 동료들의 점수나 초안별 점수를 서로 비교할 때 중요합니다. 비슷한 문서에 대한 서로 다른 두 보고서를 비교하고 있을 수 있기 때문입니다.

내 보고서 읽는 법

맨 위 비율을 보는 대신, 일치 항목의 분포를 보세요.

먼저 출처 목록을 열고 표시된 일치 항목을 살펴보세요. 개수가 아니라 실제 텍스트를요. 무엇이 일치했습니까? 출처를 밝힌 논문에서 길게 인용한 문장입니까? 반복해서 쓴 정의입니까? 예전 초안의 문단입니까? 각각 의미가 다르고, 비율만으로는 그것을 구분할 수 없습니다.

둘째, 설정이 어떻게 되어 있는지 확인하세요. 인용문을 제외한 상태로 생성된 보고서입니까? 참고문헌은요? 이전 제출물은요? 답에 따라 그 숫자가 내 문서에서 의미하는 바가 달라집니다. 이 설정은 교수자가 정하며, 물어보는 것이 그 비율이 실제로 무엇을 세고 있는지 알아내는 가장 빠른 방법입니다.

셋째, 정해진 합격 기준은 없다는 공식 입장을 함께 놓고 그 숫자를 해석하세요. Turnitin 학생 가이드에는 학교, 교수자, 과제마다 허용되는 일치 텍스트의 양이 다를 수 있다고 나와 있으며, 기대 수준은 강의 계획서, 과제 안내, 또는 교수자에게 확인하라고 권합니다.

출처가 몇 개뿐인데 점수가 높다는 것은 판결이 아니라 질문입니다. 답은 비율이 아니라 표시된 텍스트와 설정에 있습니다.

정리하면

출처 목록이 짧은데 44%라고 해서 모순은 아닙니다. 유사도 비율은 일치하는 단어, 즉 전체 단어에서 차지하는 비중을 세고, 출처 목록은 출처를 셉니다. 긴 출처 하나, 이전 초안, 올바르게 인용한 텍스트가 단어의 큰 비중을 차지할 수 있습니다. 점수는 설정에도 좌우됩니다. 교수자가 인용문, 참고문헌, 이전 제출물을 제외할 수 있어, 같은 문서라도 숫자가 달라집니다. 표시된 일치 항목을 읽고 설정을 확인하세요. 높은 점수의 의미는 거기에 있습니다.

계속 읽기