따옴표도 출처도 제대로 달았는데 Similarity Report에 여전히 일치로 뜨는 이유

따옴표와 출처 표기가 모두 올바른 문단이 일치로 표시되면 버그처럼 느껴집니다. 대개는 버그가 아닙니다. 그 사이에 문서로 남아 있는 인식 단계가 하나 있고, 빗나갈 수 있는 부분이 바로 그것입니다.

HumanPen 팀

· 8분

짧은 답

모든 일치는 소프트웨어가 그 주변에서 따옴표와 본문 내 인용을 감지했는지에 따라 네 그룹 중 하나로 분류됩니다. 인용도 따옴표도 없음, 따옴표 누락, 출처 누락, 인용 및 따옴표 있음입니다. 이 감지는 한계가 공개된 머신러닝 모델입니다. 영어로 학습되었고, 인용 인식은 이름이 명시된 네 가지 형식을 다루며, 인식하는 따옴표는 일곱 가지 특정한 형태뿐이고, 일치한 본문에서 멀리 떨어진 인용은 놓칠 수 있습니다. 귀속은 올바른데 형태가 어긋난 문단은 잘못된 그룹에 들어갑니다.

먼저 비율부터, 사람들이 생각하는 것과는 다릅니다

전체 유사도 수치에는 머릿속에 담아 둘 수 있는 정의가 있습니다. 문서의 총 단어 수로 일치 단어 수를 나눈 값입니다. 이 공식은 아무것도 가중하지 않고, 귀속이 표시되어 있다고 해서 아무것도 빼지 않습니다.

그 수치를 움직이는 것은 전혀 다른 장치이며, 그것은 여러분이 정하는 것이 아닙니다. 같은 도움말 사이트에 제외 필터 안내가 있고, 다섯 가지가 나열되어 있습니다. exclude bibliography (참고문헌 목록 제외), exclude quoted text (따옴표 안 텍스트 제외), exclude cited text (인용된 텍스트 제외), exclude small matches (작은 일치 제외), exclude small sources (작은 출처 제외)입니다. 여기서 가장 중요한 것은 두 번째입니다. 그것은 「ignores text enclosed in quotation marks or formatted as block quotes, preventing properly quoted material from appearing as matches」 (따옴표로 묶이거나 블록 인용으로 서식이 지정된 텍스트를 무시하여, 제대로 인용된 내용이 일치로 표시되지 않게 합니다) 라는 것인데, 파일이 .doc 또는 .docx일 때는 들여쓰기된 블록도 포함합니다.

이것만으로도 제목의 질문에 대한 답의 절반은 됩니다. 제대로 인용한 문단이 뜨는 이유가 아무도 그 필터를 켜지 않았기 때문인 경우가 있습니다. 켜져 있었는지는 검사를 실행한 사람이 정한 일이며, 여러분에게 전달되는 숫자에는 나타나지 않습니다.

분모는 짚어 둘 만합니다. 같은 플랫폼의 AI 작성 지표는 이 분모를 사용하지 않습니다. 그 비율은 파일 전체가 아니라 자격을 갖춘 산문을 대상으로 계산됩니다. 그래서 그 수치와 강조 표시가 서로 비례하지 않게 보일 수 있습니다. 숫자 둘, 분모 둘입니다. 이 둘은 Similarity 점수와 AI 작성 점수를 나란히 읽기에서 나란히 두었습니다.

무엇보다 먼저 알아 둘 기준이 하나 있습니다. Similarity Report가 아예 생성되려면 제출물에 최소 20단어가 있어야 합니다.

그리고 문서가 시작하는 부분에 있는, 그냥 지나치기 쉬운 규정 문장이 있습니다. 「Highlighted matches are instances of text similarity; they do not always indicate plagiarism. The match could be a quote or cited material listed in a bibliography.」 (강조 표시된 일치는 텍스트 유사성의 사례이며, 항상 표절을 뜻하는 것은 아닙니다. 그 일치는 인용이거나 참고문헌 목록에 실린 인용 자료일 수 있습니다.)

네 그룹

Match Groups는 일치한 텍스트가 어떻게 귀속되었는지에 따라 전체 유사도를 나눕니다. 문서 자체의 표현으로는 다음과 같습니다.

  • Not Cited or Quoted (인용도 따옴표도 없음) — 「that are not written as a quotation or has no citation to its original source」 (인용문으로 작성되지 않았거나 원 출처에 대한 인용이 없는 경우)에 해당하는 일치입니다.
  • Missing Quotations (따옴표 누락) — 「This text is cited, but the match is so exact that it may also require quotation marks.」 (이 텍스트에는 출처가 있지만 일치가 너무 정확하여 따옴표도 필요할 수 있습니다.)
  • Missing Citation (출처 누락) — 「This text is written as a quote, but lacks a citation to its original source.」 (이 텍스트는 인용문으로 작성되어 있지만 원 출처에 대한 인용이 없습니다.)
  • Cited and Quoted (인용 및 따옴표 있음) — 「This text contains a quotation and is cited to a source.」 (이 텍스트는 인용문을 포함하고 있으며 출처가 제시되어 있습니다.)

명시된 목적은 검토자가 「distinguish between integrity issues, teachable moments, and properly-included source text」 (학습 윤리 문제, 교육적 순간, 올바르게 포함된 원문 텍스트를 구분) 할 수 있게 하는 것입니다. 즉, 일치가 어느 그룹에 들어가는지는 사람이 원고를 어떻게 읽는지에 실제로 영향을 줍니다. 맨 위의 비율보다 더 큰 영향을 준다고도 볼 수 있습니다.

따라서 실질적인 질문은 「왜 이런 일치가 생겼는가」에서 「이 일치가 어느 그룹에 들어갔고, 그것이 올바른 그룹인가」로 바뀝니다.

어떻게 판단하는지, 그리고 어디를 놓치는지

이 부분은 문서로 남아 있지만 다른 어디에서도 거의 반복되지 않습니다.

인용과 따옴표 인식은 규칙이 아니라 학습된 모델입니다. 안내문에는 머신러닝 기술이 「to recognize in-text citations and quotation marks associated with matched text」 (일치한 텍스트와 연결된 본문 내 인용과 따옴표를 인식하기 위해) 사용된다고 나와 있습니다. 그리고 공급업체는 자체 오류율을 평이한 말로 밝힙니다. 「Since there are innumerable ways to include in-text citations and quotation marks, the Similarity Report won't get it right every time.」 (본문 내 인용과 따옴표를 넣는 방법은 셀 수 없이 많기 때문에, Similarity Report가 매번 옳게 판단하는 것은 아닙니다.)

여기에서 문서로 남은 세 가지 한계가 나옵니다.

영어에만 적용됩니다. 「The technology that powers Match Groups is trained on English content, and this functionality is currently only available for submissions in English.」 (Match Groups를 구동하는 기술은 영어 콘텐츠로 학습되었으며, 이 기능은 현재 영어 제출물에만 제공됩니다.)

인용 학습 범위는 네 가지 형식입니다. 「Citation recognition models have been trained on citations in certain formats: APA, MLA, Turabian, and IEEE numbered citations and references. If a citation is included for a match but is not in one of these formats, the report may--but is less likely to--recognize those as citations.」 (인용 인식 모델은 APA, MLA, Turabian, IEEE 번호 인용 및 참고문헌이라는 특정 형식의 인용으로 학습되었습니다. 일치 항목에 인용이 있어도 이 형식 중 하나가 아니면, 리포트가 그것을 인용으로 인식할 수도 있지만 그럴 가능성은 더 낮습니다.)

이 목록을 자기 전공과 대조해 읽어 보십시오. Vancouver, Chicago 저자-연도, Harvard와 그 수많은 기관별 변형은 여기에 없습니다. 전혀 인식되지 않는다는 뜻은 아닙니다. 표현은 「less likely」 (가능성 더 낮음)입니다. 다만 이 넷 중 하나가 아닌 형식으로 쓴다면, 귀속을 밝힌 인용이 귀속된 것으로 읽힐 가능성이 낮아진다고 문서에 나와 있습니다. 실제로 어떤 형식을 요구받는지는 그 자체로 복잡한 문제이며, 자신의 Harvard 참조 형식은 무엇인지전공별 인용 형식 고르기에서 다루었습니다.

거리가 중요합니다. 「Citations may not be recognized if they are placed very far from the matched text.」 (인용이 일치한 텍스트에서 매우 멀리 놓여 있으면 인식되지 않을 수 있습니다.) 다음 문단 끝에 출처가 붙은 블록 인용이 정확히 이 경우입니다.

인식되는 따옴표

Match Groups 페이지에 명시된 일곱 가지 형태입니다.

  • 곧은 큰따옴표: "…"
  • 굽은 작은따옴표: ‘…’
  • 겹화살괄호: «…»
  • 뒤집힌 겹화살괄호: »…«
  • 아래-위 큰따옴표: „…“
  • 겹낫표: 『…』
  • 홑낫표: 「…」

이 목록은 조심해서 옮기십시오. 큰따옴표 항목은 곧은 형태이고 작은따옴표 항목은 굽은 쌍입니다. 그런데 같은 도움말 사이트의 제외 필터 안내에는 또 다른 목록이 실려 있습니다. 여덟 항목에 굽은 것이 아니라 곧은 작은따옴표가 쓰이고, 《…》와 〈…〉가 추가되며, 「…」는 빠져 있습니다. 한 도움말 사이트에 공개된 목록이 둘, 둘을 합치면 서로 다른 형태가 열 가지, 그리고 어느 쪽 페이지도 다른 쪽을 언급하지 않습니다.

이것을 어떤 형태를 써야 한다는 규칙으로 만들지 마십시오. 교정까지 마친 초안과 업로드하는 파일 사이에서 따옴표가 무엇에도 바뀌지 않게 한다는 규칙으로 만드십시오.

그리고 실패 유형 하나가 분명하게 적혀 있습니다. 「Quotation marks are not recognized if they are separated from the text by a space (for example, " this improperly quoted text").」 (따옴표가 공백으로 텍스트와 떨어져 있으면 그 따옴표는 인식되지 않습니다. 예: " this improperly quoted text")

이 글에서 가장 확인하기 쉬운 부분입니다. 여는 따옴표 뒤에 들어간 공백 하나 — PDF에서 복사해 붙일 때 남거나 문단이 다시 줄바꿈될 때 생기는 종류 — 만으로도 일치가 Cited and Quoted에서 Missing Quotations로 옮겨갑니다.

따옴표가 인식되지 않으면, 인용이 감지되었는지에 따라 그 일치는 「Missing Quotations」 (따옴표 누락) 또는 「Not Cited or Quoted」 (인용도 따옴표도 없음)으로 떨어집니다. 두 실패는 겹칩니다.

여러 출처가 일치할 때 어떤 출처가 이름으로 올라오는가

같은 단어가 둘 이상의 출처와 일치하면, 리포트는 먼저 보여 줄 하나를 고릅니다. 우선순위는 공개되어 있는데, Internet, 그다음 Publications, 그다음 Submitted Works입니다.

이 순서는 자기 원고를 보고 있을 때 직관과 어긋날 수 있습니다. 공개된 논문에서 올바르게 가져온 문장이 카드에서는 그 논문을 옮겨 실은 웹사이트로 귀속될 수 있기 때문입니다. 나머지를 보여 주는 「Show overlapping sources」 (겹치는 출처 표시)라는 제어 기능이 있고, 개별 카드에는 View other sources (다른 출처 보기) 동작이 있습니다.

일치에 이의를 제기하기 전에 알아 둘 만합니다. 카드에 이름이 오른 출처는 가장 강한 일치이며, 반드시 여러분이 사용한 출처인 것은 아닙니다.

원고를 스무 분 동안 훑어보기

이 중 어느 것도 리포트에 접근할 필요가 없습니다. 제출하려는 파일 안에서 할 수 있습니다.

  1. 모든 직접 인용을 찾아 여는 따옴표가 첫 글자에 붙어 있고 그 사이에 공백이 없는지 확인하십시오. 따옴표 뒤에 공백이 오는 경우를 검색하십시오.
  2. 따옴표 형태를 확인하고, 변환한 뒤에는 다시 확인하십시오. 템플릿, PDF, 공동 저자의 편집기를 한 번 거치면 곧은 것이 굽은 것으로 알림 없이 바뀝니다. 번역된 원고라면 공개된 두 목록 어디에도 없는 형태가 들어 있을 수 있습니다.
  3. 인용을 가까이 옮기십시오. 인용의 출처가 다음 문장이나 다음 문단 끝에 있으면, 인용한 부분 바로 옆으로 가져오십시오.
  4. 자신의 인용 형식을 적어 두십시오. APA, MLA, Turabian, IEEE 번호식이 아니라면 인식이 덜 안정적일 것으로 예상하고, 리포트가 대신 분류해 주리라고 기대하지 말고 일치를 설명할 준비를 하십시오.
  5. 여전히 일치하는 것이 있다면 강조 색이 아니라 출처 카드를 확인하십시오. 이름이 오른 출처가 가장 강한 일치이며 실제로 사용한 출처가 아닐 수 있기 때문입니다.

리포트의 두 반쪽 사이의 선

리포트의 유사도 쪽은 저희가 다루는 영역이 아니며, 다시 쓰는 것이 해결책도 아닙니다. 어떤 문단이 인용문이라서 일치했다면 답은 귀속입니다. 인용문의 단어를 바꾸면 더 나쁜 인용문이 될 뿐입니다.

HumanPen 도구는 다른 지표를 다룹니다. 원고가 AI 작성 비율과 특정 문단 강조 표시와 함께 돌아왔을 때, 그 리포트를 가져오는 것이 어떤 문단을 열어야 하는지 알려 주는 일입니다.

리포트에 두 숫자가 모두 있다면, 그것은 해결책이 다른 별개의 문제입니다. 하나로 취급하다가, 따옴표 한 쌍만 옮기면 되었을 인용문을 다시 쓰게 되는 것입니다.

자주 묻는 질문

인용도 출처도 제대로 밝혔는데 여전히 일치로 표시됩니다. 잘못된 것인가요? 반드시 그런 것은 아닙니다. 문서는 강조 표시된 일치가 텍스트 유사성의 사례이며 항상 표절을 뜻하는 것은 아니라고 밝히고 있고, 인용 텍스트용 제외 필터가 따로 있으며 누군가 그것을 켜야 합니다. 꺼져 있다면 제대로 인용된 내용이 일치하는 것은 예상된 일입니다. 그때 중요한 것은 네 일치 그룹 중 어디에 들어가는가입니다.

리포트가 내 인용 형식을 이해하나요? 인용 인식은 APA, MLA, Turabian, IEEE 번호식으로 학습된 것으로 문서에 나와 있습니다. 다른 형식도 인식될 수는 있지만, 안내문은 그럴 가능성이 더 낮다고 합니다.

왜 내 따옴표는 반영되지 않았나요? 인식되는 형태는 목록으로 나와 있고, 명시된 실패가 하나 있습니다. 공백으로 텍스트와 떨어진 따옴표는 인식되지 않습니다. 여는 따옴표 바로 뒤에 공백이 있는지 확인하십시오.

이 내용이 영어로 쓰이지 않은 원고에도 적용되나요? Match Groups는 영어 콘텐츠로 학습되었고 영어 제출물에만 제공되는 것으로 문서에 나와 있습니다.

계속 읽기