Turnitin 이 내 방법론 섹션 전체를 빨간색으로 표시했어요
3 장에서 모델이 왜 당신을 부정행위자로 판단했는지 묻는 게 아닙니다. 진짜 묻べき인 건 하이라이트가 왜 하나의 연속된 블록으로 나타났는지, 그리고 그 퍼센티지가 무엇을 기준으로 산정된 수치인지입니다.
HumanPen 팀
· 13분
요약하면
점수가 문장 단위로 매겨지는 게 아니기 때문입니다. Turnitin 이 공개한 설명에 따르면, 제출된 텍스트는 중복되는 세그먼트로 나뉘고, 각 세그먼트에 확률이 할당되며, 해당 세그먼트 안에 포함된 모든 적격 문장이 그 점수를 물려받습니다. 어조와 문장 구조, 어휘가 2,000 어절 내내 일정하게 유지되는 텍스트를 넣으면 인접 세그먼트가 다르게 판단할 이유가 거의 없습니다. 그래서 하이라이트도 흩뿌려지는 게 아니라 띠 형태로 나타나죠. 방법론 섹션은 애초에 그렇게 쓰이도록 설계된 장르이고, Turnitin 이 자사의 오탐지가 주로 어디에 모여든다고 공개한 내용을 봐도 이 장르가 관례상 반드시 갖춰야 하는 두 가지 특성을 지목하고 있습니다. 그렇다고 수치가 틀렸다는 뜻은 아닙니다. 다만 한 섹션 전체를 덮는 빨간 벽이 40 개 문장에 대한 40 건의 별도 판단이 아니라는 거죠. 마치 그런 것처럼 해석하면 엉뚱한 것을 고치려고 시간만 낭피하게 됩니다.
왜 하나의 블록으로 나타나는가
사람들이 겪는 문제는 늘 똑같습니다. 문헌 검토는 깨끗하고, 논의 섹션도 깨끗합니다. 그러다 방법론 장이 시작되는 순간, 첫 문장부터 장이 끝날 때까지 하이라이트가 끊이지 않죠. 마치 모델이 의심스러운 구절을 찾은 게 아니라 의심스러운 장 자체를 찾은 것처럼 보입니다. 그래서 봐서 더 불안해지는 겁니다.
Turnitin 은 점수가 문장에 어떻게 할당되는지 공개했는데, 그 설명 전체를 읽기보다 중앙에 있는 두 문장을 주의 깊게 읽어야 합니다.
"Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score." (이 세그먼트 내의 각 적합 문장은 세그먼트 점수를 상속받습니다. 세그먼트가 겹치는 경우가 있으므로 일부 문장은 여러 점수를 가질 수 있으며 이는 단일 점수로 통합됩니다.)
즉, 분류의 단위는 문장이 아니라 텍스트 창입니다. 문장은 자신이 속한 문맥에 따라 점수를 매깁니다. 여기서 파생하는 결론은 Turnitin 이 공표한 게 아니라 우리의 해석입니다: 연속된 문장이 창을 공유하고 그 창들이 비슷하게 보이면, 그 창들이 산출하는 점수는 갈라질 이유가 없으며, 여기서 파생된 하이라이트도 연속적으로 나옵니다. 띠 형태는 균일한 범위에 대한 자연스러운 렌더링이지, 별개 건수를 세는 게 아닙니다.
여기서 실용적인 교훈이 나옵니다. 방법론 장에서 최초로 하이라이트된 문장이 반드시 문제가 시작된 지점일 필요는 없습니다. 왜냐하면 장 제목을 가로지르는 세그먼트에는 그 앞에 나온 마지막 단락도 포함되기 때문입니다. 사람들은 첫 번째로 빨간색 표시된 문장을 뚫어지게 보며 정확히何が 문제인지 파악하려고 실제 시간을 씁니다. 공개된 설명에 따르면 그 문장 자체에는 특별한 문제가 없을 수도 있습니다.
또 사람들이 의존하는 산술 연산 자체가 존재하지 않는다는 뜻이기도 합니다. 띠를 포함된 문장 수로 나누어 문장당 비용을 얻을 수 없고, 문장 하나를 뺀다고 해서 점수가 어떻게 변할지 예측할 수도 없습니다. 우리는 하이라이트된 문장 하나를 고치면 점수가 떨어질까 에서 가장 많이 회자되는 세 가지 버전의 주장을 조목조목 반박했습니다.
여기까지의 솔직한 한계: Turnitin 은 파이프라인의 형태만 공개했을 뿐, 풀링 함수나 집계 방식, 세그먼트 길이는 공개하지 않았습니다. 위 내용은 모두 공개된 설명에서 분포에 관해 유추할 수 있는 것들뿐이며, 누구도 수치를 예측할 수는 없습니다.
방법론 장 중 실제로 점수를 매기는 부분은 얼마나 되는가
두 번째로 확인할 건 분모입니다. 동일한 정보를 담은 두 방법론 장이라도 모델이 보는 텍스트 양이 완전히 다를 수 있기 때문입니다. Turnitin 은 '적격 텍스트'만 분석합니다.
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." 바로 그 다음 문장이 여기서 가장 중요합니다: "This percentage is not necessarily the percentage of the entire submission."
이제 본인의 분야가 이 섹션을 실제로 어떻게 작성하는지 살펴보세요. 실험실 프로토콜은 번호 매긴 단계, 시약 표, 장비 목록, 설정 블록 형태로 나옵니다. 반면 심리학이나 교육학 방법론 장은 연속된 단락 형태로 나옵니다: 참여자, 자료, 절차, 분석이 각각 온전한 문장의 흐름으로 이어집니다. 분석 관점에서 보면 이 둘은 완전히 다른 제출물이며, 두 번째 유형이 전체가 빨갛게 돌아오는 경우입니다.
| 섹션 레이아웃 | 적격 텍스트에 포함되는 내용 | 퍼센티지가 무엇을 가리키는가 |
|---|---|---|
| 번호 매긴 단계, 매개변수 표, 장비 목록, 수식 | 표준 문법 문장이 아닌 경우가 대부분이므로 거의 포함되지 않음 | 파일 내 다른 곳의 산문이며, 이 섹션 자체는 아님 |
| 참여자, 자료, 절차를 설명하는 연속 단락 | 실질적으로 전체 | 전통적인 절차적 산문으로 거의 구성된 표본 |
| 표 셀 안에 들어간 장문의 산문 | 처리됨. 2023 년 8 월 9 일 자 릴리스 노트에 따르면 모델이 표 내 장문 산문을 처리할 수 있게 되었으며, 기존 제출물은 다시 제출해야 재처리된다고 명시됨 | 다른 이유로 텍스트를 표에 옮긴 사람들을 놀라게 하는, 일반 단락과 동일함 |
중간 행에서 역설적 결론이 나옵니다. 적격 텍스트에서 제외된다고 해서 감점되는 게 아닙니다. 생성형 산문처럼 보이지 않을 번호 단계와 값 표가 제거되고, 작성물 중에서 가장 관례적인 부분만 남게 됩니다. 적격 표본이 좁을수록 그 수치는 오직 당신의 절차적 단락에 대한 진술이 됩니다.
반대 방향으로 작용하는 제외 사항 하나를 알아둘 가치가 있습니다. 흔한 오탐지를 제거해주니까요: 동일 2023 년 릴리스 노트는 참고문헌 내 하이라이트가 버그였으며, AI writing report 처리 시 참고문헌은 이제 제외된다고 기록하고 있습니다. 하이라이트된 참고문헌 섹션이 있는 제출물은 재처리하려면 다시 제출해야 합니다. 참고문헌 목록이 빨갛게 된 오래된 보고서를 보고 있다면 바로 그 경우입니다.
수치와 페이지 상 하이라이트 양 사이의 격차는 여기서 비롯되며, Turnitin 은 이를 추론에 맡기지 않고 직접 명시합니다. Turnitin AI Writing Report 읽는 법 에서 이 격차를 다루며, Turnitin 이 논문 전체를 검사할 수 있는가 는 분량 제한에서 벌어지는 일을 설명합니다. 바로 그 지점에서 장 단위 제출물이 문제가 되죠.
장르는 벤더가 자체적으로 나열한 기준에 부합한다
Turnitin 은 자사의 오탐지가 주로 무엇을 공통적으로 지니는지 설명합니다. 그대로 인용하면:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (때때로 위양성 (인간이 작성한 텍스트를 AI 생성으로 잘못 표시하는 경우) 은 구조적 변화가 거의 없는 콘텐츠, 문자 그대로 반복되는 텍스트, 새로운 아이디어 없이 단순히 고쳐 쓴 텍스트를 포함할 수 있습니다.)
그 다음 문장은 당신에게 하는 말이 아닙니다:
"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (이러한 텍스트에서 AI 작성량이 높게 나타난다면 표시된 비율을 해석할 때 이를 고려하시기 바랍니다.)
그 목록의 세 가지 항목 중 두 가지는 방법론 섹션이 본래 해야 할 일을 설명합니다. 구조적 다양성은 보고 체크리스트가 제거하는 대상입니다: 각 측정을 동일한 프레임으로, 하위 섹션을 동일한 순서로, 모든 도구를 동일한 구축 방식으로 기술해서 두 절차가 동일하게 기술되면 비교 가능하도록 만드는 것이죠. 문자 그대로의 반복은 두 조건이 실제로 동일하게 처리되었음을 알리는 방식입니다. 논문에서 문장 형태를 열한 번 똑같이 쓰는 게 올바른 유일한 섹션이 바로 여기이며, 동시에 그렇게 했는데 수정 비용이 가장 많이 드는 섹션이기도 합니다. 그곳에서 무엇을 안전하게 고칠 수 있는지는 별도의 규칙을 가진 별개 문제이므로 방법론과 결과에서 고쳐도 되는 것 에서 다루며, 아예 작문을 조정해야 하는지에 대한 더 넓은 질문은 AI 플래그를 피하려면 작문 방식을 바꿔야 할까 에서 다룹니다.
섹션만 따로 검사했을 때, 당신은 다른 것을 측정한 것이다
이 상황에서 일어나는 공황의 상당수는 기관 보고서가 아니라 자체 점검에서 옵니다. 장을 무언가에 붙여넣거나 초안 점검용 과제에 따로 제출했다가 누구도 보고 싶어하지 않는 수치가 나오는 경우가 바로 그렇습니다.
Turnitin 은 짧은 제출물이 단순히 정도가 아니라 질적으로 다르게 행동한다고 설명합니다.
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." 그리고 바로 다음 문장: "This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated."
방법론 장을 따로 제출하면 바로 그 영역에 해당될 후보입니다. 어절 수보다 더 그렇습니다. 먼저 번호 단계와 표가 분모에서 빠지기 때문입니다. 그 아래에도 바닥선이 있습니다: 장문 형식 AI writing report 는 최소 300 어절의 산문이 필요하므로, 짧은 방법론 섹션만 따로 제출하면 낮은 수치가 나오기는커녕 아예 보고서 자체가 나오지 않을 수 있습니다. 그리고 표시 임계값 이하에는 읽을 게 없습니다: 0% 초과 20% 미만 결과는 별표로만 표시되며 수치도 하이라이트도 없습니다. 즉 개선된 경우와 전혀 개선되지 않은 경우가 당신 입장에서 보면 똑같이 보인다는 뜻입니다.
빨간 섹션이 증명하지 않는 것
위의 메커니즘을 가지고 자기에게 유리한 증거로 삼고 싶은 유혹이 듭니다. 하지만 그렇지 않습니다. 이 페이지의 모든 내용은 그 수치가 무엇을 측정한 것인지 설명할 뿐입니다. 누구로 하여금 당신의 장을 작성했는지에 대한 증거는 아니며, 양쪽으로 칼날이 있습니다: 방법론 섹션 전체를 덮는 띠도 아무것도 증명하지 않으며, 띠가 왜 생기는지에 대한 설명도 마찬가지입니다.
"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." 다음 문장에 무게가 실립니다: "It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred."
- 띠는 분포지 개수가 아닙니다. 모델의 점수가 그 범위 전체에서 균일했다는 사실을 알려줄 뿐, 각각의 확신이 어느 정도였는지는 알려주지 않습니다.
- 퍼센티지는 적격 산문에 관한 것이므로 레이아웃이 다른 두 장 간에는 비교할 수 없으며, 장별 퍼센티지를 합산하면 아무것도 지칭하지 않는 수치가 나옵니다.
- 보고서는 벤더 스스로가 텍스트를 오인식할 수 있다고 밝힌 시스템에서 생성됩니다. 이는 출력을 기각하는 이유가 아니라 사람이 검토해야 하는 이유입니다.
- 대부분의 설정에서는 당신이 이것을 확인할 수 없습니다. 지표와 보고서는 학생에게 보이지 않지만, 강사가 보고서를 PDF 로 다운로드하여 공유할 수는 있습니다.
이 글을 회의에서 논거로 들고 가지 마세요. 이미 동일한 도움말 페이지를 읽은 사람에게 분류기를 설명하는 것은 답변이라기보다 준비 작업처럼 보이며, 논의를 당신의 연구가 아니라 모델에 대한 논쟁으로 끌고 가버립니다. 실제로 힘을 발휘하는 것은 출처입니다: 초안, 프로토콜, 분석 파일, 날짜가 그런 것입니다. 플래그가 떴지만 직접 썼습니다 는 어떤 증거를 모아야 하는지 다루며, AI 플래그 이후의 대화 는 회의의 절차적 측면을, 증거로서의 버전 히스토리 는 미리 생각하지 않았던 경우 기록이 어디에 있는지 다룹니다.
어쨌든 섹션이 수정될 경우
때로는 결정이 이미 내려진 경우가 있습니다. 지도교수가 내렸든 당신이 내렸든, 문제는 무엇을 잘못하지 않고 해내느냐입니다. 방법론은 논문에서 무심코 고치기 가장 나쁜 섹션입니다. 순서, 타이밍, 용량, 장비, 설정, 결정 규칙, 분석 집단, 제외 기준이 바로 내용이고, 이 중 하나를 살그머니 빼먹은 유려한 문장은 뻣뻣한 문장이 그렇지 않았던 것이 실제 결함이 됩니다.
사람들이 과소평가하는 비용은 다시 쓰는 게 아닙니다. 재확인입니다. 손댄 모든 단락은 이제 프로토콜, 분석 코드, 표와 대조해서 다시 읽어야 합니다. 장 전체를 건드리는 계획은 장 하나 분량의 교정 작업을 만들어내므로, 사용 방법보다 수정의 범위가 더 중요합니다.
바로 이 부분이 HumanPen 이 설계된 핵심입니다. 해당 제출물의 Turnitin 이나 iThenticate AI Writing Report 를 가져오면 표시된 구절이 범위가 됩니다: 오직 그 텍스트만 다시 쓰이고 나머지는 모두 그대로 유지됩니다. 이 사이트의 단락 규칙에 대한 자체 설명은 다음과 같습니다: "a paragraph is the smallest unit the engine rewrites: if your selection covers only part of one, it is expanded to the full paragraph and shown that way for you to confirm" 수식, 그림, 표 구조는 텍스트 다시 쓰기의 일부가 아닙니다. 이 섹션에서는 문서의 어느 곳보다 그 점이 더 중요합니다. 비용은 업로드한 파일이 아니라 실제로 다시 쓴 단어 수만큼 청구됩니다. 적격 결과는 무료로 AI 를 계속 낮출 수 있습니다.
그 어느 것도 예측은 아닙니다. Turnitin 의 모델은 변하며, 표시 규칙도 과거에 변경된 바 있고, 다음 보고서가 무엇을 말할지 알려드릴 방법은 없습니다. 위에서 서술한 주장은 어느 단어가 수정되고 어느 단어가 청구되는지에 관한 것으로, 이 두 가지만이 우리가 실제로 통제할 수 있는 부분입니다.
자주 묻는 질문
내가 한 단어一句씩 다 썼는데 왜 방법론 섹션 전체가 하이라이트되죠? 분류 단위가 문장이 아니라 겹치는 세그먼트이기 때문이며, 문장은 자신이 속한 세그먼트의 점수를 물려받아 풀링됩니다. 하나의 어조로 길게 쓰인 범위는 인접 세그먼트가 차별화할 거의 거리를 주지 않으므로 결과가 연속적으로 나옵니다. 이는 띠가 어떻게 형성되는지 설명할 뿐, 당신의 특정 띠가 오탐지라는 진술이 아닙니다.
하이라이트가 단단한 블록으로 나타났다는 건 그 안의 모든 문장이 AI 로 판단되었다는 뜻인가요? 아닙니다. 공공 설명이 그 이유입니다. 문장은 자신이 속한 세그먼트 (복수일 수 있음) 에서 물려받은 점수를 지니며, 이것이 풀링됩니다. 띠를 개별 판단 목록으로 읽는 것이 문장 단위 편집 계획으로 이어지는 실수입니다.
내 방법론 섹션이 주로 번호 단계와 매개변수 표인데 왜 퍼센티지가 여전히 높죠? 그건 아예 분석에 포함되지 않았을 수 있습니다. Turnitin 이 분석하는 것은 적격 텍스트, 즉 표준 문법 문장으로 작성된 산문이며, 퍼센티지가 반드시 제출물 전체의 퍼센티지는 아니라고 명시합니다. 단계와 표를 제외하면 수치가 설명하는 표본으로 관례적 단락만 남게 됩니다.
반복적으로 보이지 않도록 방법론 섹션에 다양성을 더해야 할까요? 이는 탐지기에 대한 질문 이전에 당신의 분야 보고 기준에 관한 질문이며, 방법론 섹션의 반복은 대개 일을 수행하고 있습니다. 이러한 속성이 있는 텍스트에 대한 벤더의 조언 자체도 이를 작성한 사람이 아니라 보고서를 읽는 사람을 향해 있습니다.
장을 따로 체커에 돌려서 매우 높은 수치가 나왔습니다. 이 수치가 지도교수가 보는 수치인가요? 반드시 그렇지는 않습니다. 왜냐하면 다른 제출물이기 때문입니다. Turnitin 은 수백 어절 문서의 예측은 단일 세그먼트에 중복이 없어 대체로 '전체 아니면 전무'로 나온다고 말합니다. 그런 상황에서 혼합된 콘텐츠는 전부가 AI 생성으로 플래그될 수 있습니다. 장은 전체 파일과 다른 분모이기도 합니다.
방어 수단으로 벤더의 오탐지 목록을 인용해도 되나요? 이는 도구의 오류 모드에 대한 공표된 진술이며 퍼센티지를 읽는 사람을 대상으로 하므로 그 존재를 아는 건 타당합니다. 하지만 이는 당신의 문서에 대한 증거가 아니며, 부정행위 대화에서 메커니즘을 논거로 삼으면 대개 당신에게 불리하게 작용합니다. 초안과 프로토콜을 가져가세요.