왜 AI 감지기가 잘 쓴 글을 문제삼을까

이 질문은 감지기가 에세이를 읽더니 '너무 잘 썼다'고 감점했다는 전제에서 출발합니다. 하지만 업체가 공개한 자료 어디에도 'well written(잘 쓴 글)'이라는 항목은 없습니다. 그렇다면 플래그가 실제로 알려주는 것은 별개의 문제가 됩니다.

HumanPen 팀

· 14분

간단한 답변

채점을 하는 게 아닙니다. 우리가 검색한 Turnitin 도움말 페이지 세 곳 어디에도 'quality(품질)', 'style(스타일)', 'polished(다듬어진)', 'well written(잘 쓴)', 'vocabulary(어휘)', 'clarity(명료함)'이라는 단어가 없었습니다. 반면 '300 words(300 단어)' 민감도 설정은 세 페이지 모두에 있었습니다. 이는 페이지 텍스트를 직접 읽어서 검색했다는 뜻이며, 공백 결과가 아니었다는 증거입니다. FAQ 는 감지기가 글의 좋고 나쁨을 평가한다고 설명하지 않습니다. Turnitin 이 공개한 것은 거짓 긍정이 포함될 수 있는 텍스트 유형을 정량 없이 나열한 목록뿐입니다. 신중한 학술 산문은 고정된 용어를 반복하거나 병렬 구조를 사용할 때 이 목록의 두 항목과 닮을 수 있지만, Turnitin 은 그런 특성이 오류 중 얼마나 자주 나타나는지는 밝히지 않았습니다.

이렇다고 해서 다듬은 글이 무해하다고 증명되는 것은 아니며, 우리도 그런 척은 하지 않습니다. 회사가 문서화한 것은 문서화하기로 선택한 부분일 뿐이고, 학습된 모델은 도움말 페이지에 담긴 것보다 훨씬 많습니다. 우리가 증명하려는 것은 훨씬 좁고 실용적인 명제입니다. 'well written(잘 쓴)'은 이 시스템이 보고하는 지표가 아니므로, 플래그는 그에 대한 판단이 아닙니다. 그리고 '자신의 수준 이하로 쓰라'는 조언은 공개된 근거가 전혀 없습니다.

업체의 어휘를 세어보면

2026 년 8 월 18 일에 조회한 세 페이지의 렌더링 텍스트를 검색했습니다. 일반 명령줄 fetch 에서는 `guides.turnitin.com` 이 403 을 반환했기 때문입니다. 검색 대상은 'Using the AI Writing Report', 'Turnitin's AI writing detection capabilities FAQs', 'File requirements for an AI Writing Report'였습니다. 이 페이지들은 메커니즘과 파일 규칙을 설명하며, 릴리스 노트와 알려진 문제 페이지는 검색 대상에서 제외했습니다. 표는 대소문자를 구분하지 않는 유무만 기록하며, 실시간 페이지 변경에 따라 정확한 카운트는 변동될 수 있습니다.

검색어리포트 가이드감지 FAQ파일 요구사항
`quality`없음없음없음
`style`없음없음없음
`well written` / `well-written`없음없음없음
`polished`없음없음없음
`genre`없음없음없음
`discipline`없음없음없음
`false positive`(2 차 판별)있음있음없음
`300 words`(민감도 설정)있음있음있음

맨 아래 행이 나머지 표의 의미를 결정합니다. 빈 결과와 검색 실패는 같은 흔적을 남기기 때문에, 세 페이지 모두에 있는 것으로 알려진 용어는 먼저 존재해야 합니다. FAQ 에서 'writing'과 'segment'는 있지만, 'vocabulary', 'word choice', 'clarity'는 없습니다. 'Breakdown'은 리포트 가이드에 있지만, 통계가 아닌 인터페이스 패널 이름으로만 나타납니다.

그리고 텍스트 검색으로는 전혀 보이지 않는 이미지가 있습니다. FAQ 아티클 자체에는 이미지가 없으며, 사이트 로고는 페이지 크롬에 속할 뿐 아티클의 일부가 아닙니다. 리포트 가이드에는 대체 텍스트가 없는 스크린샷이 포함되어 있어, 우리는 이를 별도로 열었습니다. 여기에는 56% AI 와 23% similarity 를 보여주는 샘플 리포트, 강조된 산문 페이지, 상태 메시지가 포함되어 있습니다. 그 어느 것도 위의 단어들을 사용하지 않습니다. 그중 하나에는 페이지 본문 어디에도 나타나지 않는 문장이 실려 있습니다.

"AI detection includes the possibility of false positives. Although some text in this submission is likely AI generated, scores below the 20% threshold are not surfaced because they have a higher likelihood of false positives." (AI 감지에는 거짓 긍정 가능성이 포함됩니다. 본 제출물의 일부 텍스트는 AI 생성일 가능성이 있지만, 20% 임계값 미만의 점수는 거짓 긍정 가능성이 더 높기 때문에 표시하지 않습니다.)

이는 제품이 스스로를 가장 신뢰하지 않는 구간에서 점수를 표시하지 않겠다는 뜻이며, 이 자료의 다른 모든 곳에서는 오류율이 설명만 될 뿐 실제 조치가 취해지지 않는다는 점을 기억해 둘 가치가 있습니다.

무엇을 위한 어휘가 있는가

무언가가 작동하고 있으며, FAQ 는 이를 'What parameters or flags does Turnitin's model take into account when detecting AI writing?'라는 제목 아래에서 이렇게 설명합니다.

"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers." (우리의 분류기는 단어 확률의 이러한 차이를 감지하도록 학습되며, 인간 작가 특유의 단어 확률 시퀀스를 잘 파악합니다.)

같은 답변은 모델이 '"burstiness," "perplexity," 또는 공개 논의에서 때때로 언급되는 기타 개별 지표를 명시적으로 평가하도록 프로그래밍되지 않았으며', 대신 '"학습 데이터에서 통계적 패턴을 학습한다"'고 덧붙입니다. 두 문장 모두 페이지에 실려 있으며, 하나만 읽으면 오해하게 됩니다. 업체는 두 개의 공개된 지표를 부인하는 것이지, 단어 확률이 통화 수단이라는 사실을 부인하는 것이 아닙니다. 이것이 사람들이 논쟁하는 용어들에 어떤 의미인지는 AI 탐지기가 측정하는 것 에서 자세히 설명합니다.

이제 발표된 단위를 아래에서 위로 따라가 봅시다. 단어, 그다음 문장, 그리고 이어서:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1 ... Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (논문이 Turnitin 에 제출되면, 제출물에서 문장을 추출하여 예측 분석을 위해 중복되는 섹션으로 분할합니다. 각 세그먼트는 AI 감지 모델에 의해 분류되며 0 에서 1 사이의 값을 받습니다... 이러한 세그먼트 내의 각 적격 문장은 세그먼트의 점수를 상속받습니다. 세그먼트가 겹치므로 일부 문장은 여러 점수를 가질 수 있으며, 이는 단일 점수로 통합됩니다. 이러한 문장 점수는 더욱 집계되어 전체 문서 AI 작성 점수를 계산하는 데 사용됩니다.)

사슬은 여기서 끝납니다. 분류되는 가장 큰 대상은 세그먼트이며, 이는 몇 개 문장 너비이고, 문서 번호는 그러한 세그먼트의 집계이지, 전체를 읽은 후 내려지는 두 번째 판단이 아닙니다. 에세이를 좋게 만드는 거의 모든 것은 세그먼트보다 큽니다. 8 페이지에 걸쳐 이어지는 논증, 잘 선택된 증거, 2 절에서 제기되어 5 절에서 답해지는 반박. 그 어느 것도 분류가 일어나는 규모에서 객체가 아닙니다. 시스템이 당신의 추론을 저울질해서 싫어하는 것이 아닙니다. 그런 자리가 없습니다.

'인간'이 무엇을 기준으로 보정되는가

학술 산문의 거짓 긍정에 관해 논의할 때, 업체는 ChatGPT 이전 테스트 코퍼스를 지적합니다.

"To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (테스트 프레임워크를 강화하고 거짓 긍정의 통계적 추세를 진단하기 위해, 모든 업데이트 또는 새 모델 릴리스 전에 ChatGPT 릴리스 이전에 작성된 70 만 편 이상의 추가 학술 논문을 테스트하여 1% 미만의 거짓 긍정 비율을 더욱 검증합니다.)

FAQ 는 자체 제목인 'How does Turnitin ensure that the false positive rate for a document remains less than 1%?'에서 같은 질문을 다시 던지며, 'over'라는 단어를 빼고 동일한 수치를 반복합니다. 'we perform additional tests on 700,000 additional academic papers that were written before the release of ChatGPT'. 같은 코퍼스, 같은 페이지에 약간 다른 두 문장입니다.

Turnitin 이 이 참조 집단을 어떻게 설명하는지 읽어보세요. ChatGPT 릴리스 이전에 작성되었다는 이유로 선택된 학술 논문입니다. 이는 날짜 기반 설명이지, 모든 논문이 독립적으로 인간이 작성했음을 검증했다는 진술이 아닙니다. 좁은 주장이라도 여전히 유용합니다. Turnitin 은 모델 릴리스 전에 이 ChatGPT 이전 학술 코퍼스를 다시 실행하여 거짓 긍정 비율을 관찰한다고 말합니다. 페이지는 논문별 저자성 검증을 설명하지 않습니다.

이것으로 결정되는 것은 아니며, 우리가 그렇게 말한다면 과장일 것입니다. 업체는 목표치만 발표할 뿐 그 배후의 분포는 발표하지 않으며, 목표치 자체는 바로 다음 문장에서 조용히 떨어뜨리는 한계를 지닙니다. 이 논증의 전체 버전, 즉 작은 비율에 실제 대학의 연간 규모를 곱하면 어떻게 되는지는 1% 의 위양성률이 의미하는 바 에서 다룹니다.

오류 분포는 공개되지 않았습니다

페이지는 1% 미만의 거짓 긍정 비율을 명시하지만, 오류가 테스트 코퍼스 전체에 어떻게 분포하는지는 발표하지 않습니다. 하위 그룹 비율도 없으며, 어떤 유형의 텍스트가 다른 유형보다 더 많은 오류를 차지하는지도 보여주지 않습니다.

대신 페이지는 거짓 긍정이 포함될 수 있는 텍스트의 정량 없는 목록과 이어지는 비율 해석 지침을 공개합니다.

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (때때로 거짓 긍정 (인간이 작성한 텍스트를 AI 생성으로 잘못 표시) 은 구조적 변이가 많지 않은 콘텐츠, 문자 그대로 반복되는 텍스트, 새로운 아이디어를 발전시키지 않고 다시 쓴 텍스트를 포함할 수 있습니다. 이러한 텍스트에서 AI 작성 비율이 높게 나왔다면, 표시된 비율을 볼 때 이를 고려하시기 바랍니다.)

그 목록에 무엇 있고 무엇 없는지 보세요. 정교한 어휘도, 긴 문장도, 강력한 논증도 없습니다. 세 가지 가능한 텍스트 특성을 명시하지만, 각각의 빈도는 주지 않습니다. 세 번째는 당신이 직접 쓰면서 산출했을 법한 무엇이 아니라 프로세스를 설명합니다.

첫 두 가지는 일반적인 학술 관행과 비교해 볼 가치가 있습니다. 이어지는 내용은 업체의 설명이 아니라 우리의 해석입니다. 당신의 분야에서 하나의 대상을 매번 같은 이름으로 부르도록 요구한다면, 동음이의어를 도입할 수 있으므로 의도적으로 같은 용어를 반복할 수 있습니다. 독자가 나란히 비교할 수 있도록 비교 가능한 항목들을 병렬 문장으로 배치한다면, 같은 이유로 구조적 변이를 줄일 수 있습니다. 두 선택 모두 실수가 아닙니다. Turnitin 은 거짓 긍정이 이러한 특성을 포함할 수 있다고 말합니다. 하지만 얼마나 자주인지는 말하지 않으며, 오류가 그곳에 집중된다고도, 그러한 특성이 오류와 상관된다고도 말하지 않습니다.

우리가 말하지 않는 것은, 이것으로 뒷받침되는 어떤 주장보다 훨씬 큰 주장이기 때문입니다. '다듬어진 글이 문제된다'는 문장은 널리 회자되며, 대개 '당신이 할 수 있는 것보다 덜 유능하게 쓰라'는 지시와 연결됩니다. 공개된 목록이 실제로 뒷받침하는 수정과, 그것을 손으로 하는 비용은 도구 없이 AI 텍스트를 인간적으로 만드는 법 에서 다룹니다.

두 번째 문장이 누구를 위해 쓰였는지도 주목하세요. 그 비율을 보고 있는 사람에게 어떤 텍스트가 그 비율을 산출했는지 저울질하라고 요청합니다. 지시는 논문을 쓴 사람이 아니라 리포트를 들고 있는 사람을 향합니다.

당신의 글쓰기 유형이 더 불리한지는 공개되지 않았습니다

다음으로 당연한 질문은 거짓 긍정이 당신의 분야, 섹션, 장르에서 더 흔한지입니다. FAQ 에는 이에 가까운 제목이 있습니다. 'Does the Turnitin model take into account that AI writing detection technology might be biased against particular subject-areas or second language writers?' 답변은 학습 샘플에 관한 것입니다.

"One of the guiding principles of our company and of our AI team has been to minimize the risk of harm to students, especially those disadvantaged or disenfranchised by the history and structure of our society. Hence, while creating our sample dataset, we took into account statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments and less common subject areas such as anthropology, geology, sociology, and others." (저희 회사와 AI 팀의 지도 원칙 중 하나는 학생들에게 해가 갈 위험을 최소화하는 것이며, 특히 우리 사회의 역사와 구조로 인해 불리하거나 권리가 박탈된 학생들을 위한 것입니다. 따라서 샘플 데이터셋을 만들 때, 제 2 언어 학습자, 비영어권 국가 출신 영어 사용자, 다양한 학생이 재학 중인 대학 및 인류학, 지질학, 사회학 등 덜 일반적인 분야 학생들과 같이 통계적으로 대표성이 부족한 그룹을 고려했습니다.)

'anthropology', 'geology', 'sociology'라는 과목명은 샘플 구축 방식을 설명하는 문단에만 나타납니다. 'discipline', 'genre', 'subgroup'은 세 페이지 모두에 없습니다. 따라서 과목 영역은 학습에 대한 입력으로 나타나지만, 공개된 테스트 분류표는 아닙니다. 인류학에 대한 거짓 긍정 비율은 없으며, 업체는 편향 답변 뒤에 수치를 두지 않습니다. 그래서 이는 의도 진술로 읽혀야 합니다.

이 간극이 바로 이 질문에서 모두가 붙잡는 수치가 회사 밖에서 나온 이유입니다. 91 편 TOEFL 에세이에 대한 2023 년 연구이며, 그 범위, 통제된 수정, 실제 한계는 비원어민 영어 작가가 AI 탐지기에 더 자주 flagged 되는 이유 에서 다루었습니다. 또한 두 감지기가 같은 단락에 서로 다른 판단을 내릴 수 있는 이유이기도 하며, 이는 탐지기가 일치하지 않는 이유 에서 다루는 별개의 복잡한 문제입니다.

당신의 최고 작업 중 일부는 아예 측정 대상이 아닙니다

'내 좋은 에세이를 문제삼았다'는 틀이 잘못된 데는 또 다른 이유가 있으며, 이는 비율이 무엇의 비율인지에 관한 것입니다. 당신의 문서 중 일부만 채점 대상이 됩니다.

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. This percentage is not necessarily the percentage of the entire submission." (이 적격 텍스트는 산문 문장만 포함합니다. 즉, 표준 문법적 문장으로 작성된 텍스트 블록만 분석하며, 목록, 불릿 포인트 (짧은 비문장 구조) 또는 기타 비문장 구조와 같은 다른 유형의 작성은 포함하지 않습니다. 이 비율이 반드시 제출물 전체의 비율은 아닙니다.)

2023 년 8 월에 발표된 두 가지 변경사항으로 경계가 더욱 이동했습니다. 하나는 표 내 롱폼 산문이 이제 처리된다는 것이며, 다른 하나는 때때로 참고문헌 내 AI 작성을 강조하던 버그가 수정되어 참고문헌이 이제 처리에서 제외된다는 것입니다. 두 릴리스 노트 모두 그 변경사항이 적용되기 전에 기존 논문을 다시 제출하라고 알려줍니다.

따라서 2 밤을 들여 정렬한 참고문헌과 짧은 비문장 불릿으로 작성된 포함 기준은 채점 집합 밖에 있습니다. 표는 조건부입니다. 그 안의 롱폼 산문은 처리될 수 있지만, 숫자 셀, 단편, 기타 비문장 표 콘텐츠는 적격 산문 밖에 남을 수 있습니다. 따라서 비율은 제출물 전체를 설명하지 않을 수 있습니다. 또한 이것이 당신의 눈앞에 있는 컬러 텍스트 양과 일치하지 않을 수 있는 기계적 이유이기도 하며, 이는 Turnitin AI writing report 읽는 법 에서 한 줄씩 분석합니다.

이 모든 것을 어떻게 활용해야 하는가

이 중 얼마는 당신이 어떻게 쓰는가와 관련이 없으며, 대부분은 그 숫자가 얼마나 무게를 가질 수 있는가와 관련이 있습니다.

  • 덜 유능하게 들리는 것은 배제해야 할 유일한 수단입니다. 위의 모든 내용은 이에 반대하며, 교환은 상식적으로 불균형합니다. 평가자의 점수는 확실하게 작용하는 반면, 점수에 미치는 효과는 누구도 측정한 바 없으며 대개 당신은 지켜볼 수조차 없습니다.
  • 몇 점인지가 아니라 어떤 부분인지 물으세요. 강조는 분류기가 어디에 내려졌는지를 보여줍니다. 비율은 적격 텍스트 중 얼마나 많은 부분을 차지하는지 알려주며, 이는 에세이 전체 중 얼마인지와는 다른 양입니다.
  • 짧은 문서는 거칠게 측정된다고 예상하세요. 업체의 말. '몇 백 단어만 있는 짧은 문서에서는 예측이 대부분 '전부 또는 전무'일 것입니다. 중복될 기회 없이 단일 세그먼트로 예측하기 때문입니다.' 그다음 문장이 중요합니다. '즉, AI 생성과 오리지널 콘텐츠가 섞인 일부 텍스트가 전적으로 AI 생성으로 플래그될 수 있습니다.' 적격 텍스트 300 단어 미만이면, 파일 요구사항에 따라 아예 읽을 리포트가 없습니다.
  • 당신의 산문이 장르가 요구하므로 관례적이라면, 업체의 조언이 누구를 위해 쓰였는지 확인하세요. 그 문장은 당신에게가 아니라 비율을 읽는 사람을 향해 있습니다. 논문이 바뀌어야 한다는 결론을 내리기 전에 알아둘 가치가 있습니다.
  • 어떤 결과 수치에 대한 약속도 불신하세요. 우리의 약속도 포함입니다. Turnitin 자신의 입장로는 개별 예측이 '간단한 기능별 용어로 항상 설명 가능한 것은 아니다'라고 합니다. 회사 밖의 누구도 수정을 점수 이동과 연결할 수 없습니다.

재작성이 들어맞는 곳, 들어맞지 않는 곳

이 중 어느 것도 재작성을 위한 논증이 아닙니다. 작업이 당신의 것이며 그렇게 말할 준비가 되어 있다면, 바뀌어야 할 대상은 논문이 아닙니다.

재작성이 제자리를 얻는 것은 특정 지점, 즉 리포트가 존재하고 특정 부분이 표시되어 있으며, 그 부분을 어쨌든 수정하게 될 때뿐입니다. 그것이 HumanPen 이 구축된 형태입니다. Turnitin 또는 iThenticate 의 파일과 AI 리포트를 함께 제공하면, 표시된 부분이 범위가 되며, 그 밖의 부분은 당신의 단어를 유지합니다. 우리 페이지는 세분성 규칙을 명시합니다. '문단은 엔진이 재작성하는 최소 단위입니다. 선택이 하나의 일부만 덮는 경우, 전체 문단으로 확장되어 확인을 위해 표시됩니다.' 청구는 실제 재작성된 단어 수를 세므로, 범위가 있는 작업은 파일의 무게가 아닌 범위가 비용을 결정합니다.

새 리포트에서도 여전히 부분이 플래그된다면, 적격 결과는 AI 를 무료로 낮출 수 있습니다. 하지만 누구도 다음 리포트의 수치를 건넬 수는 없습니다. 위의 모든 내용을 겪은 후, 하나의 수치를 인용하는 도구는 자신이 가지지 않은 수치를 인용하는 것입니다.

자주 묻는 질문

잘 쓴 산문이 더 많이 플래그되나요? 그것은 공개된 자료가 뒷받침하는 것보다 큰 주장이며, 우리는 그것을 하지 않습니다. 문서화된 것은 Turnitin 이 거짓 긍정이 포함할 수 있다고 말하는 세 가지 텍스트 유형 목록이며, 그 어느 것도 품질 판단이 아니며, 하나의 2023 년 샘플에서 영어 어휘 범위가 좁은 작가에게 측정된 효과뿐입니다. 광범위한 버전은 발견이 아니라 유포된 주장으로 취급하세요.

고급 어휘를 사용하면 AI 점수가 오르나요? 업체가 공개한 것은 어느 것도 이에 관해 말하지 않습니다. 'vocabulary'와 'word choice'는 우리가 검색한 세 도움말 페이지 모두에서 없었습니다. 하나의 2023 년 통제 실험은 어휘 선택을 직접 옮겼으며, 속설 이론과 함께가 아니라 반대 방향으로 작용했습니다. 연구자들은 이미 플래그된 에세이의 어휘를 풍부하게 했으며, 플래그는 떨어졌습니다. 이는 그 실험에서 어휘 선택이 정적이지 않았음을 증명합니다. 당신의 문서에 대해서는 아무것도 증명하지 않습니다.

용어가 일관되어야 하므로 내 글이 반복됩니다. 그것이 관례적 경우이며, 업체의 거짓 긍정 목록 중 한 항목에 답합니다. 그 상황에서 업체의 조언은 리포트를 읽는 사람을 향합니다. 비율을 볼 때 텍스트의 성격을 고려하세요.

의도적으로 문장 길이 변형을 추가해야 하나요? 포맷팅 연습으로서는 하지 마세요. 변형이 이미 의미를 담고 있는 곳에서는 복원이 일반적인 수정입니다. 일관성을 요구하는 관례가 있는 섹션에서 그것을 제조하는 것은, 당신이 속한 분야가 요구하는 글쓰기를 요구하지 않는 글쓰기로 대체하는 것이며, 그 효과는 밖에서 누구도 측정할 수 없습니다.

제출 전에 점수를 직접 확인할 수 있나요? 대개는 아닙니다. Turnitin 의 입장은 AI 작성 지표와 리포트는 강사와 관리자를 위한 것이며, 강사가 리포트를 다운로드하여 전달할 때만 학생에게 도달합니다. 숫자가 움직임을 지켜본다고 가정하는 조언은 대다수 학생들이 가지지 않은 접근을 가정합니다.