영문 에세이 AI 비율이 너무 높게 나왔다면? 리포트부터 확인하세요

Turnitin 에서 영문 에세이의 AI 비율이 높게 나왔을 때, 첫 단계는 비율을 낮추는 게 아닙니다. 실제로 숫자가 얼마인지, 어떤 표시 규칙에 따라 그 숫자가 나왔는지, 그리고 모델의 확률 판단에서 당신의 단어 선택이 어느 쪽으로 떨어졌는지를 파악하는 것입니다. 해결책은 'perplexity'라는 다이얼을 돌리는 게 아닙니다. 해결책은 당신의 단어 확률을 인간 고유의 패턴 쪽으로 옮기는 것입니다.

HumanPen 팀

· 13분

간단한 답변

Turnitin 의 AI 작성 리포트는 1% 에서 19% 사이에서는 숫자를 전혀 표시하지 않습니다. 대신 별표시를 보여주고 하이라이트를 숨깁니다. 이 구간에서는 구체적인 퍼센트 수치가 나오지 않죠. 20% 이상이 되어야만 정확한 퍼센트가 표시되며, 실제로 검토할 수 있는 하이라이트된 구절들이 나타납니다. 그러니 "AI 비율이 너무 높다"라고 말할 때 첫 번째로 해야 할 일은 낮추는 게 아니라, 지금 보고 있는 게 실제 숫자인지 별표시인지를 확인하는 것입니다. 숫자만이 내가 할 수 있는 조치를 취할 수 있게 해주니까요.

두 번째 단계는 왜 높아졌는지를 묻는 것입니다. Turnitin 의 모델은 텍스트를 겹치는 세그먼트로 나누고 각각에 0 에서 1 사이의 확률을 매긴 뒤, 그 점수들을 모아서 문서 전체의 퍼센트로 합산합니다. 당신의 단어 선택이 모델의 확률 구분에서 AI 생성 쪽으로 떨어지면 점수가 올라갑니다. 중국어가 모국어인 사람이 영어로 글을 쓸 때 확률을 AI 쪽으로 밀어내는 세 가지 통계적 경향이 있습니다. 각각 아래에서 자세히 살펴보겠습니다.

세 번째 단계는 수정입니다. 방향은 'perplexity'라는 지표를 낮추는 게 아닙니다. Turnitin 이 명시적으로 perplexity 를 계산하지 않기 때문입니다. 방향은 당신의 단어 확률을 인간 고유의 패턴 쪽으로 다시 옮기는 것입니다. 실제로 당신이 떠올리는 단어를 쓰고, 평소에는 쓰지 않는 문장 구조를 사용하며, 문서 전체를 한 번에 고치는 게 아니라 플래그가 찍힌 구절을 하나씩 수정해 나가는 것입니다.

'너무 높다'는 것이 실제로 무엇을 의미하는가

Turnitin 의 AI 작성 리포트는 낮은 점수에 대해 특별한 표시 규칙이 있습니다. detection capabilities FAQ 에 이렇게 나와 있습니다:

"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (%) and no percentage is attributed."(가양성 발생 가능성을 피하기 위해 AI 감지 점수가 1% 에서 19% 범위일 때는 점수나 하이라이트가 부여되지 않습니다. 리포트에서 AI 가 20% 임계값 미만으로 감지되면 이제는 별표 (%) 로 표시되며 백분율은 부여되지 않습니다.)

그러니 당신이 보고 있는 'AI 비율'이 퍼센트 기호와 함께 나온 숫자라면 최소 20 이상입니다. 별표시를 보고 있다면 1 에서 19 사이에 있다는 뜻이고, 리포트는 정확한 위치를 알려주지 않습니다. 20 미만에서 표시되는 유일한 정확한 수치는 0 뿐입니다.

이 구분은 사소해 보일 수 있지만 다음 단계를 결정합니다. 별표시는 하이라이트된 구절이 없고 무엇을 수정해야 할지 찾을 방법이 없으며 대상으로 삼을 것이 없다는 뜻입니다. 20 이상의 숫자는 하이라이트가 함께 나오며, 하이라이트야말로 플래그가 찍힌 텍스트를 찾아서 바꿀 수 있게 해주는 유일한 것입니다. 그러니 "AI 비율이 너무 높은데 어떻게 해야 하나요"라는 질문에 실행 가능한 답변이 있는 것은 리포트가 20% 이상이고 하이라이트를 볼 수 있을 때뿐입니다. 우리는 Turnitin AI 작성 리포트 읽는 법 에서 리포트 자체를 자세히 살펴보았습니다.

먼저 확인할 것이 하나 더 있습니다. Turnitin 은 "지시자와 리포트는 학생에게는 보이지 않으며, 교수와 관리자만이 볼 수 있다"고 명시합니다. 만약 당신이 리포트를 가지고 있다면 누군가가 다운로드해서 건네주었기 때문입니다. 스크린샷이 아닌 전체 PDF 를 가지고 있는지 확인하세요.

왜 높아지는가: 당신의 단어 확률이 AI 쪽에 있기 때문이다

Turnitin 은 자사 FAQ 에서 계산 연쇄를 이렇게 설명합니다:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score."(논문이 Turnitin 에 제출되면 제출문의 문장들이 추출되어 예측 분석을 위해 겹치는 섹션들로 세그먼트화됩니다. 각 세그먼트는 AI 감지 모델에 의해 분류되며 0 에서 1 사이의 값이 부여되는데, 이는 텍스트가 인간 작성일 확률과 AI 생성일 확률을 나타냅니다. 이 세그먼트 내의 각 적격 문장은 세그먼트의 점수를 물려받습니다. 세그먼트가 겹치기 때문에 일부 문장은 여러 점수를 가질 수 있으며, 이 점수들은 하나의 점수로 풀링됩니다. 이 문장 점수들은 추가로 집계되어 문서 전체의 AI 작성 점수를 계산하는 데 사용됩니다.)

이것은 확률 연쇄입니다. 당신의 각 문장이 모델로부터 0 에서 1 사이의 점수를 받으며, 1 에 가까울수록 더 AI 같습니다. 그 점수들이 합산되어 당신이 보는 퍼센트가 나옵니다.

그러므로 '높은 AI 비율'의 기계적 의미는 구체적입니다: 당신의 글이 모델의 확률 공간에서 AI 생성 쪽으로 떨어진다는 것입니다. AI 를 사용해서가 아니라, 당신의 단어 선택과 문장 패턴의 통계적 특징이 우연히 AI 생성 텍스트의 평균 패턴과 더 가깝기 때문입니다.

여기서 널리 퍼진 주장을 바로잡아야 합니다. 많은 답변들이 Turnitin 의 메커니즘을 'perplexity 와 burstiness 를 측정하는 것'으로 설명한 뒤 이 두 값을 낮추는 법을 알려줍니다. 그러나 Turnitin 은 FAQ 에서 이를 명시적으로 부인합니다:

"Our model is not explicitly programmed to evaluate specific signals such as \"burstiness,\" \"perplexity,\" or other individual metrics sometimes referenced in public discussions."(우리의 모델은 공개 논의에서 때때로 언급되는 "burstiness", "perplexity" 또는 기타 개별 지표와 같은 특정 신호를 평가하도록 명시적으로 프로그래밍되지 않았습니다.)

바로 그 다음 문장은 이렇습니다:

"Instead, it learns statistical patterns from our training data."(대신, 이는 우리 훈련 데이터에서 통계적 패턴을 학습합니다.)

하지만 이것이 Turnitin 이 단어 확률을 무시한다는 뜻은 아닙니다. 같은 FAQ 페이지의 다른 곳에 이렇게 나와 있습니다:

"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers."(우리의 분류기는 단어 확률의 이러한 차이를 감지하도록 훈련되었으며 인간 작성자의 특정한 단어 확률 시퀀스에 능숙합니다.)

이 두 진술은 함께 읽어야 합니다. Turnitin 은 perplexity 라는 이름의 점수를 명시적으로 계산하지 않지만, 분류기는 단어 확률 수준에서 판단을 내립니다. perplexity 자체가 단어 확률의 척도이기 때문입니다. 올바른 진술은 이렇습니다: 당신은 perplexity 라는 다이얼을 조정할 수 없습니다. 그런 다이얼이 명시적 입력으로서 존재하지 않기 때문입니다. 대신 당신이 할 수 있는 것은 당신의 단어 확률 분포를 바꾸어서 모델이 이를 인간 작성 쪽으로 다시 위치하게 하는 것입니다.

중국어 화자가 영어를 쓸 때 플래그가 더 많이 찍히는 이유

이 섹션에서는 세 가지 통계적 경향에 대해 다룹니다. 각각이 당신의 단어 확률을 AI 쪽으로 밀어냅니다. 이것들이 중국어 화자의 결함이 아닙니다. 제 2 언어로 글을 쓰면서 동시에 문법, 어휘, 논증을 관리할 때 나타나는 패턴들입니다.

첫째, '안전한' 고빈도 단어를 찾는 경향. 제 2 언어로 영어를 쓸 때 자연스러운 본능은 의미가 안정적이고 오류 위험이 낮은 단어를 선택하는 것입니다. 그런 단어들은 고빈도 단어입니다. 또한 그런 단어들이 AI 생성 텍스트가 가장 자주 찾는 단어이기도 한데, 언어 모델이 확률에 따라 선택하고 고빈도 단어가 높은 확률을 갖기 때문입니다. 당신의 단어 분포가 빈도 표의 상단에 집중될수록 평균 AI 생성 분포와 더 가까워집니다. 이미 인용한 문장, "우리의 분류기는 단어 확률의 이러한 차이를 감지하도록 훈련되었으며 인간 작성자의 특정한 단어 확률 시퀀스에 능숙합니다"라는 말은 바로 이것을 가리킵니다. 분류기는 단어 확률 시퀀스를 읽으며, 인간 작성자는 그들 고유의 특징적인 시퀀스를 가지고 있습니다. 고빈도 집중은 그 중 하나가 아닙니다.

둘째, 낮은 구조적 변이. Turnitin 은 가양성을 일으키기 쉬운 특징들을 이렇게 나열합니다:

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas."(때때로 가양성 (인간이 쓴 텍스트를 AI 생성으로 잘못 플래그하는 것) 에는 구조적 변이가 많지 않은 콘텐츠, 문자 그대로 반복되는 텍스트, 또는 새로운 아이디어를 발전시키지 않고 패러프레이즈된 텍스트가 포함될 수 있습니다.)

바로 그 다음 문장은 이렇습니다:

"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated."(우리의 지표가 이러한 텍스트에서 더 많은 AI 작성을 보여준다면, 표시된 백분율을 볼 때 그 점을 고려할 것을 권합니다.)

제 2 언어로 영어를 쓸 때 문장 구조에 할당할 수 있는 인지적 예산은 좁습니다. 그 결과는 구조적 일관성입니다: 주어 - 동사 - 목적어, 주어 - 동사 - 목적어, 주어 - 동사 - 목적어. 낮은 구조적 변이는 바로 Turnitin 이 가양성 경향이 있는 특징 목록에서 첫 번째로 꼽는 항목입니다. 공식적인 조언은 그러한 텍스트에 대해 높은 점수를 할인하라는 것이며, 그 문장은 첫 번째 문장과 함께 가야 합니다.

셋째, 기계 번역이나 Grammarly 사용 가능성. 기계 번역 출력은 그 자체로 언어 모델에 의해 생성되므로 단어 확률 분포가 자연스럽게 AI 쪽으로 위치합니다. Grammarly 의 상황은 더 구체적입니다. Turnitin 의 FAQ 에는 전용 진술이 있습니다: 맞춤법, 문법, 구두점 변경은 '대부분의 경우'플래그되지 않지만, Grammarly 의 생성 기능 (초안 생성, 패러프레이징, 요약 포함) 은 그 면제 대상이 아닙니다. 공식적인 표현은 그러한 기능을 사용하여 생성된 콘텐츠는 "AI 생성으로 플래그될 가능성이 높다"입니다. 그러니 Grammarly 의 문장 다시 쓰기를 사용했다면 그 구절들이 플래그되는 것은 놀라운 일이 아니라 예상되는 일입니다.

왜 AI 감지기가 비원어민 영어 작가에게 편향되어 있는가 는 이 질문군을 더 넓은 틀에서 위치짓습니다.

낮추는 법: perplexity 가 아니라 단어 확률을 바꾸세요

첫째, 무엇을 하지 말아야 하는지.

perplexity 를 낮추려고 하지 마세요. 이미 인용했듯이 Turnitin 은 자사 모델이 개별 지표로서 perplexity 를 평가하도록 명시적으로 프로그래밍되지 않았다고 말합니다. "perplexity 를 낮추라"는 조언은 거짓 전제에서 출발합니다. Turnitin 이 명시적으로 계산하지 않는 값을 낮출 수 없습니다. 많은 humanizer 마케팅 카피가 이 거짓 전제 위에 만들어져 있습니다.

단 하나의 문장에서 멈추지 마세요. Turnitin 은 겹치는 다문장 세그먼트에 점수를 매기므로, 하나의 문장에 국한된 변경은 그 주변의 단락과 경쟁합니다. 플래그가 찍힌 구절은 그것이 무엇을 먼저 놓는지, 어디에서 전환하는지, 멈추기 전에 얼마나 실행되는지 등 전체 분포의 형태 때문에 플래그가 찍힙니다. 작업할 단위는 문장이 아니라 구절입니다.

문서 전체를 다시 쓰지 마세요. 짧은 문서에는 문서화된 극단적 행동이 있습니다:

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap."(몇백 단어밖에 없는 더 짧은 문서에서는 예측이 대부분 '전부 아니면 전무'가 될 것입니다. 겹칠 기회가 없는 단일 세그먼트에 대해 예측하기 때문입니다.)

바로 그 다음 문장:

"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated."(이는 AI 생성 콘텐츠와 오리지널 콘텐츠가 섞인 일부 텍스트가 전적으로 AI 생성으로 플래그될 수 있음을 의미합니다.)

그러니 절반만 다시 쓴 짧은 문서는 특히 위험합니다. 당신은 절반을 다시 썼고, 나머지 절반이 AI 로 불리며, 전체가 높게 나옵니다.

이제 무엇을 해야 하는지.

먼저 리포트를 받으세요. 이미 인용했듯이 학생들은 지시자를 볼 수 없지만 교수들은 PDF 를 다운로드하여 공유할 수 있습니다. 당신은 그 PDF 를 요청할 권리가 있습니다. 일단 받으면 하이라이트된 구절을 찾으세요. 20% 이상의 리포트만 하이라이트가 있습니다. 어떤 구절들이 플래그되었는지 아는 것이 수정할 전제 조건입니다.

플래그 된 구절을 하나씩 수정하세요. 방향은 문장의 형태를 바꾸는 것입니다. 당신이 기본적으로 사용하는 주어 - 동사 - 목적어 패턴을 당신이 평소 쓰지 않는 구조로 대체하세요. 종속절, 도치, 삽입구, 문장 간 참조 같은 것들입니다. 이런 구조들이 당신의 단어 확률 시퀀스를 바꾸며, 이것이 모델이 읽는 것입니다. 세그먼트가 겹치기 때문에 문장의 점수는 이웃의 영향도 받으므로, 하나의 구절을 수정하면 주변 문장들의 점수도 바뀝니다.

실제로 당신이 떠올리는 단어를 사용하세요. 안전한 고빈도 어휘로의 끌림을 저항하세요. 덜 흔하더라도 당신이 실제로 원하는 단어를 사용하세요. 인간 작성자의 단어 확률 시퀀스에서 특징적인 부분은 종종 빈도 표의 상단에서 벗어나는 선택에 있습니다.

적격 텍스트의 경계를 염두에 두세요. Turnitin 은 표준 문법 문장만 분석합니다:

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures."(이 적격 텍스트는 산문 문장만 포함합니다. 즉, 우리는 표준 문법 문장으로 쓰인 텍스트 블록만 분석하며 목록, 불릿 포인트 (짧은 비문장 구조) 또는 기타 비문장 구조와 같은 다른 유형의 작성은 포함하지 않습니다.)

바로 그 다음 문장:

"This percentage is not necessarily the percentage of the entire submission."(이 백분율은 반드시 제출물 전체의 백분율은 아닙니다.)

그러니 당신이 보는 숫자는 파일 전체가 아닌 적격 텍스트에 대한 퍼센트입니다. 수정할 때는 적격 텍스트를 목표로 하세요. 불릿 리스트를 편집해도 그 분자는 움직이지 않습니다.

설계적 절충: 모델은 오경보보다 놓치는 것을 선호한다

하나 더. 당신의 점수를 어떻게 읽는지에 영향을 미치기 때문입니다. Turnitin 은 자사 FAQ 에서 설계적 절충을 공개합니다:

"In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing."(가양성에 대한 이 1% 의 낮은 비율을 유지하기 위해, 우리는 문서에서 AI 가 쓴 텍스트를 일부 놓칠 가능성이 있습니다. 우리는 인간이 쓴 텍스트를 AI 가 쓴 것으로 잘못 하이라이트하고 싶지 않기 때문에 이에 대해 편안합니다. 예를 들어, 우리가 문서의 50% 가 AI 도구에 의해 쓰였을 가능성이 있다고 식별하면, 그것은 최대 65% 의 AI 작성을 포함할 수 있습니다.)

방향은 명시적입니다: 모델은 AI 텍스트를 플래그하기보다 놓치는 것을 선호합니다. 이는 리포트가 기본적으로 과소 보고하는 경향을 가지고 있음을 의미합니다. 과소 보고하는 것이지 과대 보고하는 것이 아닙니다. 높은 점수를 보고 있다면, 그 점수는 모델 설계의 공세적인 측면이 아니라 보수적인 측면에 있는 것입니다. 이것이 점수가 맞다는 증거는 아닙니다. 하지만 그것을 상한선으로 treating 해서는 안 된다는 뜻입니다.

'구조 바꾸기'가 실제로 어떻게 보이는가

'구조를 바꾼다'는 말은 추상적으로 들립니다. 예시가 그것을 구체적으로 만듭니다.

  • 원문: "The results show that the method is effective."(그 결과는 그 방법이 효과적임을 보여줍니다.)
  • 재구성: "What the results show is not that the method works in general, but that it works under the specific condition we tested."(결과가 보여주는 것은 그 방법이 일반적으로 작동한다는 것이 아니라, 우리가 테스트한 특정 조건에서 작동한다는 것입니다.) 이 문장은 단순한 주어 - 동사 - 목적어에서 전환을 가진 강조 구조로 이동합니다. 단어 확률 시퀀스가 다릅니다. 모델은 다른 분포를 봅니다.

구조를 바꾸는 것은 화려한 문장을 쓰는 것이 아닙니다. 당신이 평소 쓰지 않는 문장 구조를 쓰는 것입니다. 당신이 평소 쓰지 않는 구조야말로 인간 작성자 확률 서명이 있는 바로 그 곳이기 때문입니다.

리포트와 함께하는 5 분

  1. 스크린샷이 아닌 PDF 를 가지고 있는지 확인하세요. 스크린샷은 날짜도 없고 하이라이트 위치도 없으며 어떤 리포트인지 알 방법이 없습니다.
  2. 수치가 퍼센트인지 별표시인지 확인하세요. 퍼센트는 20% 이상이며 작업할 하이라이트가 있다는 뜻입니다. 별표시는 1% 에서 19% 사이이며 하이라이트도 없고 찾을 것도 없습니다.
  3. 구체적으로 하이라이트된 구절을 찾으세요. 그것들이 수정할 것들입니다. 나머지는 그대로 두세요. 플래그되지 않은 텍스트를 바꾸는 것은 낭비입니다.
  4. 각 플래그 된 구절을 읽고 어떤 경향이 그것을 생성했는지 진단하세요. 균일한 문장 구조? 고빈도 어휘? Grammarly 다시 쓰기? 다른 원인은 다른 수정이 필요합니다.
  5. 문장 구조를 재구성하세요. 플래그 된 문장들을 당신이 평소 쓰지 않는 구조로 다시 쓰세요.
  6. 수정 후 다시 확인하세요. 감지기는 변하며, Turnitin 은 자사 모델이 반복한다고 말합니다. 그래서 고정된 결과를 약속할 수는 없습니다. 당신이 할 수 있는 것은 수정 후 또 다른 리포트를 실행하여 하이라이트가 줄어들었는지 보는 것입니다. 왜 다른 AI 감지기가 동의하지 않는가 는 서로 다른 감지기 결과가 서로를 검증할 수 없는 이유를 설명합니다.

자주 묻는 질문

높은 AI 비율이란 내가 AI 를 사용했다는 뜻인가? 아닙니다. Turnitin 의 모델은 단어 확률 분포를 읽지 사용 로그를 읽는 것이 아닙니다. 당신의 어휘가 고빈도이고 문장 구조가 균일하거나 기계 번역을 사용했다면 AI 를 사용하지 않아도 플래그될 수 있습니다. Turnitin 은 가양성을 일으키는 경향이 있는 특징들을 나열하며, 그러한 텍스트에 대해 높은 점수를 할인할 것을 교육자들에게 조언합니다.

내 AI 비율을 직접 확인할 수 있나? Turnitin 의 지시자를 통해서는 아닙니다. 공식 성명서는 지시자와 리포트가 학생에게 보이지 않으며 교수들이 PDF 로 리포트를 다운로드하여 공유할 수 있다고 말합니다. 당신이 보는 모든 리포트는 누군가가 보여주기로 선택했기 때문에 보는 것입니다.

어떤 구절을 먼저 수정해야 하나? 리포트가 실제로 표시한 것들입니다. Turnitin 은 구절 수준에서 리포트를 제공하므로, 표시된 구절들만이 작업할 증거가 있는 유일한 곳입니다. 표시되지 않은 구절을 수정하는 것은 리포트가 반응하는 것을 바꾸지 않고 에세이를 바꾸는 것입니다.

Grammarly 사용으로 플래그될까? 맞춤법, 문법, 구두점 변경은 대부분의 경우 플래그되지 않습니다. 하지만 Grammarly 의 생성 기능 (초안 생성, 패러프레이징, 요약 포함) 은 AI 생성으로 플래그될 가능성이 높습니다. 둘을 구분하세요.

짧은 논문이 더 플래그되기 쉬운가? 몇백 단어의 문서는 대부분 전부 아니면 전무인 예측을 가지며, 혼합된 콘텐츠도 전적으로 AI 로 플래그될 수 있습니다. 짧은 문서에서 부분적 재작성은 특히 주의하세요.

humanizer 도구가 내 점수를 낮출 수 있나? 이 아티클은 효능 주장을 하지 않습니다. Turnitin 의 설계 방향은 경보를 놓치는 것을 가양보보다 선호하는 것이며, 모델은 반복되고 미래 감지 결과에 대한 약속은 도구가 정직하게 할 수 없는 것입니다. 우리가 말할 수 있는 것은 리포트를 가지고 수정하면 어떤 구절이 움직였는지 알 수 있다는 것이며, 맹목적으로 수정하는 것은 그렇지 않다는 것입니다.

계속 읽기