AI 탐지기가 요구하는 최소 분량: 다섯 업체가 직접 공개한 수치

방금 다시 쓴 단락 하나를 무료 검사기에 붙여넣는 것은 가장 자연스러운 행동입니다. 그리고 그것은 바로 이 업체들이 모두 자기 문서에서 경고하는 그 경우이기도 합니다. 다섯 곳은 최소 분량을 공개하고 있습니다. 그중 한 곳은 자기 사람이 짧은 글을 직접 손으로 쓰고 도구가 그것을 AI로 판정한 실험 두 건을 공개했습니다.

HumanPen 팀

· 10분

AI 탐지기의 숫자에 뜻이 생기려면 텍스트가 얼마나 필요합니까?

여기에 나오는 모든 탐지기는 하한을 공개하고 있으며, 단락 하나는 그중 대부분 아래에 놓입니다. 아래 수치는 업체들이 자기 문서에서 밝힌 것으로, 2026년 9월 18일에 확인했습니다:

도구공개한 기준
Copyleaks — 엄격한 하한"For the AI Detector to get an accurate reading, it requires a minimum of 350 characters" (AI Detector가 정확한 판독을 하려면 최소 350문자가 필요합니다) — 단위는 단어가 아니라 문자입니다
Copyleaks — 권장 검사 분량"we suggest testing text containing an average of 350 words" (평균 350단어가 담긴 텍스트로 검사해 보시기를 권합니다)
Winston AI"Minimum 300 characters. Texts under 600 characters may produce unreliable results and should be avoided." (최소 300문자입니다. 600문자 미만인 텍스트는 신뢰할 수 없는 결과를 낼 수 있으므로 피해야 합니다.)
Originality.ai웹사이트에서는 100단어가 하한입니다. API에는 하한이 없지만 "accuracy is decreased for texts below 100 words" (100단어 미만인 텍스트는 정확도가 떨어집니다)라고 합니다
ZeroGPT"At least 150–200 words; longer text (500–1,000+) improves stability." (하한은 150단어이고 200단어까지를 염두에 둔 수치이며, 500에서 1,000단어 이상으로 길어지면 안정성이 높아집니다)
Turnitin산문이 300단어 미만이면 AI 점수가 아예 나오지 않습니다

이 가운데 두 개의 하한은 문자로 적혀 있고 나머지는 단어로 적혀 있어서, 서로 혼동하기 쉽습니다. 환산은 간단합니다. 영어 산문에서 단어 하나는 뒤에 붙는 공백까지 세면 대략 여섯 문자인데, 이 사이트에 공개된 5,357개 단락의 중위값은 6.0입니다. 환산하면 표에 있는 모든 하한을 단어 수로 바꿀 수 있습니다. Winston의 300문자 하한은 약 50단어, 600문자 미만은 피하라는 선은 약 100단어, Copyleaks의 350문자 하한은 약 58단어이고 권장 검사 분량은 350단어, Originality의 하한은 100단어, ZeroGPT는 최소 150단어 이상을 요구하고 200단어까지를 염두에 두며 500에서 1,000단어 이상이면 더 안정적이라고 하고, Turnitin의 하한은 300단어입니다. 여러분의 단락을 이 수치들과 맞춰 보십시오. 규모를 가늠하시도록 같은 5,357개 단락을 같은 하한들에 대고 세어 보았습니다. Winston의 300문자에 이르는 것은 54%, Copyleaks의 350문자에 이르는 것은 39%, Originality의 100단어에 이르는 것은 6%, ZeroGPT의 150단어에 이르는 것은 0.5%이고, Copyleaks가 권하는 350단어 분량에 이르는 단락은 하나도 없었습니다. 중위 단락은 51단어, 312문자입니다. 표에 있는 일곱 개 하한 가운데 Winston의 300문자 하나는 넘지만 나머지 여섯 개에는 못 미칩니다.

늘 한데 묶여 다니는 두 가지를 떼어 놓을 만합니다. 하한이란 업체가 자기 숫자를 더 이상 뒷받침하지 않는 지점입니다. 모든 경우에 그 아래에서는 아무것도 돌아오지 않는 지점을 뜻하는 것은 아닙니다. 이 도구들 가운데 일부는 어쨌든 백분율을 돌려줍니다. Originality.ai는 자사 API의 검사가 "have no word count minimum" (단어 수 하한이 없습니다)고 말한 뒤, 100단어 미만에서는 정확도가 떨어진다고 알려 줍니다. 어떤 도구는 아예 거부하고, Turnitin이 그중 하나입니다. 따라서 화면에 숫자가 떴다는 사실만으로는 그 도구가 표본이 충분히 크다고 판단했다는 증거가 되지 않습니다.

방금 다시 쓴 단락이 가장 다루기 어려운 경우인 이유

강조 표시된 부분을 고치고, 그 부분을 검사기에 붙여넣고, 숫자를 읽고, 다 됐는지 판단합니다. Originality.ai의 도움말 센터는 바로 이 동작을 오탐 원인 목록의 맨 윗부분에 올려 놓았습니다:

You are more likely to receive false positives by only scanning part of the entire piece of content: a single paragraph, the intro, the conclusion, half of the paper... etc. (콘텐츠 전체 가운데 일부만 검사하면 오탐을 받을 가능성이 더 큽니다. 단락 하나, 서론, 결론, 논문의 절반 등등.)

바로 다음 문장이 대신 무엇을 해야 하는지 말해 줍니다: "We can fix a lot of false positives by scanning the entire piece of content instead of a snippet. This just gives our tool more context and more content to go off of." (조각이 아니라 콘텐츠 전체를 검사하면 오탐 상당수를 해결할 수 있습니다. 그렇게 하면 저희 도구가 근거로 삼을 문맥과 내용이 더 많아집니다.)

같은 페이지에는 업체가 자기 자신을 상대로 실행한 실험 두 건이 실려 있습니다. 조언보다 보기 드물고 더 쓸모 있는 부분입니다:

  • 도움말 문서를 쓴 사람이 직접 손으로 쓴 50단어 분량의 블로그 서론이 79% AI로 돌아왔습니다.
  • 역시 손으로 쓴 107단어 분량의 결론이 69% AI로 돌아왔습니다. 페이지가 제시한 설명은 결론이 짧을 뿐 아니라 정형화되어 있다는 것입니다: "You summarize everything before, give the reader more options and places to click, and finish up with any final calls to action." (앞의 내용을 모두 요약하고, 독자에게 더 많은 선택지와 눌러 볼 곳을 제공하고, 마지막 행동 촉구로 마무리합니다.)

두 숫자 모두 사람이 쓴 텍스트에서 나왔습니다. 어느 쪽도 여러분의 글에 대한 증거가 아닙니다. 그것은 짧고 구조가 예측 가능한 발췌문이 점수를 어떻게 만드는지에 대한 증거입니다. 그리고 에세이의 서론과 결론은 원래부터 짧고 구조가 예측 가능하게 만들어집니다.

짧은 발췌문은 여러분 텍스트의 서식이 갖는 값어치도 바꿔 놓습니다. Copyleaks의 한계 페이지는 자사 탐지기가 수천 개의 패턴을 읽는다고, 그것도 "not just words or formatting" (단어나 서식만이 아닙니다)고 말한 뒤, 짧은 표본에서 결정적인 부분을 덧붙입니다: "Numbering, bullets, and outline-style headers are only one small part of the overall signal, but in very short texts they can have a larger relative impact to overall AI detection scores." (번호 매기기, 글머리 기호, 개요형 제목은 전체 신호의 아주 작은 부분에 지나지 않지만, 매우 짧은 텍스트에서는 전체 AI 탐지 점수에 더 큰 상대적 영향을 줄 수 있습니다.) 번호가 매겨진 단계 세 개로 된 방법 서술이 바로 그런 모양입니다.

다시 쓴 단락이 최악의 표본인 데에는 두 번째 이유가 있고, 그것은 길이와는 무관합니다. 그 단락은 여러분 문서에서 방금 가장 많이 편집된 부분입니다. Originality의 페이지는 도구 사용이 자기 점수에 미치는 영향을 노골적으로 적어 놓았습니다: "if a tool interacted with your content in any way, it will raise the AI score" (어떤 도구든 어떤 방식으로든 여러분의 콘텐츠에 관여했다면 AI 점수가 올라갑니다). 그리고 챗봇과 나란히 문법 검사기도 이름을 올립니다. 이 방침을 어떻게 보든, 그것이 뜻하는 바는 여러분이 작업해 온 단락이 편집 신호를 가장 많이 실은 단락이고, 여러분은 도구에게 그것만 놓고 판단해 달라고 부탁하고 있다는 것입니다.

문장 단위 숫자는 문서 전체 숫자보다 약합니다

요즘 대부분의 탐지기는 개별 문장에 색을 칠하고, 그러다 보니 보고서를 문장 단위로 읽게 됩니다. 두 업체는 그런 더 작은 단위의 판독이 전체 판독보다 무게가 가볍다고 직접 말합니다.

Winston AI의 API 문서는 자기가 돌려주는 문장별 점수 배열을 설명하면서 이렇게 덧붙입니다: "Please note that assessments on smaller samples are less accurate than the general score." (더 작은 표본에 대한 판정은 전체 점수보다 정확도가 떨어진다는 점에 유의해 주십시오.)

GPTZero의 문장 강조 표시에 대한 안내는 한 걸음 더 나아갑니다. 그리고 사람들이 저희에게 끊임없이 묻는 질문, 즉 강조된 문장을 고쳤는데 왜 점수가 움직이지 않았는지에 답합니다:

Some sentences in an otherwise AI or human document might not show up as highlighted. They may still have an effect on your score, but they aren't more likely than other parts of your document. (전반적으로 AI로 쓰였거나 사람이 쓴 문서에서 어떤 문장은 강조 표시되지 않을 수 있습니다. 그 문장들이 점수에 영향을 주고 있을 수도 있지만, 문서의 다른 부분보다 가능성이 높은 것은 아닙니다.)

그리고 이유를 붙인 문장이 이어집니다: "You may find that adjusting an entire document changes your score more than just adjusting the sentences. This is because our detector holistically analyzes the document, and its prediction can depend on a pattern that affects the bulk of the text." (문장만 조정하는 것보다 문서 전체를 조정하는 편이 점수를 더 크게 바꾼다는 것을 아시게 될 겁니다. 저희 탐지기는 문서를 전체적으로 분석하기 때문에, 그 판단이 텍스트 대부분에 영향을 주는 하나의 패턴에 좌우될 수 있습니다.)

이는 업체가 스스로, 강조 표시가 그 숫자를 만들어낸 것들의 완전한 지도가 아니라고 말한 셈입니다. AI 탐지기가 실제로 측정하는 것에서는 이 점수들이 어떻게 만들어지는지, 그리고 널리 퍼진 설명이 왜 이미 낡았는지를 다룹니다. 여기서의 실질적인 요점은 더 좁습니다. 강조된 문장을 손봐야 할 목록 전체로 받아들인다면, 업체 자신의 설명에 따르면 여러분은 부분적인 지도를 놓고 작업하는 셈입니다.

같은 텍스트, 같은 도구, 다른 답

판독을 움직이는 것은 길이만이 아닙니다. Copyleaks는 기관이 세 가지 민감도 설정 가운데 하나를 고르게 하고, 각 설정이 자기 오류율에 무엇을 하는지도 공개합니다:

설정Copyleaks가 설명하는 방식오탐미탐
Extra Safe"Designed to minimize false positives by using additional AI detection based filters." (추가 AI 탐지 기반 필터를 사용해 오탐을 최소화하도록 설계되었습니다.)0.010%0.5765%
Balanced (기본값)"Ideal for detecting AI content while minimizing false positives." (오탐을 최소화하면서 AI 콘텐츠를 탐지하는 데 알맞습니다.)0.0295%0.174%
Extra Sensitive"Our most sensitive model, designed to flag AI text that was put through a 'humanizer' or text spinner." (가장 민감한 모델로, 'humanizer'나 문장 변환기를 거친 AI 텍스트를 표시하도록 설계되었습니다.)0.1973%0.063%

첫 행과 마지막 행을 함께 보십시오. 가장 보수적인 설정에서 가장 민감한 설정으로 옮기면 공개된 오탐율이 약 스무 배로 커집니다. 그리고 그것은 다른 사람 화면에 있는 스위치입니다. 여러분은 그것이 어느 위치에 있는지 볼 수 없고, 여러분이 건네받는 보고서 어디에도 적혀 있지 않습니다.

그러니 여러분이 직접 확인한 결과와 학교 쪽 결과가 어긋날 때, "둘 가운데 하나가 고장났다"는 결론에 이르기 전에 최소 세 가지 평범한 설명이 있습니다. 도구가 다르다, 같은 도구에서 설정이 다르다, 텍스트 분량이 다르다입니다. AI 탐지기 두 개가 서로 다른 점수를 내는 이유에서 나머지를 다룹니다.

실제로 반영되는 판독은 파일 전체에 대해 이루어집니다

집에서 무엇을 돌리든, 결과를 낳는 숫자는 여러분 학교의 도구가 여러분이 제출한 파일에 대해 그 도구의 설정대로 만들어냅니다. 산문이 300단어 미만인 제출물에는 Turnitin이 AI 점수를 아예 내지 않습니다. 그리고 그 선 바로 위쪽 문서에 대해서는 자기 예측을 전부 아니면 전부에 가깝다고 표현합니다. 그것이 짧은 과제에 어떤 일을 하는지는 그 자체로 하나의 주제입니다.

Turnitin의 newer Clarity 과제도 같은 취지로 작업 구간을 공개합니다: "For Turnitin Clarity to work optimally, we recommend a minimum word count of 300 words and a maximum of approximately 2,500 words" (Turnitin Clarity가 최적으로 작동하도록 최소 300단어, 최대 약 2,500단어를 권장합니다). 그리고 AI 작성 탐지가 켜져 있는 경우에는 "submissions must be between 300 and 30,000 words." (제출물은 300단어에서 30,000단어 사이여야 합니다)라고 합니다.

여러분이 스스로 검사를 돌릴 수 있는지조차 학교가 무엇을 열어 두었는지, 그리고 어떤 화면에 닿을 수 있는지에 달려 있습니다. 이는 별개의 질문이고 그에 대한 답도 따로 있습니다: 제출 전에 자기 작업을 확인하는 방법.

그렇다면 무엇을 해야 합니까

  1. 해당 부분이 아니라 문서 전체를 검사하십시오. 이는 모든 업체의 자체 권고와 맞는 단 하나의 변화입니다. 새 도구도, 새 계정도, 새 설정도 없이, 같은 검사를 더 많은 텍스트에 대해 하는 것뿐입니다. 길이로 요금을 매기는 도구에서는 비용이 더 듭니다. Winston의 API 문서는 "Each word that is processed by the API consumes one credit" (API가 처리하는 단어 하나마다 크레딧 하나가 소모됩니다)라고 적고 있습니다. 그래도 그것은 업체들 페이지가 직접 취하라고 말하는 판독입니다.
  2. 같은 것끼리 비교하십시오. 전후 비교는 도구, 설정, 텍스트 분량이 양쪽에서 모두 같을 때만 뜻이 있습니다. 두 판독 사이에 표본 크기를 바꾸면, 그것만으로 판독이 달라집니다.
  3. 텍스트를 건드리지 않아도 숫자가 움직일 수 있다고 예상하십시오. 모델은 버전이 다시 매겨집니다. Winston의 API 문서에는 선택 가능한 버전이 스물두 개 나열되어 있고, 2.0부터 4.18까지이며, 기본값은 가장 최신입니다. 세 주 전의 점수와 오늘의 점수는 같은 모델에서 나온 것이 아닐 수 있습니다.
  4. 스스로 확인한 숫자를 어느 방향으로든 판결로 받아들이지 마십시오. 집에서 나온 낮은 수치는 통과가 아닙니다. 학교 도구는 다른 도구이기 때문입니다. 60단어 발췌문에서 나온 높은 수치도 결론이 아닙니다. 60단어는 위의 일곱 하한 가운데 하나는 넘지만 나머지는 하나도 넘지 못합니다.
  5. 실제로 건네받은 보고서를 보관하십시오. 이미 표시가 난 상황이라면 중요한 문서는 학교가 발급한 것이지, 여러분이 사후에 만들어 낸 판독이 아닙니다. 다시 쓴 뒤에 재검사하기에서 그 비교가 보여 줄 수 있는 것과 없는 것을 다룹니다.

자주 묻는 질문

탐지기가 신뢰할 수 있게 되는 단어 수가 있습니까? 이 업체들 가운데 어느 곳도 자기 출력이 확정적으로 되는 지점을 주장하지 않습니다. 이들이 공개하는 것은 그 아래에서는 신뢰할 수 없다고 자기들이 말하는 하한과, 하나의 방향, 즉 길수록 더 안정적이라는 것입니다. Copyleaks는 "the accuracy of our detection increases as the text length increases" (텍스트 길이가 길어질수록 저희 탐지 정확도가 높아집니다)라고 적고 있고, ZeroGPT의 표현은 더 긴 텍스트가 "improves stability" (안정성을 높입니다)라는 것입니다.

150단어 단락이 80%로 나왔습니다. 그중 80%가 AI라는 뜻입니까? 아닙니다. 이 혼동은 짚어 둘 만합니다. 이 점수의 이름이 붙는 방식 자체에 그 혼동이 들어 있기 때문입니다. Originality.ai의 도움말 센터는 분명하게 적습니다: "an AI score of 90% doesn't mean that AI produced 90% of the content. It means that our tool is 90% confident that AI was used in some part to produce the content" (90%라는 AI 점수는 AI가 콘텐츠의 90%를 만들어냈다는 뜻이 아닙니다. 그것은 AI가 그 콘텐츠의 어느 부분인가를 만드는 데 쓰였다고 저희 도구가 90% 확신한다는 뜻입니다). 확신의 수치와 문서에서 차지하는 비율의 수치는 화면에서 똑같아 보이지만 뜻은 다릅니다. Turnitin의 백분율은 또 하나의 세 번째 변형입니다. 분석 대상 텍스트에서 차지하는 몫입니다.

단락 몇 개를 합쳐서 하한을 넘기기만 하면 됩니까? ZeroGPT가 바로 그것을 권합니다: "consider merging sections before checking." (검사하기 전에 여러 부분을 합치는 것을 고려해 보십시오.) 그러면 길이 기준은 넘지만, 그 판독이 설명하는 것은 합쳐진 덩어리이지 여러분이 걱정하던 그 단락이 아닙니다. 여러분의 질문이 한 부분에 관한 것이라면, 텍스트를 어떤 식으로 배치해도 깔끔한 답이 나오지 않습니다. 만족스러운 답은 아니지만 솔직한 답입니다.

이 하한들이 학교의 Turnitin 보고서에도 적용됩니까? 위의 하한들은 각 업체 자기 탐지기의 것입니다. Turnitin에는 자기 기준이 따로 있습니다. 산문이 300단어 미만이면 점수가 나오지 않고, 백분율에 반영되는 것도 산문 문장뿐입니다. 목록, 표, 글머리 기호는 측정 대상에서 제외됩니다. 그래서 강조 표시와 숫자가 서로 어긋나 보일 수 있습니다.

출처

계속 읽기