Pangram과 Turnitin: 두 AI 점수가 맞지 않는 이유

저널, 학교 또는 출판 플랫폼이 귀하의 텍스트를 Pangram에 돌렸고, Turnitin 수치도 함께 있습니다. 두 결과는 일치하지 않습니다. 이유는 "모델이 다르다"는 말보다 훨씬 구체적입니다. 두 업체는 같은 종류의 지표를 제시하지도 않고, 그 아래에서는 서로 다른 코퍼스에서 서로 다른 단위를 셉니다. 여기서는 각 업체가 공개한 내용과, 끝내 맞지 않을 두 숫자를 두고 무엇을 할 수 있는지 정리합니다.

HumanPen 팀

· 19분

짧은 답

Pangram 결과와 Turnitin 결과는 같은 양에 대한 두 번의 측정이 아닙니다. 따라서 둘 사이에 차이가 있는 것은 당연하며, 어느 한쪽이 고장났다는 증거가 아닙니다. Turnitin의 2024년 8월 백서는 자사가 "accuracy"(정확도)를 지표로 사용하지 않는다고 밝힙니다. 2026년 9월 15일에 확인한 Pangram 홈페이지에는 "99.9%+ Accuracy"(정확도 99.9% 이상) 배지가 걸려 있습니다. 표제 아래에서도 두 업체는 다시 갈라집니다. Turnitin FAQ는 겹치는 세그먼트 안에서 채점되는 문장과 적격 산문에 대한 백분율을 설명하고, Pangram의 모델 카드는 세 개의 라벨을 쓰는 토큰 수준 예측과 문자 가중치를 적용한 문서 비율을 설명합니다. 결과를 좌우하는 숫자는 귀하의 기관이 판단에 사용하는 도구가 만들어낸 것입니다.

두 업체는 어떤 지표를 공개할지에 대해서도 의견이 다릅니다

2024년 8월자 Turnitin 백서 Turnitin's AI Writing Detection Model Architecture and Testing Protocol은 이렇게 말합니다:

"Turnitin does not use 'accuracy' as a metric as it is too easily manipulated and too dependent on the specific dataset upon which it is computed." (Turnitin은 "accuracy"를 지표로 사용하지 않습니다. 그 값은 너무 쉽게 조작되고, 계산 대상이 되는 특정 데이터세트에 지나치게 의존하기 때문입니다.)

다음 문장이 그 이유를 밝히며, 계산은 직접 확인하실 수 있습니다:

"For example, consider a dataset with 100 pieces of writing, 99 of which are human written. A simple, naive algorithm that identifies all pieces of writing as 'human-written' would achieve 99% accuracy on this dataset, despite having no value as an AI writing detection system." (예를 들어 100편의 글로 이루어진 데이터세트를 생각해 보십시오. 그중 99편은 사람이 쓴 글입니다. 모든 글을 "사람이 쓴 글"로 판정하는 단순하고 순진한 알고리즘은 AI 작성 탐지 시스템으로서 아무런 가치가 없음에도 이 데이터세트에서 99%의 정확도를 달성합니다.)

이 예가 여기서 가져갈 만한 부분입니다. 아무것도 표시하지 않는 탐지기도 그 100편 중 99편은 맞히므로, 그 수치는 탐지기의 성능이 아니라 테스트 세트의 구성에 따라 움직입니다. 백서는 Turnitin이 "uses two main metrics to test AIW-2: recall and FPR"(AIW-2를 시험하기 위해 두 가지 주요 지표인 재현율과 FPR을 사용한다)고 밝히며, 같은 절에서 두 지표를 예시와 함께 정의합니다.

Pangram은 정확도 수치를 눈에 띄게 공개합니다. 홈페이지 배지에는 "99.9%+ Accuracy"(정확도 99.9% 이상, 2026년 9월 15일 확인)라고 적혀 있습니다. 고등교육 페이지에는 두 수치가 함께 실려 있습니다. 첫 문장의 "99.98% accuracy"(정확도 99.98%)와, 같은 배너에서 52자 뒤에 놓인 "99.9%+ Accuracy"(정확도 99.9% 이상) 배지이며, 그 사이에는 "Detects AI Assistance Free Credits"(AI 지원 탐지, 무료 크레딧)만 있습니다. 반면 2026년 7월 29일자 Pangram 4 모델 카드는 정확도를 전혀 내세우지 않습니다. 대신 코퍼스, 언어, 도메인별로 나눈 거짓 양성률과 거짓 음성률을 제시합니다.

따라서 두 회사의 대표 수치는 같은 속성에 대한 높은 값과 낮은 값이 아닙니다. 한 업체가 다른 업체가 앞세우는 지표에 대해 서면으로 이의를 제기한 것입니다. 저희는 두 결정 중 어느 것이 틀렸다고 말하는 것이 아니며, 둘 다 비밀도 아닙니다. 두 진술은 오늘도 공개 페이지에 있습니다.

두 점수가 실제로 무엇을 세는가

두 시스템 모두 백분율을 반환합니다. 그 백분율은 서로 다른 원자료에서 만들어집니다.

Turnitin (FAQ 및 2024년 8월 백서)Pangram (Pangram 4 모델 카드, 2026년 7월 29일)
분류 단위문장. 겹치는 세그먼트로 묶입니다토큰. 가변 길이 세그먼트로 디코딩됩니다
겹침 처리여러 세그먼트에 걸친 문장은 여러 점수를 받으며, "which are then pooled into a single score"(이 점수들은 이후 하나의 점수로 합산됩니다)"predictions for tokens that appear in multiple windows are aligned and averaged"(여러 윈도우에 나타나는 토큰에 대한 예측은 정렬되어 평균됩니다). 512토큰 추론 윈도우 안에서입니다
문서 백분율은 무엇에 대한 비율인가적격 텍스트만. "this percentage is not necessarily the percentage of the entire submission"(이 백분율이 반드시 제출물 전체에 대한 백분율인 것은 아닙니다)분석된 문서. `fraction_human`, `fraction_ai_assisted`, `fraction_ai`는 "character-weighted"(문자 가중치를 적용한)이며 "sum to 1.0"(합이 1.0이 됩니다)
클래스 수둘. 이 백분율은 "likely generated by AI or likely generated and modified by an AI paraphraser or bypasser"(AI가 생성했거나, AI가 생성한 뒤 AI 패러프레이저나 우회 도구로 수정했을 가능성이 높은) 텍스트를 포괄합니다셋: `Human`(사람), `AI-Assisted`(AI 지원), `AI-Generated`(AI 생성)
최소 길이산문 300단어50단어
낮은 결과1%에서 19% 사이는 백분율과 강조 표시 없이 별표만 표시됩니다`prediction_short` returns `Human` when human characters account for at least 90%, `AI` when AI-generated characters account for at least 80%, `Mixed` otherwise (사람 문자가 90% 이상을 차지하면 축약형 "사람"을, AI가 생성한 문자가 80% 이상을 차지하면 "AI"를, 그 밖의 경우에는 "혼합"을 반환합니다)

문제가 되는 것은 분모 행입니다. Turnitin FAQ는 표시되는 백분율이 "the amount of qualifying text within the submission"(제출물 내 적격 텍스트의 양)을 대상으로 하며, "If text within the submission is not considered long-form prose text, it will not be included."(제출물 내 텍스트가 장문 산문으로 간주되지 않으면 포함되지 않습니다.)라고 말합니다. Pangram의 비율은 분석된 텍스트를 대상으로 하며 합이 1.0이 됩니다. 긴 참고문헌 목록과 목차, 표 몇 개가 들어 있는 논문을 두 시스템에 넣으면, 어느 모델이 실행되기도 전에 두 시스템은 같은 단어 묶음을 대상으로 작업하지 않게 됩니다. Turnitin AI 작성 보고서 읽는 법은 Turnitin의 분모에 무엇이 들어가고 무엇이 빠지는지 짚어 줍니다.

왜 1%와 1 in 10,000은 같은 척도가 아닌가

이 두 수치는 사람들이 나란히 놓고 보는 값이며, 하나를 다른 하나로 나누면 아무런 의미 없는 비율이 나옵니다. 둘 다 거짓 양성률이라는 이름을 씁니다. 그러나 어느 쪽도 다른 쪽과 같은 방식으로 측정되지 않았습니다.

Turnitin FAQ는 목표치를 제시합니다:

"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (우리는 AI 작성 비중이 20%를 넘는 문서에서, 사람이 온전히 쓴 텍스트를 AI 생성으로 잘못 판정하는 비율인 거짓 양성률을 1% 미만으로 유지하면서 탐지기의 효과를 극대화하려 노력합니다.)

이 끝에 붙은 조건이 이 주장을 떠받치며, 백서는 그 출처를 설명합니다. 문서의 문장 수준 점수 가운데 20%를 넘는 부분이 문장 임계값을 넘으면 그 문서는 AI 생성으로 분류됩니다. 그리고 백서는 "the 20% document proportion cutoff as well as the predetermined model threshold were chosen to keep document-level FPR below 0.01 (1%)."(문서 비율 20% 기준점과 사전에 정해진 모델 임계값은 문서 수준 거짓 양성률을 0.01(1%) 미만으로 유지하기 위해 선택되었습니다.)라고 말합니다. 기준점과 비율은 하나의 장치를 이루는 부분이지, 그 장치에 대한 독립적인 주장이 아닙니다. 대학이 논문 75,000편을 제출할 때 1% 거짓 양성률이 의미하는 것이 그 곱셈을 대신 해 줍니다.

Pangram 홈페이지 FAQ는 다음 비율을 제시합니다:

"Pangram's false positive rate (the rate at which human documents are incorrectly flagged as AI) is currently 1 in 10,000. This number is calculated on an aggregate of public datasets containing tens of millions of written documents." (Pangram의 거짓 양성률, 즉 사람이 쓴 문서가 AI로 잘못 표시되는 비율은 현재 1 in 10,000입니다. 이 수치는 수천만 건의 작성 문서를 담은 공개 데이터세트의 집합을 대상으로 계산되었습니다.)

모델 카드는 코퍼스를 밝히며 더 좁은 수치를 제시합니다. "At the production operating point, Pangram 4 achieves a 0.0041% false positive rate (roughly 1 in 24,000) on 1,000,000 human-written English FineWeb evaluation examples." (운영 환경의 기준점에서 Pangram 4는 사람이 쓴 영어 FineWeb 평가 예시 1,000,000건에 대해 0.0041%의 거짓 양성률(대략 1 in 24,000)을 달성합니다.) 카드의 두 번째 표는 이 비율을 도메인별로 나누며, 학술 작성 행은 62,971건에 대해 0.019%로, 바로 위의 영어 전체 수치보다 높습니다.

표시 규칙이 다르고 운영 지점이 다르며, Turnitin 쪽에는 20% 기준점을 넘을 때만 적용되는 비율이 있습니다. 그래서 두 숫자의 산술적 비교를 저희가 대신 만들어 드리지는 않겠습니다. 대신 각각이 무엇을 대상으로 측정되었는지 물으실 수 있고, 두 업체는 그 질문에 서면으로 답합니다. Turnitin FAQ는 자사의 비율을 "over 700,000 additional academic papers that were written before the release of ChatGPT"(ChatGPT 출시 이전에 작성된 700,000편 이상의 추가 학술 논문)을 대상으로 검증한다고 말합니다. Pangram 홈페이지는 자사의 비율을 "an aggregate of public datasets"(공개 데이터세트의 집합)에, 모델 카드는 더 좁은 수치를 FineWeb 예시에 귀속시키며, 학술 작성은 열한 개의 도메인 행 가운데 하나로 따로 나타납니다. 서로 다른 질문에 대한 답이며, 그것이 문제의 전부입니다.

백분율은 비율일 수도, 확신일 수도 있습니다

두 보고서가 모두 "99%"를 표시하면서 서로 다른 뜻일 수 있으며, 두 업체 모두 자사 문서에서 그렇게 밝힙니다.

Pangram의 모델 카드는 문서 수치를 비율로 다룹니다. 세 비율은 문자 가중치를 적용한 텍스트의 부분이며 합이 1.0입니다. 또한 다른 수치들이 겉보기와 다르다는 점도 명시합니다. ai_assistance_score는 "a continuous AI-involvement score, not the probability of the displayed discrete label"(연속적인 AI 관여 점수이며, 표시되는 이산 라벨의 확률이 아닙니다)이고, 세그먼트 신뢰도 값은 "measures the peakedness of the unconstrained CRF posterior, it is not a calibrated probability estimate."(제약 없는 CRF 사후분포의 뾰족함을 측정하며, 보정된 확률 추정값이 아닙니다). 있는 그대로 읽으면 High로 표시된 세그먼트는 모형의 내부 점수가 하나의 라벨 주위에 촘촘히 몰린 세그먼트이며, 업체는 그것을 승산으로 환산하지 말라고 말하고 있습니다.

Pangram의 교사용 안내 페이지는 백분율을 반대 방향으로 읽습니다:

"If a segment of text gets a 99% AI score, that doesn't mean we necessarily think the entire text was AI-generated. Rather, we are 99% confident that AI was used to generate some portion of the text." (텍스트의 한 세그먼트가 99% AI 점수를 받았다고 해서, 저희가 반드시 텍스트 전체가 AI 생성이라고 생각한다는 뜻은 아닙니다. 오히려 저희는 AI가 텍스트의 일부를 생성하는 데 사용되었다고 99% 확신합니다.)

Turnitin FAQ도 비율로 읽는 방식에 대해 경고합니다. "Unlike our Similarity Report, the AI writing percentage does not necessarily correlate to the amount of text in the submission." (당사의 Similarity Report와 달리, AI 작성 백분율은 제출물 내 텍스트의 양과 반드시 상관관계가 있는 것은 아닙니다.)

두 백분율을 비교하기 전에, 각각이 무엇에 대한 백분율인지부터 확인하십시오. 하나는 문자에 대한 비율이고 다른 하나는 확신 수준이라면, 두 값은 애초에 일치할 수 없었으며 어느 쪽도 거짓말을 한 것이 아닙니다. 같은 텍스트가 탐지기마다 다르게 나오는 이유에 나머지 이유가 정리되어 있습니다.

같은 라벨이 서로 다른 분모의 숫자에 붙어 있습니다

거짓 양성률은 그것이 계산된 문서 집합과 함께일 때만 의미가 있습니다. 두 업체는 하나의 라벨 아래 여러 숫자를 공개하고 있으며, 그중 한 쌍은 끝까지 짚어 볼 만합니다. 그 차이를 설명하는 듯한 쉬운 설명이 오히려 틀린 것으로 밝혀지기 때문입니다.

먼저 Pangram이며, 모두 2026년 9월 15일에 확인했습니다. 오른쪽 열도 왼쪽 열만큼 주의 깊게 읽으십시오. 그 격차의 일부는 어느 페이지에 들어갔느냐에서, 다른 일부는 각 수치가 무엇을 대상으로 측정되었느냐에서 비롯됩니다.

수치표시 위치
"99.9%+ Accuracy" (정확도 99.9% 이상)홈페이지 배지, 그리고 고등교육 페이지 배너 안의 배지
"99.98% accuracy" (정확도 99.98%)같은 배너의 첫 문장, 52자 앞
"99.26% overall" (전체 99.26%)Pangram vs. Turnitin, 2026년 7월 28일자 게시물
정확도 수치 없음Pangram 4 모델 카드(2026년 7월 29일자). 대신 코퍼스별 FPR과 FNR을 제시합니다
"1 in 10,000" (1만 건 중 1건)홈페이지 FAQ, "an aggregate of public datasets"(공개 데이터세트의 집합)에 대한 값
"roughly 1 in 24,000" (대략 2만 4,000건 중 1건)모델 카드, FineWeb 영어 예시 1,000,000건에 대한 값
학술 에세이의 경우 "approximately 1 in 25,000" (대략 2만 5,000건 중 1건)2026년 7월 28일 게시물
"Academic Writing (English)"(학술 작성, 영어)에 대해 0.019%모델 카드, 62,971건에 대한 값으로 자사 전체 수치보다 높음

Turnitin은 이 가운데 가장 가벼운 사례를 하나의 파일 안에서 만들어 냅니다. 2024년 8월 백서는 AIW-2의 문서 수준 거짓 양성률을 본문에서는 0.5%, 표 1에서는 0.51%로 제시합니다. 둘 다 2019년 이전에 제출된 학생 논문 719,877편이라는 동일한 집합에 대한 값입니다.

더 중요한 쌍은 Turnitin이 문장 수준 거짓 양성률이라는 같은 이름으로 공개한 두 수치입니다. 2023년 6월, 최고제품책임자(Chief Product Officer)는 이렇게 썼습니다:

"Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." (당사의 문장 수준 거짓 양성률은 약 4%입니다. 즉 AI가 쓴 것으로 표시된 특정 문장이 사람이 쓴 것일 가능성이 4%라는 뜻입니다.)

2024년 8월 백서는 2019년 이전에 제출된 논문에 대한 스트레스 테스트에서 0.33%라는 값을 제시하며, 그 논문들에 대해 "All papers in this dataset are human written."(이 데이터세트의 모든 논문은 사람이 쓴 것입니다.)라고 말합니다.

그 사이에 모델이 바뀌었다고 읽고 싶어집니다. 실제로 바뀌었고, 그래도 이 차이는 설명되지 않습니다. 백서는 AIW-1이 2023년 4월에 출시되었고 "In December 2023, Turnitin launched AIW-2, an updated and improved model to replace the AIW-1 model"(2023년 12월, Turnitin은 AIW-1 모델을 대체할 업데이트되고 개선된 모델인 AIW-2를 출시했습니다)고 밝히므로, 2023년 6월에 돌고 있던 모델은 AIW-1이었습니다. 이제 백서 자체의 표 2에서 AIW-1을 찾아 보십시오. 동일한 719,877편 집합에서 그 문장 수준 거짓 양성률은 0.42%이며, 4%가 아닙니다. 같은 모델, 같은 라벨, 한 자릿수 차이가 나는 두 숫자입니다. 버전 이야기는 무너집니다.

다른 것은 각 백분율이 어떤 집합에 대해 계산되었는가입니다. 4%는 이미 표시된 문장에 조건이 걸린 값입니다. 탐지기가 표시한 문장들 가운데 그 비율이 실제로 사람의 글일 수 있다는 뜻입니다. 0.42%와 0.33%는 처음부터 전적으로 사람이 쓴 글에 대한 값입니다. 그 모든 문장 가운데 그 비율이 표시되었다는 뜻입니다. 두 값은 서로 다른 질문에 답하며, 서로 가까운 값이 될 이유도 없습니다. 4%의 정의는 Turnitin의 2023년 6월 설명에서 확인하실 수 있습니다.

이것은 업체의 잘못이 드러난 일도, 숫자가 낡아진 일도 아닙니다. 하나의 표현이 서로 다른 여러 측정에 붙었을 때 생기는 일입니다. 그러므로 회의에서 어떤 비율을 들이밀 때, 답을 얻게 되는 질문은 그것이 어떤 집합에 대한 값인가입니다. 제출된 모든 문서입니까? 이미 표시된 문장만입니까? 적격 산문만입니까? 집합이 붙지 않은 백분율은 확인할 수도, 반박할 수도 없습니다.

독립적인 검증이 무엇이 있고, 무엇이 결론을 내지 못하는가

동료 심사를 거친 오픈 액세스 연구 가운데 하나만이 두 도구를 직접 비교했습니다. Who wrote this? Evaluating the reliability of AI detection tools in higher education(『이것을 누가 썼는가? 고등교육에서 AI 탐지 도구의 신뢰성 평가』)는 2026년 6월 29일 International Journal for Educational Integrity에 실렸으며, 영어 학술 논문 160편으로 이루어진 합성 세트를 만들었습니다. 네 범주에 각각 마흔 편씩, 모두 4,000단어 이상이었습니다.

사람이 쓴 집합에 대해서는 결과가 시험한 네 도구 모두에 적용됩니다. "all four tools classified 100% of human texts correctly as 'True Negatives' (receiving a score between 0 and 20%). This indicates that none of the detectors are prone to incorrectly flagging human writing as AI-generated for this collection of papers." (네 도구 모두 사람이 쓴 텍스트의 100%를 0에서 20% 사이의 점수를 받은 "참 음성"으로 정확히 분류했습니다. 이는 이 논문 묶음에서 어떤 탐지기도 사람의 글을 AI 생성으로 잘못 표시하는 경향이 없음을 보여 줍니다.) 완전히 AI가 생성한 집합에서는 두 도구가 갈라졌습니다. 논문은 "Turnitin classified 100% of the Fully AI generated papers as False Negatives (scores between 0 and 20%)"(Turnitin은 완전히 AI가 생성한 논문의 100%를 거짓 음성, 즉 0에서 20% 사이의 점수로 분류했습니다), 그리고 "Pangram was the only tool that performed well, with a strict accuracy of 65% and an inclusive accuracy of 97.5%, leaving only one case misclassified."(Pangram만이 엄격한 정확도 65%, 포괄적 정확도 97.5%로 좋은 성능을 보였으며, 오분류는 한 건뿐이었습니다)라고 보고합니다.

누가 어느 방향으로든 이것을 인용하기 전에, 저자들이 스스로 한계를 밝힙니다. "the scope of our research was limited to 160 papers, four AI detection tools, and one GenAI model (GPT-4o Deep Research) for the fully AI-generated category"(저희 연구의 범위는 논문 160편, AI 탐지 도구 네 개, 그리고 완전히 AI가 생성한 범주에 사용한 생성형 AI 모델 하나(GPT-4o Deep Research)로 제한되었습니다), 그리고 결과는 "valid only for a specific snapshot in time"(특정 시점의 스냅샷에만 유효합니다)입니다. 기관에 대한 저자들의 권고가 회의에 가져갈 만한 문장입니다. 탐지 도구는 "should not be used as sole evidence in high-stakes decision-making but should be implemented in a broader evaluation strategy."(중대한 의사결정에서 유일한 증거로 사용되어서는 안 되며, 더 넓은 평가 전략 안에 포함되어야 합니다).

표현에 관한 메모 하나. 편집된 판이 원문보다 더 널리 퍼지기 때문입니다. 논문의 결론 문장은 "From the four AI detection tools studied here, at this moment only one produced satisfactory results."(여기서 연구한 네 개의 AI 탐지 도구 가운데 이 시점에서 만족스러운 결과를 낸 것은 하나뿐이었습니다.)입니다. Pangram 자체의 연구 요약은 이를 "only [Pangram] produced satisfactory results"(오직 [Pangram]만이 만족스러운 결과를 냈다)로 바꾸어 적으며, 대괄호로 치환했음을 밝힙니다.

이 비교에서 인용되는 연구가 두 가지 더 있으며, 둘 다 단서가 필요합니다. 2025년 10월 6일자 시카고 대학교 Becker Friedman Institute의 연구 브리프는 "Among commercial options, Pangram achieves essentially zero false positive rates and false negative rates on medium-length to long passages"(상용 도구 가운데 Pangram은 중간 길이에서 긴 길이의 부분에서 거의 0에 가까운 거짓 양성률과 거짓 음성률을 달성합니다)라고 말합니다. 이 연구는 Turnitin을 시험하지 않았습니다. 네 도구는 Pangram, Originality.ai, GPTZero 그리고 RoBERTa 기준선이었습니다. 코퍼스는 뉴스, 블로그, 소비자 리뷰, 이력서 등 여섯 개의 일상 장르에 걸친 1,992개의 부분이었으며, 학생 과제물이 아니었습니다. 아울러 양쪽을 모두 밝힐 만한 연결고리도 있습니다. 두 저자 중 한 사람인 Alex Imas는 Pangram 홈페이지의 서명된 추천사에 등장합니다. 한편 워킹 페이퍼는 첫 페이지에 "All authors declare that they have no financial or personal conflicts of interest related to this study."(모든 저자는 이 연구와 관련한 재정적·개인적 이해충돌이 없음을 밝힙니다.)라는 문장을 싣고 있습니다. 그 논문은 연구소에서 무료로 내려받을 수 있으며, 브리프에서 두 번의 클릭 거리에 있습니다. 어떻게 평가할지는 각자의 판단입니다. 저희는 두 사실 가운데 어느 하나가 아니라 모두를 보셨으면 합니다.

두 번째는 2026년 7월 TechCrunch 기자의 실사용 테스트로, 하나의 글에서 두 개의 숫자를 얻었습니다. "Pangram gave it a 13% AI assisted score"(Pangram은 그것에 13%의 AI 지원 점수를 주었다), 그리고 "when I gave Pangram that same article in its entirety, as I had written it, it got a 100% human score."(내가 쓴 그대로 그 글 전체를 Pangram에 넘겼을 때는 100% 사람 점수를 받았다). 한 기자가 한 번 시험한 기록은 벤치마크가 아닙니다. 그것은 텍스트를 제출하는 방식이 돌아오는 숫자를 바꾼다는 사실에 대한 1차 기록이며, 두 기관이 서로 다른 두 파일을 돌릴 때 귀하가 놓이는 위치가 바로 그것입니다.

그리고 둘을 전혀 비교할 수 없는 경우가 있습니다. 숫자를 돌려주는 쪽이 한쪽뿐이기 때문입니다. 같은 동료 심사 논문은 주 도표 아래에 "Turnitin regards papers with an AI score between 0% and 20% as uncertain and marks them with an asterisk instead of a numerical score"(Turnitin은 AI 점수가 0%에서 20% 사이인 논문을 불확실한 것으로 보고 수치 점수 대신 별표로 표시한다)고 적고, 그 결과 "19 Fully AI-generated papers, 7 Hybrid, 6 Humanised, and 3 Fully Human papers were coded as missing in the figure."(완전히 AI가 생성한 논문 19편, 혼합형 7편, 다듬어진 글 6편, 완전히 사람이 쓴 논문 3편이 도표에서 결측으로 코딩되었습니다)고 밝힙니다. 160편 중 35편에는 무엇과 견줄 Turnitin 수치가 아예 없습니다. 귀하의 Turnitin 결과가 별표라면, 낮은 점수를 방어하고 있는 것이 아니라 점수 자체가 없는 것이며, Turnitin AI 점수에서 별표(*%)가 의미하는 것이 그 배후의 표시 규칙을 설명합니다.

두 결과가 일치하지 않을 때 할 수 있는 일

먼저 보고서를 확보하는 것부터 시작하십시오. 양쪽 모두 그것을 실행한 사람에게 의존하고 있기 때문입니다. Turnitin FAQ는 "The AI writing detection indicator and report are not visible to students. However, with the PDF download feature, instructors can download and share the AI report with students."(AI 작성 탐지 표시와 보고서는 학생에게 보이지 않습니다. 다만 PDF 내려받기 기능을 통해 교수자는 AI 보고서를 내려받아 학생과 공유할 수 있습니다.)라고 말합니다. Pangram 헬프 센터는 결과를 링크로 공유할 수 있으며 받는 사람이 "will see the scan overview and segment details without having to create a Pangram account."(Pangram 계정을 만들지 않고도 검사 개요와 세그먼트 상세 정보를 볼 수 있습니다)라고 합니다. 둘 다 요청하시고, Pangram 쪽에서는 스크린샷이 아니라 공유 링크를 구체적으로 요청하십시오. 세그먼트 보기는 어떤 부분이 그 수치를 만들었는지 보여 주지만, 백분율 스크린샷은 작업할 수 있는 아무런 정보를 주지 않습니다.

Pangram에 직접 연락해 기록을 바로잡으려는 계획은 세우지 마십시오. 피드백 기능은 검사를 실행한 계정에 붙어 있습니다. 도움말 페이지는 "Open the result you want to give feedback on, either after scanning it or from the History / All Checks page in your account"(피드백을 남기려는 결과를 검사 직후에 열거나 계정의 History / All Checks 페이지에서 여십시오)라고 안내하며, 결과 아래에 엄지 올림과 엄지 내림이 있습니다. 교수가 실행한 검사는 귀하의 계정에 없습니다.

저희는 결과를 받는 사람을 위한 이의 절차가 공개된 것도 찾지 못했습니다. 2026년 9월 15일에 Pangram 사이트맵에 등록된 URL 256개의 본문을 모두 읽었고, 총 2,117,382자였으며 모든 페이지를 검색했습니다. `appeal`(이의 신청. 여기서는 매력적이라는 뜻)은 한 페이지에 나오며, 광고에 관한 블로그 글입니다. `dispute`(분쟁)는 두 페이지에 나옵니다. 이용약관의 중재 조항과 저작성 분쟁에 관한 파트너십 글입니다. `grievance`(고충), `contest`(이의 제기), `redress`(구제), `ombuds`(옴부즈), `request a review`(검토 요청)는 256개 중 어디에도 나오지 않습니다. 같은 검색에서 `false positive`(거짓 양성)는 그 페이지 중 162개에서, `student`(학생)는 182개에서 발견되었으며, 이것으로 카운터가 조용히 모든 질의에 0을 돌려준 것이 아니라 실제로 일치 항목을 세고 있었다는 것을 아실 수 있습니다.

그 집계에는 한 가지 한계가 있습니다. 틀렸다면 깨뜨릴 수 있어야 할 종류의 주장이기 때문에 밝힙니다. 사이트맵이 사이트 전체는 아닙니다. 이 글이 가장 많이 인용하는 페이지, Pangram 4 모델 카드는 200을 반환하지만 그 사이트맵에는 등록되어 있지 않습니다. 그러므로 결과는 그러한 절차가 없는 256개의 등록 페이지로 읽어 주십시오. Pangram이 호스팅하는 모든 페이지에 대한 진술이 아닙니다. 그리고 양방향으로 읽어 주십시오. Pangram이 수정을 거부한다는 뜻이 아니며, 귀하의 기관에 절차가 없다는 뜻은 더욱 아닙니다. 업체가 그 주소가 아니라는 뜻입니다.

Pangram을 도입한 두 기관이 자체적인 경로를 공개하고 있으며, 알아 둘 만한 것은 바로 그것들입니다. Substack은 필자에게 AI 탐지 보고서에서 "select Report detection error"(Report detection error 선택)를 하라고 안내하고, 초안에 대한 "Disable AI detection"(AI 탐지 사용 중지) 조작도 문서화합니다. 참여자의 Wikipedia 편집을 Pangram에 통과시키는 Wiki Education은 교수자에게 확인된 오류 대부분의 원인을 전합니다. "If a student saves an empty outline (for example, with just short bullet points or empty section headers), or includes a significant amount of non-prose text (like sentence fragments or bibliographic entries) this might trigger the AI detector. Non-prose text is a common factor in most of the confirmed false positives we've seen." (학생이 빈 개요(예를 들어 짧은 불릿 목록이나 빈 섹션 제목만 있는 경우)를 저장하거나, 문장 조각이나 서지 항목처럼 산문이 아닌 텍스트를 상당량 포함하면 AI 탐지기가 작동할 수 있습니다. 산문이 아닌 텍스트는 저희가 확인한 거짓 양성 대부분에서 공통된 요인입니다.) 또한 이 단체는 Pangram을 "not use Pangram as definitive proof that the text was AI generated"(텍스트가 AI 생성이라는 결정적 증거로 사용하지 않고), "a way to flag which text needs additional human scrutiny for verifiability."(검증 가능성을 위해 사람의 추가 검토가 필요한 텍스트를 표시하는 수단)으로 쓴다고 적습니다.

이 산문이 아닌 텍스트 지적은 귀하의 파일로 직접 확인할 수 있으며, Pangram의 모델 카드가 업체 쪽에서 이를 뒷받침합니다. 모델은 "of at least 50 words, written primarily in complete sentences"(최소 50단어 이상이며 주로 완전한 문장으로 쓰인) 글을 대상으로 하고, 카드는 그 범위 밖에 있는 것들을 나열합니다. 그중에는 "tables of contents, reference sections, templated or automated writing, instructions and technical manuals, and text dominated by mathematical notation"(목차, 참고문헌 부분, 템플릿이나 자동 생성 글, 사용 설명서와 기술 매뉴얼, 수식 기호가 지배적인 텍스트)이 포함됩니다. 카드는 또한 "human-written headers, footers, instructions, and other extraneous formatting should be removed before checking a document"(사람이 쓴 머리글, 바닥글, 지시문, 그 밖의 불필요한 서식은 문서를 검사하기 전에 제거해야 합니다)라고 하고, "Raw text and .docx files are recommended over PDFs when available because PDF parsing can introduce unintended artifacts."(이용할 수 있다면 PDF보다 텍스트 원문과 .docx 파일이 권장됩니다. PDF 분석은 의도하지 않은 산물을 만들 수 있기 때문입니다)라고 덧붙입니다. 그러니 검사를 실행한 사람에게 물을 구체적인 질문 두 가지가 있습니다. 그것이 PDF였는지, 그리고 참고문헌 목록과 앞부분이 함께 통과되었는지입니다.

회의에서 인용할 만한 문장이 몇 줄 있습니다. 저희가 아니라 업체에서 나온 것이기 때문입니다. Pangram의 교사 지침은 "we believe that AI detection is a great way to flag assignments, but detection warrants futher investigation before any punitive measures"(AI 탐지는 과제를 표시하는 훌륭한 방법이라고 믿지만, 탐지 결과는 어떤 징계 조치 전에 추가 조사가 필요하다)고 말하고(이 철자는 원문 그대로입니다), "A nonzero false positive rate means that any positive detection could be real, or it could be the statistically anomalous one-in-ten-thousand situation where Pangram gets it wrong."(거짓 양성률이 0이 아니라는 것은 어떤 양성 판정도 실제일 수 있으며, 통계적으로 이례적인 만 분의 일의 경우 Pangram이 틀렸을 수도 있다는 뜻입니다)라고 덧붙입니다. Turnitin FAQ는 "Turnitin does not make a determination of misconduct; rather, it provides data for the educators to make an informed decision based on their academic and institutional policies."(Turnitin은 부정행위를 판정하지 않으며, 교육자가 학술적·기관적 정책에 근거해 정보에 입각한 결정을 내릴 수 있도록 데이터를 제공합니다)라고 말합니다.

Pangram의 교사 페이지는 교수자를 집필 과정의 증거로도 안내하며 Google Docs를 지목합니다. "select File -> Version history -> See version history to see a full history of their writing process." (File -> Version history -> See version history를 선택하면 집필 과정의 전체 기록을 볼 수 있습니다.) 그 기록이 있다면, 대화는 어느 쪽 백분율이 옳은가라는 질문에서 벗어납니다. 그리고 그것이 공개된 숫자로는 해결되지 않는 유일한 질문입니다. Word, Google Docs, Overleaf에서 버전 기록을 보관하는 방법은 각 도구가 기록을 어디에 저장하는지 다루고, AI로 잘못 표시되었을 때: 이의 신청 방법과 대학이 받아들이는 증거는 나머지 절차를 다룹니다.

이것이 귀하에게 의미하는 바

  • 두 업체는 같은 지표를 보고하지 않습니다. Turnitin의 2024년 8월 백서는 정확도를 지표로 쓰지 않는다고 밝힙니다. Pangram은 홈페이지와 고등교육 페이지에서 정확도 수치를 앞세웁니다.
  • 두 백분율은 서로 다른 것을 셉니다. Turnitin의 값은 적격 산문만을 대상으로 하고, Pangram의 비율은 분석된 텍스트에 문자 가중치를 적용하여 합이 1.0이 됩니다. 또한 Turnitin의 1% 미만 목표는 AI 작성 비중이 20%를 넘는 문서라는 조건이 붙어 있으므로, 그것을 Pangram의 1 in 10,000으로 바꿀 수 있는 계산은 존재하지 않습니다.
  • 어떤 버전이 만들었는지가 아니라 어떤 집합에 대한 값인지 물으십시오. Turnitin은 문장 수준 비율을 두 개 공개합니다. 약 4%(2023년 6월)와 0.33%(2024년 8월 백서)입니다. 그 사이에 모델 교체가 실제로 있었습니다. 2023년 12월입니다. 그러나 그것은 이 차이를 설명하지 않습니다. 백서는 구형 모델을 테스트 코퍼스에서 0.42%로 적고 있으며, 4%로 적지 않습니다. 두 값을 가르는 것은 집합입니다. 4%는 이미 표시된 문장만 세고, 0.42%와 0.33%는 전적으로 사람이 쓴 글에 대한 값입니다.
  • 어떤 것과 비교하기 전에 귀하의 숫자가 비율인지 확신인지 먼저 확인하십시오.
  • 별표는 낮은 점수가 아닙니다. 동료 심사 연구에서 160편 중 35편에는 Turnitin 수치가 아예 없었습니다.
  • 이의는 검사를 실행한 사람을 통해 제기하십시오. Pangram의 피드백 기능은 검사를 실행한 계정 안에 있고, 사이트맵에 등록된 256개 페이지 중 어느 곳에도 표시된 사람을 위한 이의 절차는 없습니다. 보고서 자체와, 세그먼트 보기가 포함된 Pangram 공유 링크를 요청하십시오.

Turnitin 또는 iThenticate 보고서가 있다면 보고서를 가져와 표시된 부분을 작업할 수 있습니다. 조건을 충족하는 부분은 무료로 다시 실행할 수 있습니다.

계속 읽기