Turnitin이 제 작업을 100% AI로 플래그하는 이유는 무엇입니까?
Turnitin이 직접 쓴 것에 대해 100% AI라고 말한다면, 점수는 실제이지만 판결은 그 모양이 아닙니다. 짧은 문서, 반복적인 구조, 새로운 아이디어 없는 패러프레이즈는 모두 인간 텍스트를 100%로 밀어냅니다. Turnitin 자체 설명서는 점수는 학생에 대한 불이의적 조치의 유일한 근거로 사용되어서는 안 된다고 말합니다.
HumanPen 팀
· 9분
짧은 답
100% 점수가 Turnitin이 귀하의 텍스트가 AI 생성이라는 것을 확신한다는 의미는 아닙니다. 몇백 단어의 더 짧은 문서에서, 예측은 대체로 “전부 아니면 전부”이며, 시스템이 평균을 낼 수 있는 중첩이 없는 단일 세그먼트를 점수를 메기기 때문입니다. 구조적 변동이 적거나 단어 그대로의 반복, 새로운 아이디어 없는 패러프레이즈의 텍스트는 오판에 더 취약합니다. 그리고 Turnitin 자신은, 세 개의 별도 도움말 문서에서, 점수는 학생에 대한 불이의적 조치의 유일한 근거로 사용되어서는 안 된다고 말합니다.
우리는 분류자와 그 세그먼트 관점에서 Turnitin의 AI 검출이 어떤 원리로 작동하는지를 설명한 적이 있습니다. 이 기사는 그 시스템이 직접 쓰셨음을 알고 있는 텍스트에서 100%를 반환할 때 얼마나 일이 일어남을 수 있는지를 다룹니다. 원인은 잤을듯하지 않고 기계적이며, Turnitin 자체 페이지에 문서화되어 있습니다.
짧은 문서의 문제
이것은 진정한 인간 작성물이 100% 점수를 받는 가장 흔한 이유입니다. Turnitin의 AI writing detection capabilities FAQ에서 짧은 제출물에서 얼마나 일이 일어남는지를 설명합니다:
“In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.” (몇백 단어에 불과한 짧은 문서에서는, 겹칠할 수 있는 계기가 없는 단일 세그먼트에 예측하기 때문에 예측은 대체로 “전부 아니면 전부”가 됩니다.)
다음 문장이 그 그림을 완성하는 것입니다:
“This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.” (이는 AI 생성 콘텐츠와 원본 콘텐츠가 섞인 텍스트가 전적으로 AI 생성 콘텐츠로 플래그 될 수 있음을 의미합니다.)
이 두 문장을 함께 읽으면, 짧은 논문에서의 100% 점수는 판결처럼 보이지 않습니다. 그것은 계기의 해상도와 같이 보입니다. 세그먼트가 하나만 있을 때, 평균을 낼 상대가 없습니다. 높은 확률의 하나의 세그먼트가 문서 전체의 점수가 됩니다. 귀하의 에세이가 300 또는 500 단어라면, 이것이 먼저 확인해봤지 하는 가능성입니다.
Turnitin은 2023년 십이월 릴리즈에서도 “submissions that contain less than 300 words may result in an AI writing score that is likely less accurate.” (300 단어 미만의 제출물은 정확성이 떨어질 가능성이 있는 AI 작성 점수를 생성할 수 있습니다.)라고 지적한 적이 있습니다. 짧은 문서는 점수를 메기기 어려우며, 시스템은 이를 알고 있습니다.
어떤 종류의 텍스트가 오판으로 플래그되는가
같은 FAQ 페이지에서 오판이 더 자주 발생하는 텍스트의 종류을 나열합니다:
“Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.” (때로 오판(인간이 쓴 텍스트를 AI 생성으로 잘못 플래그하는 것)은 구조적 변동이 많지 않은 콘텐츠, 글자그대로 자기자신을 반복하는 텍스트 또는 새로운 아이디어를 도출하지 않고 패러프레이즈된 텍스트를 포함할 수 있습니다.)
다음 문장은 목록 자체와 매우 중요합니다:
“If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.” (지시자가 그런 텍스트에서 더 많은 AI 작성을 보여주고8 경우, 표시된 백분율을 보기 때 그것을 고려하시라고 권장합니다.)
이것은 교육자에게 이 종류의 텍스트에 대한 퍼센트지를 할인하라고 알려주는 Turnitin의 말입니다. 귀하의 작성이 구조적으로 균일하다면 (비슷한 길이의 단락, 비슷한 문장 형식, 반복되는 어휘), 또는 자기 분석을 추가하지 않고 출처 자료를 가까이 패러프레이즈했다면, 모든 단어가 귀하의 것이어도 점수는 올라갈 수 있습니다.
이것은 기술적 결함이 아닙니다. 분류자가 균일성을 신호로 읽어내는 것입니다. 규칙적으로 보이는 통계적 패턴은, 텍스트가 일정한 레지스터로 쓴 인간에 의해 생성되었을 때에도, 모델이 AI 텍스트로부터 배운 것과 일치할 수 있습니다. 시설 규모에서 그것이 누적되며, 그것이 대학이 75,000 개의 논문을 제출할 때 1% 오판율이 의미하는 것의 산수입니다.
100% 점수는 종합값이며 판결이 아닙니다
단일 세그먼트가 100%를 생성하는 이유를 이해하려면, 점수 메기기가 어떻게 작동하는지 다음으로 보는 것이 도움이 됩니다. Turnitin의 FAQ는 파이프라인을 설명합니다:
“When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.” (논문이 Turnitin에 제출되면, 제출물의 문장이 추출되어 예측 분석을 위한 중첩 세션으로 분할됩니다. 각 세그먼트는 AI 검출 모델에 의해 분류되며, 텍스트가 인간 작성 또는 AI 생성을 나타내는 확률을 나타내는 0과 1 사이의 값을 받습니다. 이러한 세그먼트 내의 각 자격을 갖최 문장은 세그먼트의 점수를 계습니다. 세그먼트가 중첩되므로, 일부 문장은 여러 개의 점수를 가질 수 있으며, 그들은 하나의 점수로 통합됩니다. 이러한 문장 점수는 더 수집되어 문서 전체의 AI 작성 점수를 계산하는 데 사용됩니다.)
더 긴 문서에는 여러 개의 중첩되는 세그먼트가 있습니다. 하나의 세그먼트 경계 부근의 문장은 다음 세그먼트 안에도 나타납니다. 두 세그먼트의 점수는 통합됩니다. AI처럼 읽힌 하나의 세그먼트가 지배하지 않습니다, 인접한 세그먼트가 통합 점수를 다른 방향으로 끌기 때문입니다.
짧은 문서에는 하나의 세그먼트만 있습니다. 중첩 없음. 창 사이의 통합 없음. 단일 세그먼트의 분류가 문서 점수가 됩니다. 그 세그먼트가 AI 확률 0.95로 분류되면, 문서 점수는 100% (또는 종합이 그것을 어떻게 매핑하는지)가 됩니다. 시스템은 참고할 두 번째 의견이 없습니다.
이것이 100% 점수가 짧은 논문에 집중되는 기계적 이유입니다. 짧은 논문이 AI 생성이 더 쉽기 때문이 아닙니다. 계기가 자체를 수정할 기회가 적기 때문입니다.
점수 사용에 대한 Turnitin 자체의 말
Turnitin 자체 설명서는 자신의 점수에 대해, 그것을 사용하는 시설들이 일반적인 것보다 더 조심스럽니다. AI Writing Report 가이드는 다음과 같이 명시합니다:
“Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student.” (저희의 AI 작성 검출 모델이 항상 정확한 것은 아닙니다(인간이 쓴, AI가 생성한, AI가 패러프레이즈한 텍스트를 잘못 식별할 수 있습니다). 따라서 학생에 대한 불이의적 조치의 유일한 근거로 사용되어서는 안 됩니다.)
그 같은 가이드의 다음 문장입니다:
“It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred.” (학술적 부정 행위가 발생했는지를 결정하려면, 조직이 특정 학술 방친을 적용하는 것과 함께 추가적인 심사와 인간의 판단이 필요합니다.)
별도의 리뷰 가이드는 같은 요점을 다르게 표현합니다:
“It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy.” (고립되어서 확정적인 답을 제공하도록 의도된 것은 아닙니다. 어떤 도구보다 더 중요한 것은 점수를 보고, 이 정보를 학생, 그들의 작업, 시설 방친에 대한 개인적 지식과 균형을 익으며 결정을 내리는 교육자입니다.)
그리고 그 다음 문장입니다:
“When educators look at the AI writing score and utilize it as a single data point rather than a definitive response, then it is being used as intended.” (교육자가 AI 작성 점수를 보고, 확정적인 응답이 아닌 단일 데이터 포인트로 활용할 때, 그것은 의도된 대로 사용되는 것입니다.)
이것은 우리의 말이 아닌 Turnitin의 말입니다. 검출기를 구축한 회사가 그것을 사용하는 사람들에게 점수는 결론이 아닌 하나의 데이터 포인트라고 알려주고 있습니다. 귀하의 시설이 100%를 확정적인 증거로 취기한다면, 그 시설은 Turnitin이 사용해야 한다고 하지 않은 방식으로 도구를 사용하고 있을 것입니다.
자기 작성에 100%를 받은 경우의 실용적 단계
문서 길이를 확인하십시오. 제출물이 몇백 단어였다면, F9에서 설명된 “전부 아니면 전부” 동작이 가장 가능성 있는 설명입니다. 점수는 단일 세그먼트 예측의 한계를 반영하며, 귀하의 작성 과정에 대한 결정이 아닙니다.
귀하의 텍스트가 오판 프로필에 해당하는지 확인하십시오. 좁은 구조적 변동, 글자적 반복, 새로운 아이디어 없는 패러프레이즈는 Turnitin 자신이 이름하는 세 가지 특징입니다. 귀하의 텍스트에 그 중 하나라도 있다면, 공식적 조언은 백분율을 읽을 때 그것을 고려하는 것입니다. 이것은 회의에 가져올 수 있는 인용입니다.
보고서가 언제 생성되었는지를 물어보십시오. 2023년 5월, Turnitin은 높은 오판 확률을 내더 높은 오판율을 생성하더 문서의 처음과 마지막 문장에서의 오판을 줄이기 위해 검출 로직을 변경했습니다. 수정은 릴리즈 노트에 문서화되어 있습니다. 보고서가 그 수정 이전의 것이면, 이후 해결된 문제를 반영할 수 있습니다. 2024년 7월 이전에 생성된 보고서는 현재 보고서가 별표로 표시하는 1에서 19 까지의 범위 수치 점수를 보여줄 수도 있습니다. 요점은, 오래된 보고서는 새 보고서와 다르게 동작하며 날짜가 중요하다는 것입니다.
작성 과정의 증거를 가져오십시오. 버전 이력, 타임스탬프가 있는 초안 파일, 연구 활동을 보여주는 브라우저 기록. 이들은 점수에 대한 논쟁이 아닌 증거입니다. 그것은 Turnitin이 점수에 동반해야 한다고 하는 "further scrutiny and human judgment" (추가적인 심사와 인간의 판단)입니다.
Turnitin의 말을 인용하십시오. 점수는 “should not be used as the sole basis for adverse actions against a student” (학생에 대한 불이의적 조치의 유일한 근거로 사용되어서는 안 된다)라는 문구가, 세 개의 별도 Turnitin 문서에 나옵니다. 점수는 “a single data point rather than a definitive response” (확정적인 응답이 아닌 단일 데이터 포인트)이라는 문구는, Turnitin이 도구가 사용되어야 한다고 말하는 방식입니다. 이것은 의견이 아닙니다. 제조업자가 명시한 운용 지침입니다. 실제로 무엇을 말해야 할지를 작성하고 있다면, 플래그되었지만 직접 쓰신 것이 그 응답을 준비하는 것을 다룹니다.
이것에서 우리가 얻어내는 것
HumanPen 도구는 문서 재작성 도구입니다. 여기서 관련한 설계 결정은, 우리가 점수가 아닌 구간 단위로 다시 쓴다는 것입니다. 우리는 우리가 볼 수 없는 숫자를 올리려고 하지 않습니다. AI Writing Report가 플래그한 구간을 가져와, 그 구간의 실제 말을 바꿀으며 문서의 나머지는 그대로 두습니다. 계정은 다시 쓴 단어만을 세어 계산하며, 다시 쓴 텍스트에 대한 새 보고서가 계속 20% 이상으로 돌아온다면 여전히 플래그된 구간의 재실행은 무료입니다.
다음 보고서가 무엇을 말할 지는 알려주지 않을 것입니다. 검출 점수에 대한 예측을 하지 않습니다. 우리가 하는 경우 그조차보다 좁습니다: 보고서가 특정한 구간 내의 특정 말을 다시 쓰며 그 주위의 구조, 인용, 형식 서식을 보존합니다.
자주 묻는 질문
Turnitin이 100% AI에 대해 잘못할 수 있습니까? 네. Turnitin의 FAQ 자신이 짧은 문서는 단일 세그먼트에서 “전부 아니면 전부” 예측을 받으며, 구조적 변동이 없거나 가까운 패러프레이즈하는 텍스트는 오판에 더 취약하다고 합니다. 100% 점수는 세그먼트 수준 분류의 종합이며 짧은 문서에는 하나의 세그먼트만 있을 수 있습니다.
100% AI는 Turnitin이 확신한다는 의미니까? 아니요. 백분율은 중첩되는 세그먼트에 적용되어 통합되고 종합된 분류자의 출력입니다. 단일 세그먼트 문서에서는 하나의 높은 확률의 세그먼트가 전체 점수가 됩니다. Turnitin은 점수는 “should not be used as the sole basis for adverse actions against a student” (학생에 대한 불이의적 조치의 유일한 근거로 사용되어서는 안 된다)이며 “a single data point rather than a definitive response.” (확정적인 응답이 아닌 단일 데이터 포인트)이라고 합니다.
왜 제 짧은 에세이는 100%를 받았는데 긴 논문은 받지 않았습니까? 긴 문서는 더 많은 중첩되는 세그먼트가 있어서, 점수는 창 사이에 통합되고 하나의 AI처럼 보이는 세그먼트는 희석됩니다. 짧은 문서는 하나의 세그먼트를 가지며 중첩이나 희석이 없습니다. 이것은 점수 메기기 파이프라인의 기계적 특성이며 귀하의 작성에 대한 판단이 아닙니다.
Grammarly를 사용했습니까? Turnitin FAQ에서 Grammarly의 맞춤법, 문법, 문장부호 변경은 “in most cases” (대부분의 경우) AI로 플래그되지 않는다고 합니다. 하지만 Grammarly의 생성 기능 (초안 생성, 패러프레이즈, 요약)은 다른 카테고리이며, 그 기능으로 생성된 콘텐츠는 “will likely be flagged as AI-generated.” (AI 생성으로 플래그될 수 있습니다.) 입니다.
내 방어에서 Turnitin 자체의 말을 사용할 수 있습니까? 네. 점수가 조치의 유일한 근거로 안 된다는 문구는 세 개의 Turnitin 문서에 있습니다. 점수는 단일 데이터 포인트라는 문구는 그들의 리뷰 가이드에 있습니다. 이것은 제조업자의 운용 지침이며, 점수가 어떤 의미를 갖는지에 대한 모든 대화에 관련됩니다.
계속 읽기