대학이 75,000 편의 논문을 제출할 때 1% 위양성률이 실제로 의미하는 것

1% 오류율은 누군가 실제 제출 건수에 곱해보기 전까지는 사소한 오차로 들립니다. 한 대학이 이 계산을 실제 수치로 보여주는 것과 함께 그 결정을 공개했습니다.

HumanPen 팀

· 8분

간단한 답변

위양성률은 개별 논문이 아니라 전체 집단의 속성입니다. 밴더빌트 대학교는 2023 년 8 월 이를 수치로 보여주었습니다. 2022 년에 75,000 편의 논문을 Turnitin 에 제출했는데, 만약 당시 AI 검출기가 가동 중이었다면 1% 위양성률은 "around 750 student papers could have been incorrectly labeled"(약 750 편의 학생 논문이 잘못 표시될 수 있었다) 는 뜻이 됩니다.该校는 검출기를 비활성화했습니다. 하지만 이 설명에는 두 가지 조건이 붙는데, 대개 이 조건들이 생략된 채 전달됩니다. 첫째, 2022 년에는 검출기가 실제로 가동되지 않았기 때문에 소식통에서 "if"라는 표현을 사용합니다. 둘째, 공급업체의 1% 수치 자체는 다음 문장에서 수정됩니다.

그 곱셈, 대학의 표현 그대로

Vanderbilt 의 학습혁신국은 2023 년 8 월 16 일 "Guidance on AI Detection and Why We're Disabling Turnitin's AI Detector"라는 게시물을 공개했습니다. 여기서 내린 결정은 명확합니다. "Vanderbilt has decided to disable Turnitin's AI detection tool for the foreseeable future."(Vanderbilt 는 당분간 Turnitin 의 AI 검출 도구를 사용하지 않기로 결정했습니다.)

기억해 둘 만한 문장은 이 산술입니다.

"At the time of launch, Turnitin claimed that its detection tool had a 1% false positive rate (Chechitelli, 2023). To put that into context, Vanderbilt submitted 75,000 papers to Turnitin in 2022. If this AI detection tool was available then, around 750 student papers could have been incorrectly labeled as having some of it written by AI."(출시 당시 Turnitin 은 자사 검출 도구의 위양성률이 1% 라고 주장했습니다 (Chechitelli, 2023). 이를 실제 상황에 적용해 보면, Vanderbilt 는 2022 년에 75,000 편의 논문을 Turnitin 에 제출했습니다. 만약 당시 이 AI 검출 도구를 사용했다면 약 750 편의 학생 논문이 AI 작성으로 잘못 분류되었을 것입니다.)

별다른 복잡한 계산이 아닙니다. 75,000 의 1% 일 뿐입니다. 하지만 이 계산은 백분율을 실제 문서 수로 변환하며, 바로 이 변환이 오류율을 이해하기 어렵게 만드는 핵심입니다.

다시 두 번째 문장을 'if'부터 읽어보세요. 이 75,000 편의 논문이 제출될 당시 검출기는 작동하지 않았다는 뜻입니다. 따라서 750 은 Vanderbilt 나 다른 어떤 곳에서도 실제로 발생한 사건의 숫자가 아닙니다. 이는 한 대학의 연간 제출량 1% 가 실제로 얼마나 되는지를 보여주는 계산일 뿐입니다. 이는 그 숫자가 흔히 사용되는 주장보다 훨씬 작고, 훨씬 더 방어하기 쉬운 주장입니다.

숫자가 입장에 따라 달라지는 이유

업체에게 100 건 중 1 건은 사양일 뿐입니다. 기관에게는 연간 처리 건수입니다. 하지만 당신에게는 둘 다 아닙니다. 당신은 하나의 문서일 뿐이고, 그 비율은 당신의 문서가 그 하나에 해당하는지 아닌지에 대해서는 아무것도 말해주지 않습니다.

이 마지막 포인트는 양날의 검과 같아서, 사람들이 양쪽 방향으로 지나치게 나갑니다.

  • 당신의 논문이 잘못 표시되었다는 뜻이 아닙니다. 인간이 작성한 논문에 대한 1% 의 오류율은 AI 보조 작성 비율에 따라 대부분의 표시된 논문이 올바르게 표시되었을 가능성과 전혀 모순되지 않습니다.
  • '도구가 99% 정확하므로 당신이 반드시 AI 를 사용했다'는 주장은 성립하지 않습니다. 비율은 집단을 기술할 뿐, 그 집단 속에서 당신의 논문이 어디에 속하는지는 알 수 없습니다. 75,000 편의 연간 제출량에서 1% 는 수백 편의 문서에 해당하며, 그 범위에 속하는 것은 특별할 것이 없습니다. 다만 수백 편의 문서가 수백 건의 고발을 의미하는 것은 아니며, 이 둘 사이의 간격에서 대부분의 잘못된 주장이 발생합니다.

유용한 접근은 '검출기가 고장났다'거나 '검출기가 옳다'가 아닙니다. 집단 통계로는 개별 사례를 판단할 수 없다는 점입니다. 업체도 이를 서면으로 인정하고 있으며, FAQ 에서 교수진이 AI 작문 지표의 백분율을 "the sole basis for action or a definitive grading measure"(조치의 유일한 근거나 확정적인 채점 기준으로 삼아서는 안 된다고 명시하고 있습니다.)

자꾸 빠지는 조건

1% 수치를 인용할 때 중요한 세부사항이 하나 있습니다.

Turnitin 의 FAQ 는 이렇게 명시합니다. 위양성률 — 즉 "incorrectly identifying fully human-written text as AI-generated"(인간이 완전히 작성한 텍스트를 AI 생성으로 잘못 식별하는 비율) — 을 "under 1% for documents with over 20% of AI writing."(AI 작문이 20% 이상 포함된 문서에 대해 1% 미만) 으로 유지하려 한다고 밝혔습니다.

For documents with over 20% of AI writing. 이는 주장에 상당한 제약을 가합니다. 하지만 공급업계는 바로 다음 문장에서 이를 무시하고 이렇게 재진술합니다. "In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents."(즉 100 편의 완전히 인간이 작성한 문서 중 1 편을 AI 작성으로 잘못 표시할 수 있다.)

이 두 문장은 동등하지 않으며, 일반적으로 유포되는 것은 두 번째 문장입니다. 이 수치를 언급할 때는 조건이 명시된 버전을 사용해야 합니다. 정확성 때문이기도 하지만, 주로 상대방이 그 조건을 알고 있을 수 있기 때문입니다.

2023 년 게시물의 반복에서 살아남는 부분들

이 게시물은 2023 년 8 월의 것입니다. 내용의 일부는 시간이 지나도 변하지 않는 산술적 계산이고, 다른 일부는 공급업체의 발표에 관한 주장으로 시간이 지나면 달라집니다. 인용하기 전에 이 둘을 구분하는 것이 작업의 대부분입니다.

*산술은 if를 붙인 채 반복해도 안전합니다.* 1% 는 큰 제출량에서 많은 문서 수를 의미하며, 2023 년 이후 어떤 것도 이 사실에 영향을 주지 않았습니다.

비원어민 영어 작문가에 대한 우려도 반복해도 안전합니다. 이 게시물에 의존하는 것도 아닙니다. 이를 뒷받침하는 연구 결과가 있으며, 우리는 해당 연구가 실제로 무엇을 측정했는지를 비원어민 영어 작문에 대한 AI 검출기 편향 에서 자세히 검토했습니다.

투명성 관련 불만을 반복하기 전에 확인해야 합니다. Vanderbilt 는 "Turnitin gives no detailed information as to how it determines if a piece of writing is AI-generated or not"(Turnitin 이 작문이 AI 생성인지 판단하는 방식에 대한 상세 정보를 제공하지 않는다) 고 기술했습니다. 오늘날의 FAQ 는 점수가 어떻게 산출되는지 설명하고 있는데, 문장이 추출되고 겹치는 섹션으로 분할된 뒤 각 세그먼트가 분류되고 0 부터 1 까지의 값을 부여받습니다. 조건을 갖춘 문장은 세그먼트 점수를 물려받고, 겹치는 점수가 풀링되며, 풀링된 문장 점수가 문서 점수로 집계됩니다. 회의에서 관련 메커니즘이 공개된 적이 없다고 주장하면 누군가 이 문단을 당신 앞에 내놓을 것입니다.

다만 이의가 해소되었다고 결론내리기 전에 게시물의 다음 문장을 꼼꼼히 읽어보세요. 이의는 '작동 방식을 알려달라'보다 더 좁습니다. 실제 불만은 이 도구가 "looks for patterns common in AI writing, but they do not explain or define what those patterns are"(AI 작문의 공통 패턴을 찾지만, 그 패턴이 무엇인지 설명하거나 정의하지는 않는다) 는 점입니다. 세그먼트 점수를 결합하는 방식에 대한 설명은 패턴 자체에 대한 설명이 아닙니다. 공개된 메커니즘과 공개된 이의는 서로 다른 질문을 다루며, 둘 다 같은 날 정확하게 인용될 수 있습니다.

우리는 이 FAQ 문단이 언제 처음 등장했는지 알 수 없습니다. 우리는 그 날짜를 확인하지 않았으므로, 위의 어떤 내용도 공급업체가 이 게시글에 대한 답변으로 공개했다고 읽혀서는 안 됩니다.

또 다른 조건이 하나 더 있으며, 이는 Vanderbilt 에게 속합니다. 이 게시물은 해당 기능이 "less than 24-hour advance notice, no option at the time to disable the feature"(24 시간 미리 알림도 없이, 당시에는 기능을 비활성화할 옵션도 없이) 도입되었다고 기술합니다. 'At the time'은 원문의 표현입니다. 이 세 단어를 빼고 인용하면 출시 당시의 진술을 제품 전체에 대한 지속적 주장으로 바꾸게 됩니다. 이는 1% 수치에서 'over 20%'를 빼는 것과 같은 수법이며, 단지 논쟁의 반대편에서 행해진 것일 뿐입니다.

과장하지 않고 활용하는 법

  1. 날짜를 명시하세요. '2023 년, Vanderbilt 가 이 도구를 비활성화하고 이 이유를 공개했다'는 검증 가능하고 방어 가능합니다. '대학들이 AI 검출을 포기했다'는 둘 다 아닙니다.
  2. 이 산술이 무엇을 보여주는지 말하세요. 이는 누구나 자신의 기관 제출량으로 다시 계산할 수 있기 때문에 유포되며, 실제 문제를 제기합니다. 작은 비율이라도 누군가가 공정하게 검토해야 하는 처리량을 만들어낸다는 점입니다. 다만 이는 고발 건수를 추정하지는 않습니다. 모든 제출이 점수 대상이 되는 것은 아니며, 기관 밖에서는 실제 AI 사용량을 알 수 없고, 플래그가 반드시 고발로 이어지는 것도 아닙니다. 우리는 20% AI 는 너무 높은가 에서 이를 더 자세히 다룹니다.
  3. 내 문서에 대해 무언가를 증명한다고 주장하지 마세요. 이는 대규모에서 잘못 플래그되는 것이 일상적인 사건임을 보여줄 뿐이며, 이는 다른 그리고 더 겸손한 주장입니다.
  4. 귀하의 기관이 공개한 내용이 있는지 확인하세요. 학술诚信 정책과 교수학습센터가 내놓은 자료를 찾아보세요. 뉴스 페이지만 보지 마세요. 당신이 참여할 가능성이 있는 어떤 대화에서도 지역 성명이 원격 성명보다 우선합니다.
  5. 시작에서 빼세요. 프로세스와 출처가 먼저 설득합니다. 통계는 누군가 그 숫자가 분명히 결정적이라고 주장할 때 꺼내는 것입니다.

귀 기관이 여전히 사용한다면

그렇다면 당신 앞에 있는 보고서가 위의 그 어떤 것보다 중요합니다. 백분율이 무엇을 통계로 삼는지, 그리고 하이라이트와 숫자가 왜 불일치할 수 있는지는 별개의 주제이며, AI 작문 보고서 한 줄씩 읽기 에서 다룹니다.

HumanPen 은 특정 문단이 표시되고 그중 일부가 수정이 필요할 때만 개입합니다. 보고서가 경계를 설정하며, 표시되지 않은 문단은 이미 당신이 가진 어구를 유지합니다.

이 중 어떤 것도 위양성에 대한 답은 아닙니다. 당신이 직접 작성했다는 입장이라면 다시 쓰는 것은 잘못된 움직임이며, 실제로 심사위원을 설득한 것은 완전히 다른 주제입니다. 심사단을 움직였던 증거 를 확인하세요.

자주 묻는 질문

1% 위양성률은 내 플래그가 아마도 잘못되었다는 뜻인가요? 아닙니다. 이는 인간이 작성한 문서 집단 전체의 비율일 뿐, 개별 사례에 대해서는 아무것도 말해주지 않습니다. 다만 기관 규모의 제출량에서는 잘못 플래그된 논문이 드문 사고가 아니라 일상적인 현상이라는 점은 의미합니다.

750 편이라는 숫자는 어디에서 나왔나요? 2023 년 8 월 16 일 Vanderbilt 가 게재한 게시물에서 나온 것으로, 2022 년에 Turnitin 에 제출한 75,000 편의 논문에 1% 를 적용한 수치입니다. 조건법을 유의하세요. 검출기가 2022 년에는 가동되지 않았으므로 'if this AI detection tool was available then'이라고 서술되어 있습니다. 이는 해당 대학의 제출량 1% 를 실제 숫자로 나타낸 것이며, 750 편의 논문이 잘못 표시되었다는 기록도 아니고 다른 기관에 대한 예측도 아닙니다.

1% 주장은 무조건적인가요? 아닙니다. Turnitin 이 명시한 목표는 'for documents with over 20% of AI writing'(AI 작문이 20% 이상 포함된 문서에 대해) 1% 미만입니다. 바로 다음 문장에서 이 조건을 빼고 다시 서술하는데, 그래서 조건 없는 버전이 유포되는 것입니다.

대학들이 대체로 AI 검출 기능을 껐나요? 이 소식은 이를 뒷받침하지 않습니다. 2023 년 한 기관의 결정과 그 이유를 기록할 뿐입니다. 귀하의 기관이 이를 사용하는지는 지역적 문제에 지역적 답변이 있을 뿐입니다.

계속 읽기