비원어민 영어 작가가 AI 감지기에 더 자주 걸리는 이유

7 개 감지기가 인간이 작성한 TOEFL 에세이 샘플의 61% 를 잘못 분류했습니다. 이 연구가 모든 다국어 작가를 대변하는 것은 아니지만, 통제된 수정 실험을 통해 어휘력이 제한적일 경우 논증의 작성자는 그대로인데도 감지기 점수가 움직일 수 있음을 보여줍니다.

HumanPen 팀

· 8분

연구 결과: 인간 에세이의 61.22% 가 AI 로 판정됨

2023 년 스탠포드 연구진 (Liang, Yuksekgonul, Mao, Wu, Zou) 이 널리 사용되는 GPT 감지기 7 개를 두 종류의 에세이에 대해 테스트했습니다. 첫 번째는 [Patterns](Cell Press 저널에 게재된) 지에 발표된 연구로, 중국 교육 포럼에서 가져온 학생들이 작성한 TOEFL 에세이 91 편 이었습니다. 두 번째는 Hewlett Foundation 의 ASAP 데이터세트에서 가져온 미국 8 학년 학생들의 에세이 88 편이었습니다. 두 세트 모두 AI 가 관여하지 않았습니다.

미국 8 학년 에세이에서는 감지기가 거의 완벽하게 작동했습니다. 반면 TOEFL 에세이에서는 평균 위양성률이 61.22%였습니다. 7 개 감지기 전원이 91 편 중 18 편 (19.78%)을 AI 작성으로 판정했고, 91 편 중 89 편 (97.80%)은 적어도 하나의 감지기에서 걸렸습니다.

이 대비가 바로 핵심 결과입니다. 같은 7 개 도구가 미국 8 학년 세트에서는 TOEFL 세트보다 훨씬 더 잘 작동했습니다. 이것이 모든 다국어 작가나 오늘날 사용되는 모든 감지기의 오류율을 입증하는 것은 아닙니다. 다만 집계된 정확도 주장 뒤에 특정 작가 집단에 대해서는 훨씬 더 나쁜 결과가 숨겨질 수 있음을 보여줍니다.

61.22% 는 이 샘플과 2023 년 당시 7 개 감지기에 대한 결과로 해석해야 하며, 당신의 개인적 피검출 확률로 받아들여서는 안 됩니다. 이 연구는 불평등한 오류에 대한 경고이지 보편적 예측이 아닙니다.

이 발견은 논쟁의 여지가 있습니다. 한 감지기 업체는 한 학생 포럼 출신의 에세이 91 편으로는 일반적인 오류율을 주장하기에 표본이 너무 작고 협소하다고 지적했습니다. 이는 실제 제한점입니다. 표본이 편의 추출되었고, 비교 집단이 언어 배경뿐만 아니라 연령에서도 달랐으며, 2023 년 이후 감지기 제품이 변했다는 점입니다. 그러므로 논리적으로 방어 가능한 결론은 헤드라인보다 좁습니다. 이 연구는 기관들이 간과해서는 안 되는 큰 격차를 확인했다는 것입니다.

기관들은 리스크 관점에서 같은 주의를 기울여 왔습니다. 밴더빌트 대학은 2023 년 8 월 Turnitin 의 AI 감지기 기능을 비활성화했습니다. 문서 수준의 위양성률이 1% 라고 주장해도 연간 약 75,000 건의 제출물에서 심각한 검토 부담을 초래한다고 지적했습니다. 이 계산은 예시일 뿐 정확히 750 명의 학생이 고발될 것이라는 예측은 아닙니다. 모든 논문이 검토 대상이 되는 것은 아니며, 기본률도 알 수 없고, 플래그가 반드시 고발로 이어지는 것도 아닙니다. 요점은 소규모 비율이라도 제도적 규모에서는 공정한 절차가 필요하다는 것입니다.

증거를 강화하려면 무엇이 필요할까요? 더 대규모의 사전 등록 연구에서는 제 1 언어, 숙련도 수준, 학문 분야, 과제 유형에 걸쳐 작가를 표본 추출하고, 연령이 일치하는 집단을 비교하며, 감지기 버전별 결과를 공개하고, 위양성과 위음성을 모두 보고해야 합니다. 집계된 정확도만으로는 부족합니다. 도입을 고려하는 기관에는 헤드라인율을 다른 코퍼스에서 가져오기보다, 해당 업체가 실제 학생 집단을 평가했는지, 하위 집단 결과를 이용할 수 있는지 물어야 합니다.

개인적인 보고서의 경우, 스탠포드 수치나 업체 벤치마크 어느 것도个案를 결정하지 않습니다. 관련 증거는 로컬에 있습니다. 어떤 텍스트가 자격을 갖췄는지, 하이라이트가 어디에 있는지, 어떤 모델 버전이 실행되었는지, 과제가 무엇을 허용했는지, 학생의 초고가 어떻게 발전했는지입니다. 집단 연구는 검토자에게 어떤 실패 모드를 진지하게 받아들여야 하는지 알려주지만, 특정 작업에 대한 검토를 대체하지는 않습니다.

감지기가 실제로 측정하는 것

초기 공개된 감지기 설명서는 두 가지 통계 신호에 집중했습니다. 퍼플렉시티 (perplexity) 와 버스티니스 (burstiness) 입니다. 현대 상업 시스템은 많은 학습 신호를 결합할 수 있으며 내부는 대부분 공개되지 않으므로, 이 두 용어는 현재의 모든 제품을 완벽하게 설명하는 것이 아니라 문제를 이해하는 도구로 보는 것이 가장 좋습니다.

퍼플렉시티 (perplexity)는 언어 모델에게 당신의 어휘 선택이 얼마나 놀라운지를 측정합니다. 모델이 예측한 다음 단어가 실제 나타나면 퍼플렉시티는 낮습니다. 버스티니스 (burstiness)는 문장 길이와 구조가 텍스트 전체에서 얼마나 변하는지를 측정합니다. 일정하고 규칙적인 문장은 낮은 점수를 받습니다.

이러한 신호를 사용하는 감지기에서 낮은 퍼플렉시티와 낮은 변동성은 기계적 분류에 기여할 수 있습니다. 이것이 보편적 테스트는 아니며, 같은 구절이라도 다른 참조 모델에서는 다른 퍼플렉시티를 가질 수 있습니다. 분류기는 여전히 신호를 결합하고 결과를 레이블링할 임계값을 선택해야 합니다.

감지기는 작성자나 의도를 관찰하지 않습니다. 제출된 텍스트의 특징을 관찰하여 학습된 훈련 데이터 패턴과 비교할 뿐입니다.

이 차이는 제 2 언어 작문에 중요합니다. 더 작은 작업 어휘, 반복되는 문장 틀, 교실 모델에 대한 엄격한 준수는 생성된 텍스트에서 발견되는 특징과 닮을 수 있습니다. 더 나은 분류기가 그 오류를 줄일 수는 있지만, 어떤 아키텍처도 텍스트적 유사성을 그 구절을 누가 썼는지에 대한 직접 관찰로 바꾸지는 않습니다.

임계값도 중요합니다. 낮추면 생성된 텍스트를 더 많이 잡아내지만 더 많은 인간 텍스트를 받아들입니다. 높이면 그 반대입니다. 광고된 정확도 수치는 하나의 운영 지점에서 하나의 데이터세트를 설명할 뿐입니다. 숙련도 수준, 학문 분야, 문서 길이 또는 이후 모델 버전 전체에서 균일한 성능을 보장하지는 않습니다.

어휘 범위가 결과를 움직인다는 것을 보여준 실험

이 논문은 두 그룹을 비교하는 데 그치지 않습니다. 원본 에세이와 논증은 그대로 유지한 채 양방향으로 언어를 조작합니다. 이 때문에 제안된 메커니즘이 더 설득력을 얻습니다. 비록 이 실험이 어휘를 모델이 만든 다른 모든 문체 변화와 분리하지는 못하지만요.

첫 번째 방향. 연구자들은 모든 감지기에서 걸렸던 TOEFL 에세이를 가져와 GPT-4 에게 어휘를 풍부하게 하도록 요청했습니다. 퍼플렉시티가 유의미하게 상승했고 (P = 9.36E-05), 통일적으로 감지된 수는 18 편에서 91 편 중 1 편 (1.10%)으로 줄었습니다. 같은 저자, 같은 논증, 같은 에세이. 바뀐 것은 어휘뿐입니다.

더 강력한 두 번째 방향. 감지기가 거의 완벽하게 판정했던 미국 8 학년 에세이를 가져와 ChatGPT 에게 "비원어민이 쓴 것처럼 단어를 단순화하라"고 프롬프트했습니다. 잘못된 분류는 평균 5.19% 에서 56.65%로 급증했습니다.

근본적인 에세이의 작성자는 바뀌지 않았지만 분류는 바뀌었습니다. 이 개입은 따라서 인구통계학적 레이블이 감지기에 보이 somehow 어서가 아니라 표면 언어, 특히 어휘 다양성이 인과적 역할을 한다는 것을 뒷받침합니다. GPT-4 와 ChatGPT 는 구문, 리듬, 표현도 바꿀 수 있으므로, 어휘만이 유일한 원인이라고 단정하기에는 무리가 있습니다.

논문 자체의 결론은 감지기가 "제약된 언어 표현을 가진 작가를 의도치 않게 처벌할 수 있다"는 것이며, 평가나 교육 환경에 아예 도입하지 말 것을 경고합니다.

이 결과는 다국어 작가에게 더 격식 있게 쓰라고 권하는 것이 역효과를 낼 수 있는 이유도 설명합니다. 학술 조언은 종종 표준 전환, 보수적 어휘, 균일한 문장 구조에 점수를 줍니다. 이러한 선택은 명확성을 위해 적절할 수 있지만, 오래된 통계 감지기가 인간 증거로 취급했던 바로 그 변동성을 줄입니다. 해법은 논문에 장식적 어휘를 억지로 넣는 것이 아니라 감지기를 작성자 테스트로 취급하지 않는 것입니다.

관련 발견: 하나의 프롬프트가 그들을 무력화함

같은 논문은 이러한 점수를 증거로 사용하는 것을 복잡하게 만드는 또 다른 사실을 보고합니다. 연구팀은 ChatGPT-3.5 로 에세이를 생성했는데 감지기가 안정적으로 잡아냈습니다. 그런 다음 단일 자기수정 프롬프트인 "제공된 텍스트에 문학적 언어를 사용하여 격상하라"를 적용하자, 감지 비율이 100% 에서 13%로 떨어졌습니다.

이것을 기법으로 제시하는 것이 아닙니다. 도구에 대한 사실로 제시하는 것입니다. 한 줄 프롬프트로 87% 포인트 움직이는 척도는 고발의 약한 근거이며, 그것이 어떤 감지기 결과도 정직하게 약속할 수 없는 이유이기도 합니다. 저희는 하지 않습니다.

그 결과에는 두 가지 한계가 있습니다. 첫째, 2026 년의 모든 제품이 아니라 2023 년에 테스트된 7 개 감지기와 모델 출력을 설명합니다. 둘째, 회피에 대한 강건성과 인간 작가에 대한 공정성은 다른 속성입니다. 감지기는 속이기 더 어렵더라도 불균등한 위양성을 유지할 수 있습니다. 현재 어떤 평가도 점수가 실제로 사용될 집단과 작문 장르에서 둘 다를 테스트해야 합니다.

감지기는 삼중 분류 (triage) 에는 유용할 수 있지만 재결 (adjudication) 에 충분히 신뢰할 수는 없습니다. 결과가 중대할수록 더 많은 독립적 증거와 절차적 검토가 필요합니다.

걸렸을 때 무엇을 해야 할지

이 중 어느 것도 감지기를 우회하는 글쓰기에 관한 조언이 아닙니다. 통계를 당신에 대한 증거로 읽을 때 무엇을 해야 하는지입니다.

  • 지금부터 초고를 보관하세요. Word 나 Google Docs 의 버전 이력, 개요 파일, 읽기 노트, 지도교수 피드백을 보존하십시오. 이러한 자료는 작업이 시간에 따라 어떻게 발전했는지를 보여줍니다. 경쟁하는 감지기 점수보다 더 강력한 증거입니다.
  • 헤드라인 비율이 아닌 전체 보고서를 요청하세요. 구절 하이라이트는 플래그가 방법론, 정의, 배경과 같은 관례적 언어를 사용하는 섹션에 군집하는지 보여줄 수 있습니다. 보고서가 실제로 제공하지 않는 한 이를 섹션 수준 확률로 설명하지 마십시오.
  • 이 숫자가 어떻게 사용되는지 묻으세요. 관련 과정 또는 기관 정책, 감지기와 버전, 점수 외의 고려된 증거를 요청하십시오. 많은 기관이 플래그를 발견으로 보지 않고 살펴볼 이유로 취급합니다.
  • 의미와 소유권을 위해 편집하세요. 자연스럽게 사용하지 않을 어구를 대체하고, 모든 주장과 인용을 확인하고, 논증을 설명할 수 있는지 확인하십시오. 문장 길이 변동을 인위적으로 만들어내려고 명확한 산문을 왜곡하지 마십시오.

공식 절차가 시작되었다면 제출된 파일을 그대로 두고 사본으로 작업하세요. 연구, 초고 작성, 피드백 수령, 수정한 시기를 나타내는 간단한 타임라인을 작성하세요. 증거를 검토할 충분한 시간을 요청하고, 규칙이 허용하는 곳에서 고문이나 학생 대표를 동반하십시오. 잘못된 플래그에 대한 응답 준비 에 대한 별도 가이드에서 이 절차를 자세히 다룹니다.

교육자라면 학생이 편향 문제를 제기할 때까지 기다리지 마십시오. 누가 플래그를 검토하는지, 어떤 상호확인이 필요한지, 언어 배경과 장애가 어떻게 고려되는지, 학생이 기본 보고서를 어떻게 받는지 미리 정의하십시오. 도구가 선택적 삼중 분류인 것은 인간 프로세스가 이 도구에 이견을 제시할 수 있을 때만 가능합니다.