Turnitin은 자사 검출기가 영어 학습자에게 편향되어 있는지 스스로 시험했습니다. 그 결과에는 두 가지 측면이 있습니다.
300단어를 넘는 제출물에서 Turnitin은 L2 작성자와 L1 작성자 사이의 격차가 작고 통계적으로 유의하지 않다고 보고합니다. 150단어에서 300단어 사이의 제출물에서는 같은 평가에서 격차가 더 컸고, 자체 목표치인 1%를 크게 웃돌았습니다. 그리고 Turnitin은 자체 표본에 관한 한계를 직접 밝히고 있는데, 대학 수준의 글을 쓰고 계시다면 중요한 부분입니다.
HumanPen 팀
· 6분
짧은 답, 그것도 양쪽 모두
Turnitin은 이 질문을 직접 평가해 결과를 공개했습니다. 답에는 두 가지 측면이 있고, 둘은 반대 방향을 가리킵니다.
300단어 이상의 제출물에서는 영어 학습자(L2)와 영어 원어민(L1) 사이의 오탐률(FPR) 격차가 작고 통계적으로 유의하지 않았습니다. 150단어에서 300단어 사이의 제출물에서는 같은 평가에서 격차가 더 컸고, 자체 목표치인 1%를 크게 웃돌았습니다.
그러니 안심할 수 있는 결과가 본인에게 적용되는지는 제출하신 글의 길이에 달려 있습니다. 또한 Turnitin이 자체 표본에 대해 밝힌 한계도 있습니다. 대학 수준의 글을 쓰고 계시다면 중요하며, 아래쪽에 나옵니다.
무엇을 시험했는가
Turnitin은 두 변수의 조합마다 최대 2,000편의 텍스트를 추출했습니다. L2 영어(영어 학습자) 대 L1 영어(영어 원어민), 그리고 "너무 짧음"(150단어에서 300단어) 대 "충분히 긺"(300단어 이상)입니다. 이 데이터세트는 자사 검출기의 학습 데이터에 포함되지 않았습니다.
헤드라인에 실리는 결과
300단어 최소 요건을 충족하는 문서에서 Turnitin은 L2와 L1 작성자 사이의 오탐률 격차가 작고 통계적으로 유의하지 않다고 보고합니다:
"For documents meeting our minimum 300 word count requirement, the difference in the false positive rate (FPR) between L2 English writers (ELL writers) and L1 English writers (native English writers) is small, and not statistically significant, illustrating that our detector is not biased between these two groups of writers. Additionally, although the FPR for each group is slightly higher than our overall target of 0.01 (1%), neither group's FPR is significantly different from this target." (자체 최소 단어 수 요건인 300단어를 충족하는 문서에서는 L2 영어 작성자(ELL 작성자)와 L1 영어 작성자(영어 원어민) 사이의 오탐률(FPR) 격차가 작으며 통계적으로 유의하지도 않습니다. 이는 자사 검출기가 이 두 작성자 집단 사이에서 편향되지 않았음을 보여 줍니다. 또한 각 집단의 FPR은 전체 목표치 0.01(1%)보다 약간 높지만, 어느 집단의 FPR도 이 목표치와 유의하게 다르지는 않습니다.)
"Not statistically significant" (통계적으로 유의하지 않음)은 발견한 차이가 그저 우연일 수 있다는 뜻입니다. 차이가 0이라는 뜻도 아니고, 편향이 없다는 뜻도 아닙니다. 그리고 두 집단의 오탐률은 모두 1% 목표치보다 높았습니다. 다만 그 차이는 검정이 의미 있다고 보지 않은 수준이었습니다. "Slightly higher" (약간 높음)은 "at or below." (목표치 이내)와 같지 않습니다.
헤드라인에 실리지 않는 결과
150단어에서 300단어 사이의 문서에서는 같은 평가가 반대 방향을 발견했습니다. L2와 L1 작성자 사이의 격차는 더 컸고, 오탐률은 1% 목표치를 유의하게 웃돌았습니다:
"Conversely, for documents that are (반대로, 이른바 "너무 짧은" 문서의 경우) "too short," we found there is a greater difference in FPR between these groups of writers and it's significantly greater than our target of 0.01 FPR. This again corroborates our earlier finding that AI writing detectors require longer samples to correctly identify AI-generated content and to keep false positives to a minimum." (이 두 작성자 집단 사이의 FPR 격차가 더 크며, 그것은 자사 목표치인 0.01 FPR을 유의하게 넘는 수준입니다. 이는 AI 글쓰기 탐지기가 AI 생성 콘텐츠를 정확히 식별하고 오탐을 최소한으로 유지하려면 더 긴 표본이 필요하다는 앞서의 발견을 다시 한 번 뒷받침합니다.)
같은 검출기를 대상으로 한 같은 연구가, 긴 텍스트에는 한 가지 결과를, 짧은 텍스트에는 다른 결과를 냈습니다. 블로그 제목이 담고 있는 것은 전자입니다. 후자는 본문에 있습니다.
표본에 실제로 들어 있던 것
Turnitin은 다음과 같이 밝힙니다:
"Most of the L2 English documents are short persuasive or informative writing tasks, most similar to the Automated Scoring and Assessment Prize (ASAP) secondary-level essay corpus. A comparable collection of publicly available full-length university level documents from L2 and L1 writers was not available for this evaluation." (L2 영어 문서 대부분은 짧은 설득형 또는 설명형 쓰기 과제로, Automated Scoring and Assessment Prize(ASAP)의 중등 수준 에세이 코퍼스와 가장 비슷합니다. L2와 L1 작성자의 대학 수준 전문(全文) 문서를 모은 비교 가능한 공개 컬렉션은 이번 평가에 사용할 수 없었습니다.)
이번 평가에 쓰인 L2 글은 대부분 중등학교 수준의 에세이입니다. 대학 과제물, 문헌 검토, 실험 보고서, 학위 논문의 한 장을 쓰고 계시다면 그것은 시험된 대상이 아닙니다. Turnitin은 이 비교를 수행할 대학 수준의 L2·L1 글 공개 컬렉션을 찾을 수 없었다고 말합니다. "not statistically significant" (통계적으로 유의하지 않음)이라는 결과가 적용되는 것은 중등 수준의 짧은 설득형·설명형 에세이입니다. 실제로 제출하시는 문서에도 그것이 적용되는지는 이번 평가로는 답할 수 없는 질문입니다.
300단어 기준선
Turnitin은 300단어 최소 기준을 이 연구에 직접 연결합니다. 800,000건의 문서를 평가해 짧은 제출물이 오탐률을 끌어올리는 것을 확인한 뒤, 최소 제출 길이를 300단어로 정했습니다:
"Our evaluation of 800,000 documents—mentioned earlier in this blog—shows a slightly higher-than-comfortable false positive rate on short submissions (fewer than 300 words). There may not be enough signal/markers in such short samples to identify the telltale distributional differences in AI writing. In order to ensure we keep our false positive rate below 1%, we moved quickly to update the minimum submission length to 300 words for our AI writing detection capability to process a submission." (이 블로그 앞부분에서 언급한 800,000건의 문서 평가를 보면, 짧은 제출물(300단어 미만)에서 오탐률이 다소 불편할 정도로 높게 나타납니다. 그토록 짧은 표본에는 AI 글쓰기 특유의 분포 차이를 찾아낼 만한 신호나 표지가 충분히 담겨 있지 않을 수 있습니다. 오탐률을 1% 미만으로 유지하기 위해, 저희는 AI 글쓰기 탐지 기능이 제출물을 처리할 때의 최소 제출 길이를 300단어로 신속히 상향했습니다.)
이 최소 기준이 존재하는 까닭은 짧은 텍스트가 문제를 일으켰기 때문입니다. 안심할 수 있는 결과가 적용되는 것은 그 기준을 넘는 경우뿐입니다. 기준 아래에서는 같은 평가가 알아 두셔야 할 격차를 발견했습니다.
Liang의 연구는 어떠한가요?
Liang의 연구와 관련된 헤드라인을 보셨을 수 있습니다. Turnitin은 그것을 직접 다룹니다:
"Liang's claim is grounded on a small collection of works of just 91 Test of English as a Foreign Language (TOEFL) practice essays, all of which are less than 150 words long. Turnitin's AI writing detection was not included in this evaluation, perhaps in part because we won't make predictions about documents that are so short." (Liang의 주장은 단 91편의 TOEFL(Test of English as a Foreign Language) 연습 에세이라는 작은 작품 모음에 근거하고 있으며, 모두 150단어가 되지 않습니다. 이 평가에는 Turnitin의 AI 글쓰기 탐지가 포함되지 않았는데, 아마도 저희가 그렇게 짧은 문서에 대해서는 판정을 내리지 않는 점도 그 이유일 것입니다.)
이것을 어떻게 활용할 것인가
제출물이 300단어를 넘는다면, Turnitin의 자체 데이터에 따르면 L2와 L1의 오탐률 격차는 작고 통계적으로 유의하지 않습니다. 그렇다고 표시를 받지 않으리라는 보장은 아닙니다. 이는 이번 평가가 L2 작성자가 체계적으로 더 불리하다는 강한 증거를 찾지 못했다는 뜻입니다. 적어도 그들이 확보한 표본에서는 그렇습니다.
실제로 활용하실 수 있는 것은 다음과 같습니다:
제출하기 전에 단어 수를 확인하십시오. 300단어 미만의 부분이 표시되었다면, 검출기 자체 평가에 따르면 짧은 텍스트에서 L2와 L1 작성자 사이의 격차가 더 벌어지고 전반적인 오탐률도 더 높습니다. 짧은 발췌문이 아니라 문서 전체로 검사를 실행해 달라고 담당 교수자에게 요청하실 수 있습니다.
무엇이 어떤 기준으로 표시했는지 물어보십시오. Turnitin이 사용되었다면 300단어 최소 기준과 "slightly higher than 1%" (1%보다 약간 높음)이라는 부분은 표시를 검토하는 사람에게 제기하실 수 있는 구체적인 사안입니다.
초안과 메모, 출처를 보관하십시오. 표시를 받으셨고 본인의 L2 영어가 한몫했다고 생각되신다면, 수정 이력과 참고 자료를 보여 주는 것이 대화를 해결하는 길입니다. 담당 교수자와 통계적 유의성을 두고 논쟁하는 것은 아마 통하지 않을 것입니다.
계속 읽기