AI 20% 는 높은 걸까? 왜 절대적 기준이 없는가
20% 는 Turnitin 이 수치 결과를 표시하는 기준일 뿐, 부정행위에 대한 보편적 기준이 아닙니다. 어떤 보고서의 의미든 본문 내용, 모델 오류, 하이라이트 위치, 그리고 각 기관의 규정에 따라 달라집니다.
HumanPen 팀
· 5분
Turnitin 을 포함해 누구도 기준점을 공개하지 않습니다
업계 차원의 커트오프도, 받아들여지는 안전한 구간도, Turnitin 이 내놓은 '얼마나 많으면 과도한가'에 대한 수치도 없습니다. 기관마다 각자의 관행을 정하며 그 차이도 큽니다. 어떤 플래그라도 학생과 대화해야 하는 사유로 삼는 곳도 있고, 이 지표를 아예 무시하는 곳도 있으며, Vanderbilt 는 완전히 비활성화 하기도 했습니다.
따라서 '20% 가 높은가'에 대한 정직한 답은 직접 읽어볼 수 있는 규정에 달려 있으며, 숫자만으로는 답할 수 없다는 것입니다. 안전한 백분율을 제시하는 어떤 글도 그 숫자를 만들어낸 것입니다.
이 질문에는 세 가지 다른 결정이 숨어 있습니다. Turnitin 은 인터페이스에 표시될 내용을 위한 보고 규칙을 정합니다. 기관은 직원이 제출물을 검토할 시점을 정하는 조사 규칙을 정합니다. 징계 기관은 정책 위반 여부를 판단할 때 증거 기준을 적용합니다. 같은 숫자가 세 단계 모두에 나타날 수 있지만, 그 숫자 자체가 어떤 단계도 정하지는 않습니다.
20% 표시 경계가 20% 부정행위 규칙은 아닙니다. 두 가지를 같은 것으로 취급하는 것이 대부분의 '안전 점수' 조언 뒤에 숨은 근본적인 오류입니다.
20% 보고서 두 개가 반드시 비교 가능한 것도 아닙니다. 한 문서는 거의 대부분 산문으로 이루어져 있을 수 있고, 다른 문서는 표와 부록이 주를 이룰 수 있습니다. 한 보고서는 집중된 단일 블록을 보여주고, 다른 보고서는 흩어진 구절들을 보여줄 수 있습니다. 백분율은 이러한 다양한 경우들을 하나의 제목으로 압축하므로, 해석은 보고서와 정책에서 시작되며 보편적인 색상 차트에서 시작되는 것이 아닙니다.
공급업체가 저범위 표시 방식을 변경했습니다
문서화된 기준은 하나 있으며, 그것은 표시 규칙입니다. 2024 년 7 월 이후로, Turnitin 의 결과가 1% 에서 19% 사이일 때 별표가 표시되고 수치 백분율이나 하이라이트는 표시되지 않습니다. Turnitin 은 저범위에서 위양성 발생률이 더 높게 나타났으며, 숫자를 숨기는 것이 오해를 줄인다고 말합니다.
별표는 모델의 저범위에 대한 주의 표시입니다. 이것이 0 을 의미하는 것은 아니며, 기관에 어떤 징계 결론을 내려야 하는지도 알려주지 않습니다.
표시된 20% 와 숨겨진 19% 는 인터페이스 규칙의 양쪽에 위치하지만, 그 1% 차이가 과학적 격차를 만드는 것은 아닙니다. 임계값 근처에서는 작은 모델이나 텍스트 변화가 사용자가 보는 것을 바꿀 수 있습니다. 그렇기 때문에 20% 보고서는 맥락과 함께 읽어야 하며, 별표와 근본적으로 다르다고 취급해서는 안 됩니다.
구식 보고서는 비교를 더욱 복잡하게 만듭니다. 변경 사항이 소급 적용되지 않았으므로 2024 년 7 월 8 일 이전 제출물은 새 제출물이 숨길 낮은 수치 점수를 여전히 표시할 수 있습니다. 생성일, 이용 가능한 경우 감지기 버전, 원래 PDF 나 스크린샷을 사례 기록과 함께 보관하세요.
'1%'주장은 어떻게 되었는가
감지기가 2023 년 4 월 출시될 때, Turnitin 은 평가 조건에서 문서 수준 위양성률이 less than 1 percent라고 홍보했습니다. 2023 년 6 월 회사의 최고 제품 책임자는 Inside Higher Ed 에게 a sentence-level false-positive figure was around 4 percent 라고 말했습니다. 이 수치들은 다른 단위를 사용하므로 1 에서 4 로의 단순 수정으로 제시해서는 안 됩니다.
위양성률은 또한 분모와 기준 인구가 필요합니다. 문장 수준 오류는 인간의 문장이 얼마나 자주 잘못 레이블되는지를 묻고, 문서 수준 오류는 완전히 인간의 문서가 의사결정 규칙을 초과하는 빈도를 묻습니다. 둘 다 Turnitin 의 first year 에 검토된 200 million papers 을 곱하여 고소 건수를 추정할 수 없는데, 이는 인간, AI 보조, 부적격 및 반복 제출의 혼합이 알려져 있지 않기 때문입니다.
Vanderbilt 는 연간 약 75,000 건의 제출로 기관 규모를 보여주며, 작은 주장된 비율조차도 공정한 검토가 필요한 많은 사례를 의미할 수 있다고 설명했습니다. 정확히 750 명의 학생이 잘못 기각될 것이라고 확정한 것은 아닙니다. 플래그가 고발이 될 필요는 없으며, 논문은 많은 문장을 포함하더라도 위양성 문서가 되지 않을 수 있습니다.
기본률은 또 다른 이유로 중요합니다. 특정 평가에서 금지된 AI 사용이 드물다면, 특이도가 높아도 거짓 양성이 모든 플래그의 상당 부분을 차지할 수 있습니다. 사용이 흔하다면 같은 탐지기는 다른 양성 예측 값을 가질 수 있습니다. 유병률, 민감도, 특이도 및 기관의 검토 프로세스를 알지 못하면, 표시된 백분율은'이 학생이 부정행위를 했을 확률은 얼마인가?'라는 질문에 답할 수 없습니다.
탐지기 백분율, 거짓 양성 비율 및 부정행위 확률은 세 가지 다른 양입니다. 어느 것도 다른 것을 대신할 수 없습니다.
거짓 양성이 실제로 군집하는 곳
Turnitin 은 인간과 AI 작성 문장이 혼합된 테스트에서 더 구체적인 오류 분석을 발표했습니다. 관찰된 거짓 양성 문장의 54% 가 AI 작성 문장 바로 옆에 있었고, 또 다른 26% 는 두 문장 떨어져 있었습니다.
그 평가에서 거짓 양성 문장의 5 개 중 4 개는 AI 텍스트로부터 2 문장 이내에 있었습니다. 이는 혼합 문서에서의 경계 행동을 설명하며, 완전한 인간 논문에서 거짓 양성이 어디에 떨어지는지 보여주지 않으므로 모든 이후 모델 버전으로 일반화해서는 안 됩니다.
이는 실제적인 결과를 가져옵니다. AI 지원 구절이 있는 논문에서 주변 문장들이 잘못 플래그될 가능성이 가장 높으며, 백분율은 어떤 것이 어떤 것인지 알려줄 수 없습니다. 분포는 알려줄 수 있으며, 이것이 헤드라인이 아닌 보고서 자체 를 읽어야 하는 논거입니다. Turnitin 은 또한 문서의 시작과 끝 문장 — 서론과 결론 — 에서 거짓 양성의 높은 발생률을 보고합니다. 그로 인해 이를 집계하는 방식을 변경했습니다.
이것이 모든 하이라이트된 문장을 삭제하거나 다시 쓰는 것이 건전한 진단적 대응이 아닌 이유입니다. 일부 하이라이트된 경계 문장은 인간이 작성했을 수 있으며, 일부 하이라이트되지 않은 구절은 AI 지원이지만 누락되었을 수 있습니다. 이 보고서는 문맥적 검토가 필요한 영역을 식별합니다. 저자성 증거는 여전히 초안, 출처, 허용 사용 선언 및 작성자가 작업을 설명하는 능력에서 나옵니다.
'이것이 높은가'보다 더 나은 질문들
- 우리 기관은 이 숫자로 무엇을 하는가? 많은 기관이 이것을 발견이 아니라 검토 사유로 취급합니다. Turnitin 자체도 이것이 부정행위를 결정하지 않는다고 말합니다.
- 플래그는 어디에 있는가? 방법, 정의 및 배경 — 형식적으로 읽혀야 하는 구절들 — 에 집중되어 있는 것은 논거 전체에 흩어져 있는 것과 다른 의미를 가집니다.
- 문서의 얼마나 많은 부분이 평가되었는가? 백분율은 산문만을 포함합니다. 표, 목록 또는 참고문헌이 많은 논문은 생각보다 훨씬 적은 부분이 평가되었을 수 있습니다.
- 어떤 보고서 상태와 날짜를 보고 있는가? 별표, 0%, 수치 점수 및 자격 오류는 서로 다른 의미를 가지며, 2024 년 7 월 이전 보고서는 오래된 표시 규칙을 따릅니다.
- 어떤 다른 증거가 필요한가? 검토자들이 이 지표를 충분한 증거로 취급하기보다 초안, 출처, 버전 기록, 이전 작성물 및 학생의 설명을 검토하는지 물어보십시오.
교육자의 경우, 이 기능을 사용하기 전에 이 프로세스를 기록해 두세요. 누가 보고서를 볼 수 있는지, 무엇이 대화를 촉발하는지, 학생들에게 증거가 어떻게 전달되는지, 어떤 조정이 적용되는지, 그리고 누가 최종 결정을 내리는지. 학생은 해당 서면 프로세스를 요청하고 원래 제출물을 변경하지 않은 상태로 유지하세요. 두 단계 모두 20 이 본질적으로'높은' 여부를 논쟁하는 것보다 더 유용합니다.