ChatGPT는 AI 탐지기입니까? OpenAI가 자체 분류기에 대해 공개한 내용

점점 더 많은 의혹 제기가 "이 글은 AI가 쓴 것 같습니다"라고 말하는 챗봇의 스크린샷에서 시작됩니다. 바로 그 챗봇을 만든 회사가 이와 똑같은 일에 대해 무엇을 공개했는지는 알아둘 만한 가치가 있습니다.

HumanPen 팀

· 6분

짧은 답

아닙니다. OpenAI는 이 목적을 위해 별도로 훈련한 분류기를 따로 만들었고, 측정한 정확도를 공개했습니다. AI가 쓴 텍스트의 26%를 정확히 찾아낸 반면, 사람이 쓴 텍스트의 9%는 AI가 쓴 것으로 잘못 판정했습니다. 그리고 2023년 7월 20일에 이를 내리고, "due to its low rate of accuracy" (정확도가 낮기 때문이라는 뜻입니다)라는 이유를 밝혔습니다. "이것을 AI가 썼습니까?"라고 질문받은 채팅 모델은 그 분류기가 아니며, 한 번도 그런 적이 없습니다. 그 모델이 그럴듯하게 들리는 답을 내놓는 것은, 그럴듯하게 들리는 답을 내놓는 일이 바로 그 모델이 하는 일이기 때문입니다.

OpenAI가 실제로 만든 것과 실제로 측정한 것

2023년 1월, OpenAI는 "trained to distinguish between text written by a human and text written by AIs from a variety of providers" (사람이 쓴 텍스트와 여러 업체의 AI가 쓴 텍스트를 구별하도록 훈련되었다는 뜻입니다) 분류기를 공개했습니다. 그 발표는 지금도 온라인에 남아 있고, 맨 위에 철회 안내가 추가되어 있습니다.

그 수치는 누군가의 독립적인 테스트가 아니라 발표 자체에 적혀 있습니다.

"In our evaluations on a 'challenge set' of English texts, our classifier correctly identifies 26% of AI-written text (true positives) as 'likely AI-written,' while incorrectly labeling human-written text as AI-written 9% of the time (false positives)." (영어 텍스트로 구성된 'challenge set'에 대한 자체 평가에서, 이 분류기는 AI가 쓴 텍스트의 26%를 'AI가 쓴 가능성이 높음'으로 정확히 식별했습니다. 이것이 참양성입니다. 반면 사람이 쓴 텍스트는 9%의 비율로 AI가 쓴 것으로 잘못 판정했습니다. 이것이 거짓양성입니다.)

26%만 잡아냈습니다. 사람이 쓴 글의 9%가 잘못 지적되었습니다. 게다가 이는 공급업체가 자사 모델의 출력을 학습 데이터로 쓸 수 있는 입장에서, 의도적으로 만든 시스템에 대해 스스로 내린 평가입니다.

첫 문단에는 더 자주 인용되어야 하는데도 잘 인용되지 않는 문장이 하나 있습니다. "it is impossible to reliably detect all AI-written text." (AI가 쓴 텍스트를 모두 안정적으로 탐지하는 것은 불가능합니다.)

스스로 공개한 한계

그 발표에는 한계에 대한 항목이 실려 있는데, 악용될 것을 예상한 사람들이 쓴 것처럼 읽힙니다. 해당 문서의 표현을 그대로 옮기면 다음과 같습니다.

  • "It should not be used as a primary decision-making tool, but instead as a complement to other methods of determining the source of a piece of text." (의사결정의 주된 도구로 사용되어서는 안 되며, 어떤 텍스트의 출처를 판단하는 다른 방법들을 보완하는 수단으로 사용되어야 한다는 뜻입니다.)
  • "The classifier is very unreliable on short texts (below 1,000 characters). Even longer texts are sometimes incorrectly labeled." (이 분류기는 1,000자 미만의 짧은 텍스트에서는 매우 신뢰할 수 없습니다. 더 긴 텍스트도 잘못 판정되는 경우가 있습니다.)
  • "Sometimes human-written text will be incorrectly but confidently labeled as AI-written by our classifier." (때때로 사람이 쓴 텍스트가 잘못되었지만 확신을 가지고 AI가 쓴 것으로 분류되기도 한다는 뜻입니다.)
  • "We recommend using the classifier only for English text. It performs significantly worse in other languages and it is unreliable on code." (이 분류기는 영어 텍스트에만 사용할 것을 권장합니다. 다른 언어에서는 성능이 크게 떨어지고, 코드에서는 신뢰할 수 없습니다.)
  • "Text that is very predictable cannot be reliably identified." (매우 예측 가능한 텍스트는 안정적으로 식별할 수 없습니다.) 여기에 제시된 예는 처음 1,000개의 소수를 나열한 목록입니다. "because the correct answer is always the same" (정답이 항상 같기 때문입니다).
  • "Classifiers based on neural networks are known to be poorly calibrated outside of their training data. For inputs that are very different from text in our training set, the classifier is sometimes extremely confident in a wrong prediction." (신경망 기반 분류기는 학습 데이터 밖에서 보정이 제대로 되지 않는 것으로 알려져 있습니다. 학습 세트의 텍스트와 매우 다른 입력에 대해서는, 이 분류기가 때때로 잘못된 예측을 극도로 확신하기도 합니다.)

세 번째 항목과 마지막 항목은 같은 현상을 두 번 서술한 것입니다. 확신과 정확성은 연결되어 있지 않습니다. 이런 도구가 "확실히 AI"라고 말하는 것은 "AI일 수도 있다"라고 말하는 것보다 강한 주장이 아닙니다. 같은 장치에 다른 숫자가 붙어 있을 뿐입니다.

그리고 철회되었습니다

같은 페이지 맨 위에는 다음과 같이 적혀 있습니다.

"As of July 20, 2023, the AI classifier is no longer available due to its low rate of accuracy." (2023년 7월 20일 기준으로, AI 분류기는 정확도가 낮아 더 이상 제공되지 않습니다.)

기업이 자사 제품을 철회하면서 그 이유로 정확도를 드는 것은, 이 분야에서 나올 수 있는 가장 깨끗한 증거에 가깝습니다. 그렇게 말하는 데에는 기업에도 비용이 따릅니다. 바로 그렇기 때문에 어느 쪽이든 제삼자의 의견보다 값어치가 있습니다.

채팅 모델은 분류기가 아닙니다

여기가 가장 반드시 짚어야 하는 부분입니다. 철회 소식이 마치 그 기능이 챗봇으로 옮겨간 것처럼 전해지는 경우가 있기 때문입니다. 옮겨가지 않았습니다. 그 분류기는 별도로 미세 조정된 모델이었고, 발표문에서는 "a language model fine-tuned on a dataset of pairs of human-written text and AI-written text on the same topic" (같은 주제에 대해 사람이 쓴 텍스트와 AI가 쓴 텍스트를 짝으로 묶은 데이터셋으로 미세 조정한 언어 모델이라는 뜻입니다)이라고 설명했으며, 신뢰도 임계값은 "to keep the false positive rate low" (오탐률을 낮게 유지하기 위해서입니다)라고 의도적으로 조정되어 있었습니다.

이 가운데 어느 것도 채팅 인터페이스를 설명하지 않습니다. 채팅 모델에 어떤 부분이 AI에 의해 쓰였는지를 물으면, 참조할 탐지 구성 요소가 없습니다. 그저 그런 질문 뒤에 흔히 이어지는 종류의 텍스트를 만들어 낼 뿐입니다. 자신감 있게 들리는 판정, 요청하시면 비율, 그리고 이유 목록이 나옵니다. 게다가 같은 부분에 대해 두 번째로 물으면 다른 판정이 나오는 일이 흔합니다.

결국 유통되는 스크린샷은 약한 측정이 아닙니다. 측정 자체가 아닙니다.

이것이 Turnitin에 대해 말하는 것과 말하지 않는 것

한 업체가 철회한 분류기는 다른 업체의 현재 제품에 대해 아무것도 말해 주지 않으며, 그것을 그렇게까지 끌어다 붙이는 것은 정직하지 않습니다.

Turnitin의 탐지기는 다른 시스템이며, 제작사가 다른 방식으로 설명하고 자체적으로 공개한 주장과 자체적으로 기록된 실패 사례를 갖고 있습니다. 탐지기들은 일반적으로 같은 부분에 대해서도 크게 의견이 갈리는데, 이는 자체 증거를 가진 별개의 문제이며 동일한 텍스트에서 탐지기들이 얼마나 갈리는지에 정리되어 있습니다. 그리고 오탐의 영향을 가장 크게 받는 집단도 문헌으로 확인되어 있으며, 영어가 모국어가 아니라면 특히 중요합니다. 비원어민 영어 작문에 대해 연구가 보여주는 것을 참고하십시오.

여기서 할 수 있는 좁은 주장은 출처가 뒷받침하는 유일한 것입니다. 채팅 모델에 무엇이 AI에 의해 쓰였는지를 묻는 것은 탐지가 아닙니다. 그리고 가장 널리 알려진 채팅 모델을 만든 회사는 목적에 맞게 만든 분류기를 공개하고, 성능을 측정한 뒤 철회했습니다.

이런 방식으로 지적을 받으셨다면

여러분의 소속 기관 절차를 안다고 하는 척하지 않고, 실질적인 틀만 제시하겠습니다.

  1. 그 주장이 무엇에서 비롯되었는지 확인하십시오. "지적을 받았다"는 말은 리포트를 갖춘 기관의 탐지기를 뜻할 수도 있고, 누군가 여러분의 글을 챗봇에 붙여넣었다는 뜻일 수도 있습니다. 두 상황은 다르며, 문서가 함께 나오는 것은 하나뿐입니다.
  2. 리포트가 있다면 그것을 요청하십시오. 리포트에는 지적된 부분과 그 위치가 담겨 있습니다. 채팅 창의 스크린샷에는 문장 하나만 있습니다.
  3. 채팅 모델에 같은 질문을 두 번 하십시오. 같은 부분에 대해, 새로운 세션 두 개에서 물어보시면 됩니다. 불안정성은 주장하는 것이 아니라 실제로 보여 주실 수 있는 성질입니다.
  4. 이 가운데 어떤 것도 먼저 꺼내지 마십시오. 설득력이 있는 것은 절차와 출처이며, 도구에 관한 논쟁이 통하는 경우는 드뭅니다. 기술적인 이의를 먼저 제기하면 질문을 피하는 것으로 읽힐 수 있습니다.

우리가 이 문제에서 서 있는 위치

우리는 문서를 다시 쓰는 일을 하므로 분명히 말씀드립니다. 위의 내용은 탐지가 작동하지 않는다는 주장이 아니며, 우리는 그런 주장을 팔지 않습니다. HumanPen 도구는 실제 리포트가 있고 특정 부분에 표시가 있는 상황을 위한 것입니다. 그 표시가 편집 범위의 경계가 되며, 그 밖의 부분은 건드리지 않습니다.

여러분의 상황이 리포트 없이 챗봇 스크린샷만 있는 경우라면, 그것은 다시 쓰기의 문제가 아닙니다. 해야 할 대화가 있는 것이며, 위의 자료는 우리가 그 자리에 가져갈 것입니다.

자주 묻는 질문

ChatGPT는 텍스트가 AI에 의해 쓰였는지 알 수 있습니까? OpenAI는 채팅 모델을 쓰는 대신 이 작업을 위해 별도의 분류기를 만들었고, 정확도를 공개한 뒤 정확도가 낮다는 이유로 2023년 7월에 철회했습니다. 채팅 인터페이스에는 참조할 탐지 구성 요소가 없습니다.

OpenAI 분류기의 수치는 어떠했습니까? 영어 텍스트로 구성된 'challenge set'에서 AI가 쓴 텍스트의 26%를 정확히 식별했고, 사람이 쓴 텍스트를 9%의 비율로 AI가 쓴 것으로 잘못 판정했습니다.

왜 챗봇은 그렇게 확신에 차서 말합니까? OpenAI가 공개한 자체 한계에는 이런 분류기가 "extremely confident in a wrong prediction" (잘못된 예측을 극도로 확신하기도 한다는 뜻입니다)이라고 적혀 있습니다. 채팅 모델의 확신에 찬 어조는 그 모델의 글쓰기 방식에서 나오는 성질이며, 여러분의 텍스트에 대한 증거가 아닙니다. 두 번 물으면 서로 다른 답이 나오는 일이 흔합니다.

그렇다면 Turnitin의 AI 탐지도 작동하지 않는다는 뜻입니까? 그것에 대해서는 아무것도 말하지 않습니다. 업체가 다르고, 시스템이 다르며, 공개된 주장도 다릅니다. 이 출처가 뒷받침하는 것은 오직 하나, 채팅 모델을 탐지기로 사용하는 것은 탐지가 아니라는 점입니다.

계속 읽기