포스터 발표와 AI 탐지: 점수가 신뢰할 수 없게 되는 이유
포스터 발표는 글머리 기호, 짧은 라벨, 표 항목으로 구성됩니다. Turnitin FAQ는 모델이 글머리 기호나 비산문 콘텐츠에서 AI를 신뢰할 수 있게 탐지하지 않는다고 말합니다. 하나의 도움말 문서가 표를 신뢰할 수 없는 목록에 추가합니다. 그 결과, 백분율과 강조되는 내용 사이에 큰 격차가 생깁니다. 다음은 포스터 형식 문서에서 이 메커니즘이 어떻게 작동하는지, 그리고 점수가 왜 오해의 소지가 있을 수 있는지에 대한 설명입니다.
HumanPen 팀
· 5분
간단한 답변
포스터는 에세이나 저널 논문처럼 작성되지 않습니다. 글머리 기호, 짧은 구, 시각적 요소에 의존합니다. Turnitin 문서는 모델이 적격 산문 문장만 분석하며 비산문 형식의 AI를 신뢰할 수 있게 탐지하지 않는다고 말합니다. 포스터가 문서로 제출되면, 백분율은 작은 산문 부분을 반영하는 반면 강조 표시는 거의 아무것도 보여주지 않을 수 있습니다. 둘 사이의 불일치는 알려진 동작이며 결함이 아닙니다.
글머리 기호는 적격 텍스트가 아닙니다
FAQ는 무엇이 적격 텍스트로 간주되는지에 대해 명확합니다:
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. (이 적격 텍스트에는 산문 문장만 포함되며, 이는 표준 문법적 문장으로 작성된 텍스트 블록만 분석하고 목록, 글머리 기호(짧은 비문장 구조) 또는 기타 비문장 구조와 같은 다른 유형의 글쓰기를 포함하지 않음을 의미합니다.)"
FAQ는 또한 다음과 같이 명시합니다:
"The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures). (모델은 비산문 또는 코드 형태의 AI 생성 텍스트를 신뢰할 수 있게 탐지하지 않으며, 글머리 기호(짧은 비문장 구조)와 같은 단문/비관습적 글쓰기도 탐지하지 않습니다.)"
다음 문장이 결과를 설명합니다:
"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights. (이는 여러 다른 유형의 글쓰기를 포함하는 문서가 백분율과 강조 표시 사이의 불일치를 초래함을 의미합니다.)"
포스터의 경우, 이 불일치는 극단적입니다. 포스터에 있는 텍스트의 대부분은 글머리 기호나 짧은 라벨입니다. 포스터를 문서로 제출하고 높은 AI 백분율을 받은 경우, 그 백분율은 겨우 몇 개의 적격 산문 단락에 기반할 수 있으며, 포스터의 대부분을 차지하는 글머리 기호는 탐지기에 보이지 않습니다.
하나의 도움말 문서가 표를 목록에 추가합니다
Turnitin 도움말 문서 Using the AI Writing Report 는 모델의 한계가 FAQ 목록보다 더 넓다고 말합니다:
"The model does not reliably detect AI-generated text in the form of non-prose, such as poetry, scripts, or code, nor does it detect short-form/unconventional writing such as bullet points, tables, or annotated bibliographies. (모델은 비산문(예: 시, 대본, 코드) 형태의 AI 생성 텍스트를 신뢰할 수 있게 탐지하지 않으며, 글머리 기호, 표, 주석이 달린 서지사항과 같은 단문/비관습적 글쓰기도 탐지하지 않습니다.)"
해당 문서의 다음 문장:
"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights. (이는 여러 다른 유형의 글쓰기를 포함하는 문서가 백분율과 강조 표시 사이의 불일치를 초래함을 의미합니다.)"
포스터는 결과, 비교, 타임라인에 자주 표를 사용합니다. 표가 신뢰할 수 있게 탐지되지 않는 것으로 나열된 경우, 포스터 콘텐츠의 상당 부분이 모델의 신뢰할 수 있는 범위 밖에 속합니다. 보이는 백분율은 표와 글머리 기호 목록 사이에 끼인 몇 안 되는 산문 단락에서 계산될 수 있습니다.
2023년에 표에서 일어난 일
2023년 8월의 중요한 업데이트가 있습니다. 릴리스 노트는 다음과 같이 말합니다:
"We are now able to process long-form prose text in tables. (이제 표 내의 장문 산문 텍스트를 처리할 수 있습니다.)"
다음 문장은 다음과 같습니다:
"Resubmit to reprocess existing submissions that contain tables. (표를 포함하는 기존 제출물을 다시 처리하려면 다시 제출하십시오.)"
이는 표 셀 내의 완전한 문법적 문장(장문 산문 문장)을 포함하는 표가 이제 처리됨을 의미합니다. 표 내의 짧은 라벨, 숫자, 데이터 항목은 여전히 비산문이며 모델 분석 밖에 남아 있습니다. 포스터의 경우, 이는 부분적인 개선입니다. 각 셀에 완전한 문장이 있는 결과 표는 이제 분석될 것입니다. 단순한 숫자와 짧은 라벨만 있는 표는 그렇지 않습니다.
탐지 메커니즘과 포스터 콘텐츠
FAQ는 제출물이 어떻게 처리되는지 설명합니다:
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. (논문이 Turnitin에 제출되면, 제출물에서 문장이 추출되어 예측 분석을 위해 겹치는 섹션으로 분할됩니다. 각 세그먼트는 AI 탐지 모델에 의해 분류되며, 텍스트가 인간 또는 AI 생성일 확률을 나타내는 0과 1 사이의 값을 받습니다. 이러한 세그먼트 내의 각 적격 문장은 세그먼트의 점수를 상속받습니다.)"
적격 산문 문장만 추출됩니다. 그런 다음 집계가 문서 수준 점수를 생성합니다:
"These sentence scores are further aggregated and used to compute the overall document AI writing score. (이러한 문장 점수는 추가로 집계되어 전체 문서 AI 작성 점수를 계산하는 데 사용됩니다.)"
포스터의 경우, 추출 단계에서 매우 적은 수의 문장만 가져올 수 있습니다. 포스터의 몇 안 되는 산문 단락은 초록, 짧은 서론, 결론적 언급일 수 있습니다. 나머지는 모두 글머리 기호와 표 항목입니다. 점수는 그 작은 산문 집합에서 계산되며, 좁은 표본을 반영함을 의미합니다. Turnitin AI 작성 보고서 읽는 법은 숫자와 페이지 사이의 같은 격차에서 출발합니다.
짧은 문서와 전부 아니면 전무 문제
문서로 제출되는 포스터는 짧습니다. FAQ는 이에 대해 경고합니다:
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. (수백 단어만 있는 더 짧은 문서에서는 겹칠 기회 없이 단일 세그먼트에 대해 예측하기 때문에 예측은 대부분 '전부 아니면 전무'가 됩니다.)"
다음 문장:
"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. (이는 AI 생성 콘텐츠와 원본 콘텐츠가 혼합된 일부 텍스트가 완전히 AI 생성으로 표시될 수 있음을 의미합니다.)"
적격 산문이 300 또는 400단어밖에 안 되는 포스터는 정확히 이 범위에 해당합니다. 이렇게 적은 세그먼트로는 평균화 효과가 없습니다. 높은 점수를 받은 단일 세그먼트가 전체 문서를 AI 생성으로 표시할 수 있습니다. 백분율과 강조 표시 사이의 불일치에 관한 FAQ의 다음 문장은 여기서 매우 눈에 띄게 됩니다. 높은 백분율을 보지만 포스터 자체에는 강조된 텍스트가 거의 없을 수 있으며, 이는 AI 작성 점수가 누락되거나, 일관성이 없거나, 다운로드되지 않는 이유의 사례 중 하나입니다.
오탐지와 포스터의 반복적인 언어
FAQ는 오탐지를 유발하는 경향이 있는 것을 설명합니다:
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. (때때로 오탐지(인간이 작성한 텍스트를 AI 생성으로 잘못 표시)는 구조적 변화가 많지 않은 콘텐츠, 문자 그대로 자신을 반복하는 텍스트, 또는 새로운 아이디어를 발전시키지 않고 바꾸어 쓴 텍스트를 포함할 수 있습니다.)"
포스터 산문은 반복적이 되는 경향이 있습니다. 동일한 주요 발견이 초록, 결과 섹션, 결론에 나타납니다. 공간이 제한되어 있기 때문에 언어가 압축되고 균일하며, 균일성은 AI 탐지기가 측정하는 것이 분류기가 포착하고 있다고 말하는 것에 가깝습니다. FAQ는 계속됩니다:
"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated. (지표가 그러한 텍스트에서 더 많은 양의 AI 작성을 표시하는 경우, 표시된 백분율을 볼 때 그것을 고려에 넣기를 권장합니다.)"
포스터의 경우, 이 조언은 이중으로 관련이 있습니다. 산문은 짧고, 반복적이며, 구조적으로 균일합니다. 세 가지 요소 모두 오해의 소지가 있는 점수의 위험을 복합적으로 증가시킵니다.
귀하에게 이것이 의미하는 바
포스터 발표가 Turnitin AI 점수를 받은 경우, 다음 사항을 명심하십시오:
- 글머리 기호와 짧은 라벨은 적격 텍스트가 아닙니다. 점수는 이를 반영하지 않습니다.
- Turnitin의 하나의 도움말 문서는 표도 신뢰할 수 있게 탐지되지 않는다고 말하지만, 2023년 8월부터 표 내의 장문 산문이 처리되고 있습니다.
- 백분율과 강조 표시 사이의 불일치는 혼합 형식 문서에 대해 예상되는 동작입니다.
- 짧은 적격 산문은 세그먼트 중첩이 최소화된 "전부 아니면 전무" 예측을 유발합니다.
- 포스터 산문은 반복적이고 균일하여 FAQ가 설명하는 오탐지 프로필과 일치합니다.
- 강조 표시가 적은 높은 백분율은 최종 판결이 아닌 주의를 기울여 처리해야 합니다.
표시된 구절을 처리하려면, Turnitin 보고서를 가져오십시오 그리고 작업하십시오. 적격 구절은 무료로 다시 실행할 수 있습니다.
계속 읽기