한 줄 요약
AI 생성 텍스트의 대규모 모니터링을 위한 최대우도 기반 추정 모델을 제안하고, AI 학회 리뷰 데이터를 통해 6.5~16.9%의 텍스트가 LLM에 의해 수정되었을 가능성을 분석한다.
핵심 기여도
- 최대우도 추정(MLE)을 기반으로 AI 생성 텍스트 비율을 대규모 코퍼스에서 추정하는 방법 제안.
- ICLR 2024, NeurIPS 2023, CoRL 2023, EMNLP 2023 리뷰 데이터를 대상으로 6.5~16.9%의 텍스트가 LLM에 의해 수정되었을 가능성을 제시.
- AI 생성 텍스트가 리뷰 신뢰도가 낮고, 마감 직전에 제출되며, 저자 반박에 응답하지 않는 리뷰에 더 많이 나타남을 밝힘.
- 기존 AI 텍스트 탐지 방법 대비 1000만 배 이상 빠르고, 추정 오차를 3.4배, 4.6배 감소시킴.
핵심 아이디어
기존 AI 텍스트 탐지 방법은 개별 텍스트를 분석하는 방식이지만, 본 연구는 대규모 코퍼스에서 AI 생성 텍스트의 비율을 추정하는 **분포 기반 GPT 정량화**(distributional GPT quantification) 모델을 제안한다. 이 모델은 **최대우도 추정**(MLE)을 활용하여, **사전에 알려진 인간 작성 텍스트와 AI 생성 텍스트**를 기반으로 **불확실한 출처의 텍스트**를 분석한다.
핵심 통찰은, AI 생성 텍스트는 개별적으로는 감지가 어려우나, **대규모 코퍼스에서 특정 어휘(예: "commendable")의 빈도가 인간 작성 텍스트와 차이를 보인다는 점**을 활용하여 통계적으로 추정할 수 있다는 것이다. 이는 **단어 빈도 분포**(token frequency)를 기반으로 **복합 확률 분포**(compound probability distribution)를 구성하는 방식이다.
기술적 접근법
- **모델 구조**: 최대우도 추정(MLE) 기반의 분포 기반 GPT 정량화(distributional GPT quantification) 모델.
- **데이터**: ICLR 2024, NeurIPS 2023, CoRL 2023, EMNLP 2023 리뷰 데이터.
- **추정 방식**: 인간 작성 텍스트와 AI 생성 텍스트의 분포를 비교하여, **α (AI 생성 텍스트 비율)**를 추정.
- **성능**: 기존 AI 텍스트 탐지 방법 대비 **10^7배 빠르고**, **in-distribution 추정 오차 3.4배 감소**, **out-of-distribution 추정 오차 4.6배 감소**.
- **어휘 기반 분석**: 특정 형용사, 부사, 명사의 빈도를 기반으로 확률 분포를 구성하여 추정 정확도를 높임.
주요 결과
- **ICLR 2024, NeurIPS 2023, CoRL 2023, EMNLP 2023** 리뷰 데이터에서 **6.5~16.9%의 텍스트가 LLM에 의해 수정되었을 가능성이 있음**.
- **AI 생성 텍스트는 리뷰 신뢰도가 낮고**, **마감 직전에 제출되며**, **저자 반박에 응답하지 않는 리뷰에 더 많이 나타남**.
- **Nature 계열 저널 리뷰에서는 AI 생성 텍스트 증가 추세가 관찰되지 않음**.
- **형용사 "commendable" 등의 빈도가 AI 생성 텍스트에서 인간 작성 텍스트보다 높음** (Supp. Table 2, 3).
의의 및 한계
본 연구는 **AI 생성 텍스트의 대규모 코퍼스 수준 분석**을 가능하게 하며, **학술 리뷰 시스템 내 AI 사용의 영향을 정량적으로 평가**할 수 있는 기초를 제공한다. 특히, **개별 텍스트 수준에서 감지가 어려운 AI 생성 텍스트의 집단적 특성을 통계적으로 분석**할 수 있다는 점에서 학술적 의의가 있다.
한계로는, **AI 생성 텍스트 비율 추정이 정량적 추정치일 뿐, 개별 텍스트의 생성 여부를 확정하지는 못함**. 또한, **Nature 계열 저널에서는 AI 사용 증가가 관찰되지 않았으나, 그 이유에 대한 심층 분석은 제시되지 않음**.
실용적 활용
본 연구는 **학술 리뷰 시스템, 언론, 교육 등 AI 생성 텍스트가 높은 영향을 미치는 정보 시스템**에서 **AI 사용 추이를 모니터링**하는 데 활용될 수 있다. 특히, **리뷰 마감일에 가까울수록 AI 사용률이 높아지는 경향**을 바탕으로, **리뷰 제출 시스템 개선**이나 **AI 도구 사용 정책 수립**에 기여할 수 있다.