Pulse 게시 ·

OpenAI 텍스트 워터마크, 동의어로 10% 바꾸자 탐지율 하락

TechCrunch가 OpenAI의 텍스트 워터마크 기술 textGrain과 시험 결과를 소개했다. 단어 선택에 비가시적 패턴을 남겨 복사·붙여넣기 뒤에도 유지하지만, 단어 10%를 동의어로 바꾼 한 시험에서는 탐지율이 약 92%에서 66%로 떨어졌다. 짧은 문장·수학 답변·번역문도 탐지가 더 어렵다고 회사는 설명했다.

textGrain은 비밀 키로 다음 단어 예측을 분류하고 단어 선택에 패턴을 누적하며, 탐지기는 텍스트와 키를 사용한다.

EU의 대상 ChatGPT·Codex 이용자에게 향후 몇 주간 순차 적용하고, 전 세계 API 개발자는 일부 모델에서 선택적으로 활성화할 수 있다. API 기본값은 꺼짐이다.

OpenAI는 워터마크가 사용자를 식별하지 않으며, 활성화에 따른 모델 성능의 유의미한 변화는 관찰하지 못했다고 밝혔다.

탐지기 초기 접근은 승인된 연구자와 전문기관으로 제한하며, 워터마크가 없다는 이유만으로 사람이 쓴 글이라고 판단할 수는 없다.

복사로는 유지되는 표시도 편집에는 약해, 원문과 수정본 사이에서 탐지 가능성이 달라질 수 있다.

원문

앞선 소식 보기