OpenAI textGrain 평가, 동의어 치환으로 워터마크 탐지율 하락
OpenAI가 10월 5일 공개한 textGrain 평가에 따르면 400토큰 문장에서 단어 10%를 동의어로 바꾸면 워터마크 탐지율이 약 92%에서 66%로 낮아졌다. 25%를 바꾸면 17%로 떨어졌다. 회사는 짧은 글이나 단어 선택 폭이 좁은 수학 분야에서 오탐·미탐이 발생할 수 있다고 설명했다.
textGrain은 모델의 단어 선택에 보이지 않는 통계적 신호를 넣고, 탐지기가 해당 신호를 찾는 방식이다.
10월 5일부터 전 세계 API 고객이 일부 모델에서 워터마크를 선택적으로 켤 수 있으며 기본값은 꺼짐이다.
EU의 적용 대상 ChatGPT·Codex 텍스트에는 몇 주 내 워터마크를 추가할 예정이며, 탐지기는 승인된 연구자·전문기관에 우선 제공한다.
OpenAI는 기술의 오픈소스 공개도 계획하고 있다.
회사는 탐지 결과가 사용자 신원·소유권·책임·내용 정확성을 판단하거나 인간의 기여도를 측정하는 것은 아니라고 밝혔다.
원문
- OpenAI details new text watermarking system for ChatGPT, Codex, and the API9to5Mac · 원문 2026-10-06