AI 요약
Anthropic이 2026년 8월, EU AI Act 제50조 투명성 규범에 서명하면서 Claude의 생성 텍스트에 기계 판독 가능한 워터마크를 전 세계적으로 삽입하기 시작했다. 텍스트 워터마킹은 LLM이 다음 토큰을 선택할 때의 확률적 '흔들림'에 비밀키 기반의 편향을 주입하는 방식으로, KGW 방법(2023)에서 출발해 Gumbel-Max 트릭 기반의 distortion-free 방식, Google DeepMind의 SynthID-Text(토너먼트 샘플링), 의미 공간에 워터마크를 심는 SemStamp와 PASA(2026)까지 진화했다. 주요 과제는 품질 저하와 패러프레이즈(의역) 공격에 대한 취약성이었으며, 최신 연구는 '누가 생성했는지'까지 식별하는 페이로드 삽입 방향으로 확장되고 있다.
핵심 포인트
- Anthropic은 2026년 8월 2일 이후 출시 모델부터 EU 지역에 한정하지 않고 전 세계 텍스트 출력에 워터마크 적용
- KGW법(2023, Kirchenbauer)은 직전 토큰 기반 의사난수로 어휘를 그린/레드 리스트로 나누고 그린 리스트 로짓에 보너스를 부여하는 방식
- Google SynthID-Text는 Tournament sampling으로 출력 분포를 보존하면서 2,000만 건 규모 실전 트래픽에서 검증 완료
- PASA(2026)는 의미 클러스터에 비밀키 기반 공유 난수를 연결해 '왜곡 없음'과 '의역 내성'을 동시에 달성
향후 전망
- 워터마크가 'AI 생성 여부'를 넘어 사용자 ID, 타임스탬프 등 페이로드 정보를 담는 방향으로 발전할 전망
- 의미 공간 기반 워터마킹이 주류가 되면서 의역 공격에 대한 내성이 크게 개선될 것으로 기대
출처:hatena (Zenn)
