“클로드, AI 텍스트에 워터마크 심기 시작”… LLM 워터마킹 기술은 어떻게 작동하나

Anthropic이 2026년 8월부터 Claude의 생성 텍스트에 워터마크를 삽입한다고 발표했으며, 이는 EU AI Act 제50조 투명성 규범에 따른 것이다. 텍스트 워터마킹은 LLM의 단어 선택 확률을 미세하게 편향시켜 통계적으로 감지 가능한 패턴을 만들며, Google의 SynthID-Text와 같은 distortion-free 기법이 품질 저하 없이 구현되고 있다. 최신 연구는 토큰 수준을 넘어 의미 공간에 워터마크를 삽입하여 패러프레이즈 공격에도 강건한 방법을 개발 중이다.

AI 요약

Anthropic이 2026년 8월, EU AI Act 제50조 투명성 규범에 서명하면서 Claude의 생성 텍스트에 기계 판독 가능한 워터마크를 전 세계적으로 삽입하기 시작했다. 텍스트 워터마킹은 LLM이 다음 토큰을 선택할 때의 확률적 '흔들림'에 비밀키 기반의 편향을 주입하는 방식으로, KGW 방법(2023)에서 출발해 Gumbel-Max 트릭 기반의 distortion-free 방식, Google DeepMind의 SynthID-Text(토너먼트 샘플링), 의미 공간에 워터마크를 심는 SemStamp와 PASA(2026)까지 진화했다. 주요 과제는 품질 저하와 패러프레이즈(의역) 공격에 대한 취약성이었으며, 최신 연구는 '누가 생성했는지'까지 식별하는 페이로드 삽입 방향으로 확장되고 있다.

핵심 포인트

  • Anthropic은 2026년 8월 2일 이후 출시 모델부터 EU 지역에 한정하지 않고 전 세계 텍스트 출력에 워터마크 적용
  • KGW법(2023, Kirchenbauer)은 직전 토큰 기반 의사난수로 어휘를 그린/레드 리스트로 나누고 그린 리스트 로짓에 보너스를 부여하는 방식
  • Google SynthID-Text는 Tournament sampling으로 출력 분포를 보존하면서 2,000만 건 규모 실전 트래픽에서 검증 완료
  • PASA(2026)는 의미 클러스터에 비밀키 기반 공유 난수를 연결해 '왜곡 없음'과 '의역 내성'을 동시에 달성

향후 전망

  • 워터마크가 'AI 생성 여부'를 넘어 사용자 ID, 타임스탬프 등 페이로드 정보를 담는 방향으로 발전할 전망
  • 의미 공간 기반 워터마킹이 주류가 되면서 의역 공격에 대한 내성이 크게 개선될 것으로 기대
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...