핵심 요약
- 앤트로픽의 SynthID-Text 워터마크 적용 발표 이후, 워터마크 토큰 샘플링이 AI 모델의 안전성 및 에이전트 도구 호출 동작에 오작동을 유발한다는 연구가 발표되었습니다.
- 문장에서는 미세한 어휘 차이에 불과하지만, AI 에이전트가 사용하는 JSON 파라미터나 함수 호출 인자가 왜곡되면서 엉뚱한 도구를 실행하는 '샘플링 드리프트' 문제가 발생합니다.
- 규제 준수를 위한 출처 표기 조치가 역으로 프롬프트 인젝션 방어 취약 및 에이전트 오작동을 초래하는 '보안세'가 될 수 있다는 분석입니다.
요약 최근 앤트로픽(Anthropic)이 차세대 클로드(Claude) 모델 출력물에 구글 딥마인드의 'SynthID-Text'를 기반으로 한 비가시적 워터마크를 도입하겠다고 발표하면서 AI 보안 분야에서 뜻밖의 논란이 불거졌습니다. EU AI Act 등 글로벌 규제에 대응해 AI 생성 텍스트의 출처를 밝히기 위한 기술적 조치였지만, 연구진 분석 결과 이 워터마크가 AI 에이전트의 작동 방식을 왜곡하는 예상치 못한 부작용을 일으키는 것으로 나타났습니다.
SynthID-Text는 모델이 다음 토큰을 생성하는 과정에 직접 개입하는 토너먼트 샘플링 방식을 사용합니다. 겉보기에는 문장의 품질이 떨어지지 않는 것처럼 보여도, 특정 워터마크 키가 적용되는 순간 토큰 샘플링 과정에서 미세한 변화(샘플링 드리프트)가 발생하게 됩니다. 일반적인 글 작성에서는 단어 선택이 살짝 바뀌는 수준에 그치지만, JSON 등 정형 데이터를 다루며 외부 도구를 실행하는 AI 에이전트 환경에서는 치명적인 결과로 이어질 수 있습니다.
실제로 함수 이름이나 중괄호 같은 구조는 고정되어 있더라도 파라미터 값, 쿼리, 파일 경로, 수신자 등의 값은 모델의 불확실성이 높은 구간이기 때문에 워터마크 알고리즘에 의해 토큰이 쉽게 변경됩니다. 이는 결국 에이전트가 호출하는 툴의 인자값을 바꾸거나 잘못된 툴을 실행하는 오류로 직결됩니다.
더 심각한 문제는 보안 및 유해성 차단(Refusal) 기능의 변화입니다. 프롬프트 인젝션 공격에 노출되었을 때 워터마크로 인해 거부 반응이 약화될 수 있으며, 이때 에이전트가 외부 툴에 접근할 권한까지 가지고 있다면 모델의 단순한 말실수를 넘어 시스템 차원의 위험한 실행으로 이어질 수 있습니다. 출처 표기를 위해 의무화된 워터마크가 도리어 AI 에이전트 개발자들에게 일종의 '보안세(Provenance Tax)'로 작용하고 있다는 지적입니다.
Sponsored · 광고