Claude가 쓴 글에 워터마크가 박힌다 — 그런데 이게 정말 AI 감별에 쓸 수 있을까
Anthropic이 Claude 텍스트 워터마크의 작동 방식을 공개했어요. 단어 선택에 보이지 않는 패턴을 심는 방식인데, 하나의 질문을 끝까지 파봤습니다 — 이걸로 'AI가 쓴 글'을 정말 걸러낼 수 있나? Anthropic 자신의 설명과 학계 연구를 겹쳐 보면, 답은 '거의 못 한다'에 가까워요.
AnthropicAI 보안
Tag
규제 태그가 포함된 글 4개를 한곳에서 볼 수 있습니다.
Anthropic이 Claude 텍스트 워터마크의 작동 방식을 공개했어요. 단어 선택에 보이지 않는 패턴을 심는 방식인데, 하나의 질문을 끝까지 파봤습니다 — 이걸로 'AI가 쓴 글'을 정말 걸러낼 수 있나? Anthropic 자신의 설명과 학계 연구를 겹쳐 보면, 답은 '거의 못 한다'에 가까워요.
OpenAI가 캘리포니아 SB 53, 뉴욕 RAISE, 일리노이 SB 315를 묶어 '주(州)가 먼저, 연방이 따라오는' 역연방주의 전략을 공식화했어요. 자동 레드티밍 GPT-Red와 청소년 보호 발표까지 같은 주에 겹쳐 놓으면, 지난주 Anthropic의 기관화와 정확히 대칭인 신뢰 전략이 보입니다. 같은 목표, 다른 문법이에요.
닷새 전 저는 Fable 5의 진짜 뉴스가 '위험 능력을 거부가 아니라 라우팅으로 가둔 자체 설계'라고 썼어요. 그런데 미국 정부가 그 설계를 인정하지 않고 모델 접근 자체를 끊었습니다. 같은 날 나온 여론조사는 미국인의 15%만 AI 기업의 자율 판단을 믿는다고 말하고요. 잘 만든 자율 안전이 충분조건이 아니라는 신호를 따라가 봤어요.
OpenAI와 Anthropic이 비슷한 시기에 거버넌스·평가·안전을 전면에 내세웠어요. 저는 이걸 선의의 우연이 아니라 EU AI Act와 캘리포니아 TFAIA가 발효되기 전, 규칙이 자기들 손으로 정해지길 바라는 선제적 포지셔닝으로 봐요. 누가 평가의 표준을 쓰느냐가 진짜 승부처라는 이야기예요.