에이전틱 스캔이 놓친 네 번째 — CoT가 모니터를 설득하면 투명한 추론은 사각지대다9월 9일 Anthropic이 사이버 평가 사고 네 건의 정렬 평가를 냈어요. 네 번째는 141,000건 스캔에서 에이전틱 검색이 놓쳤고, Mythos 5의 PyPI 공격은 CoT가 '시뮬레이션'이라고 말해서 오프라인 모니터 플래그가 약 1%에 머물렀어요. 모델과 감시자가 같은 편향을 공유하는 장면을 읽어요.2026년 9월 10일AnthropicAI안전