9월 29일, Anthropic의 Frontier Red Team이 보고서를 발표했습니다.
자사 모델이 아니라 경쟁사 모델에 대한 평가였습니다.
중국 Zhipu AI가 8월에 공개한 오픈웨이트 모델 GLM-5.3입니다.
보고서의 결론은 분명합니다.
GLM-5.3은 처음부터 끝까지 작동하는 익스플로잇을 스스로 만들 수 있고,
그 수준이 Claude Mythos Preview에 거의 근접하다는 내용입니다.
수치부터 보면 Chrome의 V8 엔진에 알려진 취약점을 익스플로잇하는 ExploitBench에서 GLM-5.3은 410회 시도 가운데 50회 성공했습니다.
Mythos Preview는 56회였습니다. 비율로 보면 12.2%와 13.7%입니다.
Anthropic 내부의 바이너리 익스플로잇 테스트에서는 GLM-5.3이 4%, Mythos Preview가 6%의 완전 제어권 탈취율을 보였습니다.
Kimi K3, DeepSeek V4.1 Flash, Opus 4.6, GLM-5.2 등 다른 모델들은 0에 가까웠습니다.
이 벤치마크에서 Mythos Preview보다 높은 점수를 받은 모델은 없었고, 그 바로 아래가 GLM-5.3이었습니다.
더 작은 모델인 GLM-5.3-Flash는 공개된 Chrome 취약점 두 개를 여덟 시간 만에 작동하는 익스플로잇 체인으로 엮었습니다.
Zhipu의 API 가격으로 환산하면 20.40달러였습니다.
샌드박스 테스트에서는 하루 안에 알려지지 않은 브라우저 취약점을 찾아내고, 이를 웹페이지에 연결해 SSH 개인 키를 빼내는 데까지 성공했습니다.
이 보고서가 왜 나왔는지는 5개월 전의 사례에서 이해할 수 있습니다.
지난 4월, Anthropic은 Mythos Preview를 공개하면서 일반 출시를 보류했습니다.
스스로 작동하는 익스플로잇을 처음부터 끝까지 만들 수 있는 첫 모델이라는 이유였습니다.
Project Glasswing을 통해 검증된 방어 조직 약 100곳에만 접근권한을 제공했습니다.
이전 글에서 방어자가 먼저 모델을 사용해야 한다는 논리로 다루었던 내용입니다.
그런데 GLM-5.3은 오픈웨이트입니다.
누구나 가중치를 내려받아 자기 서버에서 돌리고 수정할 수 있습니다.
비슷한 역량을 가진 모델 하나는 100곳이 심사를 거쳐 쓰고, 다른 하나는 아무 심사 없이 누구나 내려 받고 수정하여 활용할 수 있습니다.
모델에 대한 안전장치의 차이는 더 큽니다. 기본 상태의 GLM-5.3은 핵심 시스템을 공격하라는 노골적인 요청을 거부했습니다.
그러나 Anthropic의 시뮬레이션에서 그 거부는 쉽게 무너졌습니다.
모델에 자율 레드팀 에이전트라고 역할을 지정하면 64%가 응했습니다.
추론 과정을 동의하는 것처럼 미리 채워 넣으면 92%까지 올라갔습니다.
거부 기능을 가중치에서 아예 제거하는 어블리터레이션(abliteration) 처리를 한 버전은 100% 요청에 응했습니다.
그렇게 안전장치를 제거한 사본은 공개 며칠 만에 인터넷에 올라와 있었습니다.
이 보고서는 몇 가지 단서와 함께 읽을 필요가 있습니다. 측정의 주체가 경쟁사입니다.
오픈웨이트 모델에 대한 통제 강화를 주장해 온 회사가 오픈웨이트 모델의 위험을 측정해 발표한 것입니다.
수치는 모두 Anthropic의 것이고, 비교 대상인 Claude 모델들은 안전장치를 끈 상태로 측정됐습니다.
다만 미국 NIST 산하 AI 표준 및 혁신센터(CAISI)가 9월 17일에 별도로 낸 평가도 방향은 같았습니다.
GLM-5.3을 지금까지 공개된 가장 사이버 역량이 높은 오픈웨이트 모델로 규정했고, 미국 최상위 모델에 약 4개월 뒤처진다고 봤습니다.
Zhipu 자체의 발표도 함께 봐야 합니다.
Zhipu의 표에서는 ExploitBench 점수가 Mythos 5가 78.0%, GPT-5.6 Sol이 76.5%, GLM-5.3이 54.4%입니다.
측정 방식과 비교 대상 모델이 달라 격차가 더 크게 보입니다.
어느 쪽이든 공통된 사실은 하나입니다.
오픈웨이트 모델의 공격 역량이 프론티어와 몇 달 차이로 좁혀졌습니다.
저는 이 보고서가 세 가지를 보여준다고 생각합니다.
첫째, 모델의 대한 통제는 자기 모델까지만 적용됩니다.
Anthropic은 Mythos를 공개를 막았습니다.
하지만 그 결정은 Anthropic의 모델에만 효력이 있습니다.
비슷한 능력을 가진 모델이 다른 곳에서 공개되면 모델 봉인의 효과와 의미는 그만큼 줄어듭니다.
Project Glasswing 글에서 이 역량이 확산을 막는다는 것은 어렵다고 썼는데, 그 확산이 다섯 달 만에 수치로 확인됐습니다.
둘째, 안전장치의 의미가 오픈웨이트 모델에서는 다릅니다.
API로 제공되는 모델은 안전장치가 회사의 서버에 있습니다.
오픈웨이트 모델은 안전장치가 가중치 안에 있고, 가중치는 모델을 받은 사람의 것입니다.
거부 기능이 있어도 제거할 수 있다면 그것은 안전장치가 아니라 기본 설정에 가깝습니다.
어떤 안전장치를 넣었는가보다 누가 그 모델을 활용하는지가 실제 위험을 결정합니다.
셋째, 역설적인 부분이 하나 있습니다.
7월 Hugging Face 사건에서 조사팀은 Claude가 안전장치 때문에 보안 작업 일부를 거부하자 GLM-5.2를 로컬에서 돌려 포렌식을 했습니다.
방어자에게 오픈웨이트 모델이 필요했던 순간입니다.
같은 성질이 공격자에게도 동일하게 열려 있습니다.
오픈웨이트의 유용함과 위험함은 같은 곳에서 나옵니다.
Mythos를 봉인한 지 5개월 만에 비슷한 모델이 누구나 받을 수 있는 형태로 공개되어 다가왔습니다.
프론티어 랩 한 회사의 통제 정책으로 다룰 수 있는 AI 보안 문제의 범위가 어디까지인지가 이 보고서가 남긴 질문으로 생각합니다.
'일과 생각' 카테고리의 다른 글
| 네 개의 AI가 투표해서 다음 공격을 정하는 악성코드 (0) | 2026.09.26 |
|---|---|
| Claude가 Anthropic 연구의 4분의 1을 이끕니다 (0) | 2026.09.20 |
| 가장 빨리 달리던 회사가 속도를 늦추자고 했습니다 (0) | 2026.09.15 |
| 산업은 달랐지만 문제는 같았습니다 - AX 컨설팅 현장에서 느낀 점 (0) | 2026.08.27 |
| 피해자가 가해자에게 요구한 것 - Hugging Face의 두 가지 조건 (0) | 2026.07.27 |