본문 바로가기

일과 생각

오픈웨이트 모델이 Mythos급 공격 역량에 도달했습니다

9월 29일, Anthropic의 Frontier Red Team이 보고서를 발표했습니다.

자사 모델이 아니라 경쟁사 모델에 대한 평가였습니다.

중국 Zhipu AI가 8월에 공개한 오픈웨이트 모델 GLM-5.3입니다.

 

보고서의 결론은 분명합니다.

GLM-5.3은 처음부터 끝까지 작동하는 익스플로잇을 스스로 만들 수 있고,

그 수준이 Claude Mythos Preview에 거의 근접하다는 내용입니다.

 

수치부터 보면 Chrome의 V8 엔진에 알려진 취약점을 익스플로잇하는 ExploitBench에서 GLM-5.3은 410회 시도 가운데 50회 성공했습니다.

Mythos Preview는 56회였습니다. 비율로 보면 12.2%와 13.7%입니다.

 

Anthropic 내부의 바이너리 익스플로잇 테스트에서는 GLM-5.3이 4%, Mythos Preview가 6%의 완전 제어권 탈취율을 보였습니다.

Kimi K3, DeepSeek V4.1 Flash, Opus 4.6, GLM-5.2 등 다른 모델들은 0에 가까웠습니다.

 

이 벤치마크에서 Mythos Preview보다 높은 점수를 받은 모델은 없었고, 그 바로 아래가 GLM-5.3이었습니다.

더 작은 모델인 GLM-5.3-Flash는 공개된 Chrome 취약점 두 개를 여덟 시간 만에 작동하는 익스플로잇 체인으로 엮었습니다.

 

Zhipu의 API 가격으로 환산하면 20.40달러였습니다.

샌드박스 테스트에서는 하루 안에 알려지지 않은 브라우저 취약점을 찾아내고, 이를 웹페이지에 연결해 SSH 개인 키를 빼내는 데까지 성공했습니다.

 

이 보고서가 왜 나왔는지는 5개월 전의 사례에서 이해할 수 있습니다.

지난 4월, Anthropic은 Mythos Preview를 공개하면서 일반 출시를 보류했습니다.

스스로 작동하는 익스플로잇을 처음부터 끝까지 만들 수 있는 첫 모델이라는 이유였습니다.

Project Glasswing을 통해 검증된 방어 조직 약 100곳에만 접근권한을 제공했습니다.

이전 글에서 방어자가 먼저 모델을 사용해야 한다는 논리로 다루었던 내용입니다.

 

그런데 GLM-5.3은 오픈웨이트입니다.

누구나 가중치를 내려받아 자기 서버에서 돌리고 수정할 수 있습니다.

비슷한 역량을 가진 모델 하나는 100곳이 심사를 거쳐 쓰고, 다른 하나는 아무 심사 없이 누구나 내려 받고 수정하여 활용할 수 있습니다.

 

모델에 대한 안전장치의 차이는 더 큽니다. 기본 상태의 GLM-5.3은 핵심 시스템을 공격하라는 노골적인 요청을 거부했습니다.

그러나 Anthropic의 시뮬레이션에서 그 거부는 쉽게 무너졌습니다.

모델에 자율 레드팀 에이전트라고 역할을 지정하면 64%가 응했습니다.

추론 과정을 동의하는 것처럼 미리 채워 넣으면 92%까지 올라갔습니다.

거부 기능을 가중치에서 아예 제거하는 어블리터레이션(abliteration) 처리를 한 버전은 100% 요청에 응했습니다.

 

그렇게 안전장치를 제거한 사본은 공개 며칠 만에 인터넷에 올라와 있었습니다.

이 보고서는 몇 가지 단서와 함께 읽을 필요가 있습니다. 측정의 주체가 경쟁사입니다.

오픈웨이트 모델에 대한 통제 강화를 주장해 온 회사가 오픈웨이트 모델의 위험을 측정해 발표한 것입니다.

수치는 모두 Anthropic의 것이고, 비교 대상인 Claude 모델들은 안전장치를 끈 상태로 측정됐습니다.

다만 미국 NIST 산하 AI 표준 및 혁신센터(CAISI)가 9월 17일에 별도로 낸 평가도 방향은 같았습니다.

 

GLM-5.3을 지금까지 공개된 가장 사이버 역량이 높은 오픈웨이트 모델로 규정했고, 미국 최상위 모델에 약 4개월 뒤처진다고 봤습니다.

Zhipu 자체의 발표도 함께 봐야 합니다.

Zhipu의 표에서는 ExploitBench 점수가 Mythos 5가 78.0%, GPT-5.6 Sol이 76.5%, GLM-5.3이 54.4%입니다.

측정 방식과 비교 대상 모델이 달라 격차가 더 크게 보입니다.

 

어느 쪽이든 공통된 사실은 하나입니다.

오픈웨이트 모델의 공격 역량이 프론티어와 몇 달 차이로 좁혀졌습니다.

저는 이 보고서가 세 가지를 보여준다고 생각합니다.

 

첫째, 모델의 대한 통제는 자기 모델까지만 적용됩니다.

Anthropic은 Mythos를 공개를 막았습니다.

하지만 그 결정은 Anthropic의 모델에만 효력이 있습니다.

비슷한 능력을 가진 모델이 다른 곳에서 공개되면 모델 봉인의 효과와 의미는 그만큼 줄어듭니다.

Project Glasswing 글에서 이 역량이 확산을 막는다는 것은 어렵다고 썼는데, 그 확산이 다섯 달 만에 수치로 확인됐습니다.

 

둘째, 안전장치의 의미가 오픈웨이트 모델에서는 다릅니다.

API로 제공되는 모델은 안전장치가 회사의 서버에 있습니다.

오픈웨이트 모델은 안전장치가 가중치 안에 있고, 가중치는 모델을 받은 사람의 것입니다.

거부 기능이 있어도 제거할 수 있다면 그것은 안전장치가 아니라 기본 설정에 가깝습니다.

어떤 안전장치를 넣었는가보다 누가 그 모델을 활용하는지가 실제 위험을 결정합니다.

 

셋째, 역설적인 부분이 하나 있습니다.

7월 Hugging Face 사건에서 조사팀은 Claude가 안전장치 때문에 보안 작업 일부를 거부하자 GLM-5.2를 로컬에서 돌려 포렌식을 했습니다.

방어자에게 오픈웨이트 모델이 필요했던 순간입니다.

같은 성질이 공격자에게도 동일하게 열려 있습니다.

오픈웨이트의 유용함과 위험함은 같은 곳에서 나옵니다.

 

Mythos를 봉인한 지 5개월 만에 비슷한 모델이 누구나 받을 수 있는 형태로 공개되어 다가왔습니다.

프론티어 랩 한 회사의 통제 정책으로 다룰 수 있는 AI 보안 문제의 범위가 어디까지인지가 이 보고서가 남긴 질문으로 생각합니다.

반응형