본문 바로가기

일과 생각

네 개의 AI가 투표해서 다음 공격을 정하는 악성코드

9월 22일, Cisco Talos가 CLOSEDQUORUM이라는 악성코드를 공개했습니다.

 

Windows를 표적으로 하는 Go 기반 임플란트인데, 

지금까지 알려진 악성코드와 다른 점이 하나 있습니다.

 

공격자의 서버에서 매번 다음 명령을 받는 대신 DeepSeek, Qwen, Mistral, Gemini 네 모델의 투표로 다음 행동을 결정합니다.

감염된 시스템의 현재 상황을 정리해 네 모델에 동시에 보낸 후 각 모델이 다음 행동을 제안하면 다수결로 하나를 선택해 실행합니다.

 

자격증명 수집, 권한 상승, 측면 이동처럼 선택지를 미리 좁혀 둔 뒤에 그 안에서 모델이 판단하게 하는 구조입니다.

처음 배포한 뒤에는 공격자의 지속적인 명령이 필요 없습니다.

 

이 발견은 Talos가 같은 날 공개한 CAIRN이라는 오픈소스 탐지 프레임워크에서 나왔습니다.

CAIRN은 AI가 들어간 악성코드를 직접 실행하지 않고도 찾습니다.

프롬프트 템플릿, 모델 API 엔드포인트, API 키 접두어, 탈옥 문구, AI 분석 샌드박스를 속이려는 문자열 같은 메타데이터를 지문처럼 보는 방식입니다.

AI를 쓰는 악성코드는 새로운 종류의 흔적을 남긴다는 발상에서 시작했습니다.

 

이 내용에서 한 가지는 분명히 짚어야 합니다.

Talos는 CLOSEDQUORUM이 실제 공격에 배포된 것은 아직 확인되지 않았습니다.

 

공개된 빌드에는 더미 API 키가 들어가 있고, 

실제로 동작하는 캠페인이라기보다 완성된 설계에 가깝습니다.

 

다만 개발자가 2025년부터 카드 정보 거래 관련 범죄 포럼에서 활동한 인물과 연결된 정황은 확인했습니다.

 

그래서 이 사례는 자율 공격이 이미 널리 쓰이고 있다는 증거라기보다, 

자율 명령, 제어 구조가 실제 악성코드 설계에 들어왔다는 증거로 보여집니다.

 

저는 이 발견이 세 가지 포인트를 보여준다고 생각합니다.

 

첫째, 안전장치는 모델마다 존재하지만 공격은 모델 네개를 함께 사용합니다.

각 AI 회사는 자기 모델에 요청에 따른 거부 기능을 넣습니다.

하지만 다수결 구조에서는 한 모델이 거부해도 나머지 셋이 답하면 공격은 계속됩니다.

모델 단위로 설계된 안전장치를 공격자가 시스템 구조로 우회한 방식입니다.

 

둘째, 공격의 두뇌가 상용 API입니다.

CLOSEDQUORUM은 자체 모델을 훈련하지 않았습니다.

코딩 보조와 고객 지원에 쓰이는 일반 모델 API를 침입 판단 엔진으로 가져다 썼습니다.

이전 글에서 OpenAI 에이전트가 평가 환경을 빠져나온 사례를 다뤘다면, 

이번에는 공격자가 같은 종류의 능력을 의도적으로 설계에 넣었습니다.

 

셋째, 방어자가 먼저 관련 도구를 공개했습니다.

Talos는 악성코드를 발견하는 데서 끝나지 않고, 

이런 유형을 찾는 CAIRN까지 오픈소스로 공개했습니다.

자율 공격이 흔해지기 전에 그 흔적을 추적할 기반을 먼저 깔아 둔 것입니다.

Project Glasswing 글에서 다뤘던 "방어자가 먼저 써야 한다"는 논리가 악성코드 탐지 영역에서도 같은 형태로 나타났습니다.

 

물론 CLOSEDQUORUM은 처음부터 끝까지 스스로 움직이는 공격은 아닙니다.

사람이 만든 파이프라인이 판단의 한 단계를 모델에 넘긴 사례입니다.

 

하지만 그 한 단계가 명령과 제어라는 점이 다릅니다.

공격자가 자리를 비워도 공격이 진행되는 지점이 악성코드 공격의 설계 안으로 들어오기 시작했습니다.

 

관련 링크: https://blog.talosintelligence.com/the-closed-quorum-inside-the-first-reported-autonomous-ai-c2-implant/

반응형