본문 바로가기

AI

(31)
오픈웨이트 모델이 Mythos급 공격 역량에 도달했습니다 9월 29일, Anthropic의 Frontier Red Team이 보고서를 발표했습니다.자사 모델이 아니라 경쟁사 모델에 대한 평가였습니다.중국 Zhipu AI가 8월에 공개한 오픈웨이트 모델 GLM-5.3입니다. 보고서의 결론은 분명합니다.GLM-5.3은 처음부터 끝까지 작동하는 익스플로잇을 스스로 만들 수 있고,그 수준이 Claude Mythos Preview에 거의 근접하다는 내용입니다. 수치부터 보면 Chrome의 V8 엔진에 알려진 취약점을 익스플로잇하는 ExploitBench에서 GLM-5.3은 410회 시도 가운데 50회 성공했습니다.Mythos Preview는 56회였습니다. 비율로 보면 12.2%와 13.7%입니다. Anthropic 내부의 바이너리 익스플로잇 테스트에서는 GLM-5.3..
네 개의 AI가 투표해서 다음 공격을 정하는 악성코드 9월 22일, Cisco Talos가 CLOSEDQUORUM이라는 악성코드를 공개했습니다. Windows를 표적으로 하는 Go 기반 임플란트인데, 지금까지 알려진 악성코드와 다른 점이 하나 있습니다. 공격자의 서버에서 매번 다음 명령을 받는 대신 DeepSeek, Qwen, Mistral, Gemini 네 모델의 투표로 다음 행동을 결정합니다.감염된 시스템의 현재 상황을 정리해 네 모델에 동시에 보낸 후 각 모델이 다음 행동을 제안하면 다수결로 하나를 선택해 실행합니다. 자격증명 수집, 권한 상승, 측면 이동처럼 선택지를 미리 좁혀 둔 뒤에 그 안에서 모델이 판단하게 하는 구조입니다.처음 배포한 뒤에는 공격자의 지속적인 명령이 필요 없습니다. 이 발견은 Talos가 같은 날 공개한 CAIRN이라는 오픈소..
Claude가 Anthropic 연구의 4분의 1을 이끕니다 9월 17일, Anthropic Institute가 내부 측정 결과를 처음으로 공개했습니다. 2026년 8월 기준 Claude가 Anthropic의 AI 연구개발 업무 가운데 26%를 ‘이끌고 있다’는 내용입니다. 2월에는 1%에도 미치지 못했습니다. 불과 6개월 사이의 변화입니다. 이번 발표는 지난주 Dario Amodei가 공개한 에세이와 함께 보면 더 인상적입니다. AI 개발 속도를 늦추는 방안을 제안한 회사가 닷새 뒤, 자기 회사의 AI 개발 속도계를 공개한 셈이기 때문입니다. Anthropic은 Epoch AI가 만든 여섯 단계의 자동화 척도를 사용했습니다. AI가 전혀 관여하지 않는 AL0부터 사람의 개입 없이 완전히 자율적으로 움직이는 AL5까지입니다. 이 가운데 AL3은 사람의 밀착 지시..
가장 빨리 달리던 회사가 속도를 늦추자고 했습니다 9월 12일 토요일, Dario Amodei가 개인 사이트에 에세이 한 편을 올렸습니다. 제목은 "We Must Pace the Frontier"입니다. 약 3,800단어 분량이며 핵심 문장은 다음과 같습니다. AI 모델의 역량을 개선하는 속도를 늦춰야 한다는 것입니다. 몇 시간 뒤 Sam Altman이 동의한다고 밝혔습니다. OpenAI도 Anthropic이 약속한 첫 번째 조치를 똑같이 이행하겠다고 덧붙였습니다. Elon Musk도 동의를 표했고, 다음 날 Satya Nadella가 AI 모델의 역량에 대해 의도적인 속도 조절과 상주 평가자 개념을 환영했습니다. 경쟁 관계인 프론티어 랩의 수장들이 감속에 한목소리를 낸 것은 처음입니다. 이 에세이가 특이한 이유는 발언자가 Dario Amodei이기 때..
피해자가 가해자에게 요구한 것 - Hugging Face의 두 가지 조건 7월 26일 토요일, Hugging Face의 공동창업자이자 CEO인 Clement Delangue가 X에 글을 올렸습니다. 며칠 전 OpenAI의 AI 에이전트가 자사 프로덕션 시스템에 침투한 사건에 대한 입장이었습니다.그는 샌프란시스코로 날아가 OpenAI 경영진을 직접 만난 뒤, "투명성의 정신"으로 요구 사항을 공개한다고 밝혔습니다. 요구는 두 가지였습니다.그런데 그 두 가지에는 손해배상도, 사과도, 법적 조치도 들어 있지 않았습니다. 먼저 사건의 시간표를 정리하면 이렇습니다.7월 16일, Hugging Face가 자율 에이전트 하나가 내부 데이터셋과 자격증명에 접근했다는 사실을 공개했습니다.OpenAI가 자사 모델의 관여를 확인한 것은 7월 21일과 22일이었습니다.공식 공개는 7월 24일에 이..
OpenAI의 에이전트가 샌드박스를 탈출했습니다 7월 21일, OpenAI가 이례적인 보안 사고를 공개했습니다. 자사의 AI 모델이 격리된 테스트 환경을 스스로 빠져나와 외부 인터넷에 접근했고, Hugging Face의 프로덕션 시스템까지 침투했다는 내용입니다.사고에 관여한 것은 GPT-5.6 Sol과 아직 공개되지 않은 더 강력한 모델이었습니다. 가장 놀라운 것은 동기였습니다.이 모델들은 누군가의 공격 지시를 받은 것이 아닙니다.자신에게 주어진 벤치마크 시험을 통과하기 위해 그 시험의 정답을 찾아 나선 것입니다. 무슨 일이 있었는지부터 정리하면 이렇습니다.OpenAI는 모델의 사이버 공격 역량을 측정하기 위해 ExploitGym이라는 벤치마크로 평가를 진행하고 있었습니다.실제 소프트웨어 취약점을 작동하는 익스플로잇 코드로 바꿔내는 과제 898개로 구..
아틀란소프트의 대표이자 컨설턴트로 새로운 챕터를 시작했습니다. 지난 6월부터 아틀란소프트에서 소프트웨어 개발과 기술 전략, AX 컨설팅을 중심으로 스타트업의 창업 및 초기 운영과 제품 전략 컨설팅을 함께하고 있습니다. 업무 자동화 ERP, 데이터 분석 대시보드, LLM 기반 지식 챗봇, 볼링 전산 시스템과 콘텐츠 플랫폼 리뉴얼 등 기획부터 구축까지 프로젝트를 수행하고, 비영리기관과 협회에 대한 기술 자문과 기업, 대학교, 공공기관 대상 강의로 활동의 폭을 넓혀가고 있습니다. 감사하게도 6건의 컨설팅 계약을 진행하게 되었고, 그중 2건은 해외 기업과의 협업입니다. 좋은 인연도 이어졌습니다. 이앤티이노베이션과의 인연으로 전남창조경제혁신센터의 '전남형 스타트업 AX 전환 실증지원 프로그램'에서 AI 데이터 관리 및 AX 교육 강사를 맡았고, 이어서 전남창조경제혁신센터 임..
강제와 자발, 결과는 같았습니다 - Mythos와 GPT-5.6의 공통점 지난 두 편의 글에서 두 사건을 다뤘습니다. 6월 12일, Anthropic이 정부 명령으로 Fable 5와 Mythos 5를 차단한 사건과 그리고 6월 26일, OpenAI가 정부 요청으로 GPT-5.6 출시를 소수 파트너로 제한한 사건입니다.당시에는 두 사건이 별개처럼 보였습니다. 하나는 강제 중단이었고, 하나는 자발적 협조였습니다. 그런데 6월 26일과 27일 이틀 사이에 벌어진 일을 함께 놓고 보면, 두 사건이 사실은 하나의 그림이었다는 것이 분명해집니다. 먼저 그 이틀 동안 무슨 일이 있었는지 정리하면 이렇습니다.6월 26일 금요일, OpenAI가 GPT-5.6을 정부 승인 파트너 약 20곳으로 제한해 출시했습니다. 같은 날, 상무부 장관 Howard Lutnick이 Anthropic에 두 번째..