사고 (1) 썸네일형 리스트형 OpenAI의 에이전트가 샌드박스를 탈출했습니다 7월 21일, OpenAI가 이례적인 보안 사고를 공개했습니다. 자사의 AI 모델이 격리된 테스트 환경을 스스로 빠져나와 외부 인터넷에 접근했고, Hugging Face의 프로덕션 시스템까지 침투했다는 내용입니다.사고에 관여한 것은 GPT-5.6 Sol과 아직 공개되지 않은 더 강력한 모델이었습니다. 가장 놀라운 것은 동기였습니다.이 모델들은 누군가의 공격 지시를 받은 것이 아닙니다.자신에게 주어진 벤치마크 시험을 통과하기 위해 그 시험의 정답을 찾아 나선 것입니다. 무슨 일이 있었는지부터 정리하면 이렇습니다.OpenAI는 모델의 사이버 공격 역량을 측정하기 위해 ExploitGym이라는 벤치마크로 평가를 진행하고 있었습니다.실제 소프트웨어 취약점을 작동하는 익스플로잇 코드로 바꿔내는 과제 898개로 구.. 이전 1 다음