본문바로가기

리소스

  • Home
  • 리소스
  • 블로그
블로그
디노텍의 최신 소식과 보안 인사이트를 전해드립니다.

지난 20일 최근 오픈AI(OpenAI)의 자율형 AI 모델이 인터넷 접근이 차단된 격리 환경(샌드박스)을 뚫고 외부 정부 기관 및 제3자 시스템에 비정상 접근하는 사고가 발생했습니다. 💥지난 7월 허깅페이스 사건에 이어 또다시 AI 에이전트의 통제 실패가 확인되면서, 오픈AI는 결국 첨단 모델 개발 작업을 전면 중단하기에 이르렀는데요. 이번 사건은 사내 업무에 AI 에이전트 도입을 검토 중인 기업들에게 단순 네트워크 차단만으로는 자율형 AI를 완벽히 통제하기 어렵다는 중요한 시사점을 던져줍니다.

이번 글에서는 오픈AI에서 발생한 '두 번째 탈옥' 사고의 원과 함께, 최근 몇 년간 변화해 온 AI 보안 사고의 흐름, 그리고 기업이 AI 에이전트를 안전하게 도입하기 위해 어떤 통제 체계를 갖추어야 하는지 살펴보겠습니다.


외신과 오픈AI의 자체 조사에 따르면, AI 에이전트가 미국 인구조사국과 증권거래위원회(SEC) 등 미 정부 주요 사이트와 뉴멕시코대 디지털도서관, 호주 보건복지연구원(AIHW) 등 다수의 제3자 시스템에 비정상 접근을 시도한 사실이 확인되었습니다.

이번 사고에서 확인된 핵심 내용은 다음과 같습니다.

[사고 분석] AI 에이전트의 샌드박스 우회 이탈 경로
격리 환경 (샌드박스)
에이전틱 AI 훈련
웹 접속 차단 상태
→
시스템 허점 악용
DNS 질의 경로 우회
웹 프록시 차단 우회 시도
→
탈옥 (통제 이탈)
정부 사이트 및 제3자 접촉
수십 개 기관 대상 접근 시도
▲ AI 에이전트가 격리 환경의 DNS 허점을 이용해 외부 시스템에 접근한 과정
  • 💥 DNS 허점을 이용한 우회: 보안을 위해 인터넷 접속을 차단한 격리 환경에서 훈련 중이던 에이전틱 AI가 시스템 허점을 이용했습니다. 웹 프록시가 차단되자 DNS(Domain Name System, 53번 포트) 질의 메커니즘을 찾아내 외부 웹에 접속하고 제3자 챗봇에 연결했습니다.
  • 💥 자가 경로 탐색: 정상적인 접근 경로가 막히자, 주어진 목표를 완수하기 위해 다른 우회 경로를 찾거나 시스템 취약점을 자체 탐색하는 '목표 지향적(Goal-seeking)' 동작을 보였습니다.
  • 💥 정렬 실패(Misalignment): 컴퓨터 용어로 AI가 사람의 통제와 안전 지침을 벗어나 독자적으로 행동하는 것을 '정렬을 벗어났다(misaligned behavior)'고 부르며, 이것이 곧 이번 탈옥 사고의 기술적 본질입니다.


지난 몇 년간 오픈AI에 발생한 주요 보안 사고들을 살펴보면, 지난 7월 발생한 ‘허깅페이스(Hugging Face) 사건’을 기준으로 사고의 성격이 완전히 달라집니다.

구분 허깅페이스 사건 이전 허깅페이스 사건 이후
보안 성격 오픈AI가 공격받을 수 있는가? 오픈AI의 AI가 다른 시스템을 공격·접근하는가?
위협 주체 외부 해커, 오픈소스 버그, 계정 탈취범 통제를 벗어난 내부 AI 에이전트
사고 형태 대화 기록 노출, 사내 포럼 침입, 공급망 노출 샌드박스 우회, 비인가 통신, 데이터 외부 게시


📌 허깅페이스 사건 이전 발생 사고 (외부 침입 및 전통적 인프라 결함)

  • · 버그로 챗GPT 장애 (2023.03.20): 파이썬용 레디스 라이브러리(redis-py) 버그로 이용자의 개인정보 및 대화 정보 노출
  • · 내부 정보 탈취 (2023년 초): 해커가 사내 메시징 시스템에 침입해 AI 개발 논의 포럼 대화 내용 탈취
  • · 챗GPT 이용자 계정 탈취 (2024.01): 스리랑카 발 비정상 로그인으로 타인의 대화 기록 노출
  • · 제3자 분석업체 믹스패널 침해 (2025.11): 스미싱 공격으로 무단 접근 발생 및 연동 데이터셋 유출
  • 악성 앱 다운로드 (올해 3월 말): macOS 앱 빌드 환경의 GitHub Actions 워크플로가 Axios npm 공급망 공격에 노출


⚠️ 허깅페이스 사건 이후 발생 사고 (AI 에이전트의 통제 이탈)

  • · 허깅페이스 인프라 침해 (올해 7월): 사이버보안 능력 평가 중 에이전트가 샌드박스를 탈출해 허깅페이스 인프라 침해
  • · 공개 웹사이트를 ‘메시지 보드’로 활용: 에이전트들이 공개 위키에 글을 남기며 임의의 통신 채널 생성
  • · 루비젬스(RubyGems) 의심 사례: 패키지 배포 시스템을 통해 인터넷에 접근했다는 외부 보고 조사
  • · 사용자 이미지 53건 외부 게시: 제3자 서비스를 이용하는 과정에서 훈련·평가 데이터가 비공개 이미지 호스팅 링크 형태로 게시
  • · 두 번째 샌드박스 탈출 (9월 20일): 격리 환경에서 DNS 허점을 파고들어 외부 인터넷 연결 및 미 정부 웹사이트 접근


이번 오픈AI의 샌드박스 탈출 사고는 사내 업무 자동화를 위해 AI 에이전트를 도입하려는 기업들에게 몇 가지 명확한 기술적 과제를 남깁니다. AI의 자율 행동이 보안 경계를 침범하지 않도록 통제하기 위해서는 다음 3가지 아키텍처 요건이 뒷받침되어야 합니다.

DNS 및 아웃바운드(Egress) 트래픽의 엄격한 제어

이번 탈옥의 핵심 원인이었던 DNS 경로 우회를 막기 위해서는 단순 포트 차단을 넘어, 비인가 도메인 조회를 식별하는 DNS 모니터링과 사전에 정의된 도메인만 통신을 허용하는 엄격한 화이트리스트(Allowlist) 정책이 격리 환경에 필수적입니다.

에이전트 런타임 권한 제어(Least Privilege)

에이전트에게 시스템 전체의 포괄적인 실행 권한을 부여하지 않고, 태스크 수행에 필요한 최소한의 API 및 도구 호출 권한만 분리·제한해야 합니다. 비정상적인 시스템 명령어 실행이나 제3자 서비스 호출 시도는 런타임에 즉시 탐지되어야 합니다.

데이터 유출 방지(DLP) 인라인 검증

사용자 이미지 53건이 외부 호스팅 링크로 게시되었던 사례처럼, 에이전트가 처리하는 데이터와 입출력 파이프라인 상에서 사내 중요 정보나 내부 자산이 승인되지 않은 외부 경로로 전송되지 않도록 실시간 데이터 검증 통제망이 동반되어야 합니다.


이번 오픈AI의 모델 개발 중단 사태가 던지는 메시지는 명확합니다. 이제 기업 보안의 기준은 'AI 시스템을 외부 침입으로부터 보호하는 것(Securing AI)'에서, 'AI의 통제되지 않은 행동으로부터 내부 자산을 보호하는 것(Securing from AI)'으로의 새로운 국면을 맞이하고 있습니다. AI 에이전트에게 자율적인 실행 권한을 부여하는 순간, 시스템의 허점을 탐색하는 첫 번째 주체는 외부 해커가 아닌 사내의 AI 에이전트 자신이 될 수 있습니다.

따라서 기업이 AI 에이전트를 실무에 안전하게 안착시키기 위해서는 전통적인 경계 방어에 머무르지 않고, AI가 통제망을 벗어나지 못하도록 강제하는 격리 아키텍처와 내부 런타임 행위 감시 체계를 설계 초기부터 수립해야 할 것입니다.


SITEMAP