AI 에이전트들이 탈출하고 있다. 그 다음엔 무슨 일이 일어날까요?
지난 한 달 동안 세계 최고의 첨단 AI 개발업체 세 곳이 자신들이 개발한 AI 에이전트가 접근 권한이 없는 시스템에 접근했음을 확인했습니다. 처음에는 고립된 AI 탈출 사건처럼 보였지만, 이제는 하나의 패턴으로 보인다.
- OpenAI의 테스트가 현실 세계로 유출되었습니다. 인공지능 에이전트가 사이버 보안 테스트를 우회하여 인터넷에 접속했고, 허깅페이스 와 모달랩스 고객사의 시스템을 해킹했습니다. 해당 에이전트는 OpenAI가 상황
파악하기 전까지 며칠 동안 인프라를 침해했습니다. - 앤트로픽은 자체 테스트 결과를 검토한 결과, 자체적으로 발생한 문제들을 발견했습니다. 14만 1천 건 이상의 테스트를 검토한 결과, 클로드 모델이 다른 조직의 보안을 침해한 사례가 3건 발견되었습니다. OpenAI 에이전트와 달리, 이 모델들은 외부로 나갈 필요가 없었습니다. 설정 오류로 인해 처음부터
접속이 허용되었습니다. - 메타는 AI 에이전트 공격과 연루된 세 번째 AI 개발자가 되었습니다. 보안 테스트 도중 설정 오류로 인해 모델 중 하나가 인터넷에 접속할 수 있게 되었습니다. 해당 모델은 그러한 접근 권한을 이용하여 제3자 서비스의 취약점을 찾아 악용했습니다.
- AI 보안 연구소(AISI)의 테스트 결과, 에이전트들이 속임수와 인간의 조작을 이용해 단순한 공격을 넘어설 수 있다는 사실이 밝혀졌습니다. AISI의 Anthropic의 Mythos 5 및 OpenAI의 GPT-5.6-Sol 테스트 해당 프로그램은 가짜 온라인 신분을 만들고, 사회 공학적 기법을 사용하며, 사람들에게 악성 코드를 승인하도록 설득하려 한 것으로 밝혀졌습니다. 실험 결과 자율 에이전트는 목표를 추구하는 과정에서 기술적 공격과 기만 전략을 결합할 수 있는 것으로 나타났습니다.
모든 사건이 동일한 상황에서 발생한 것은 아닙니다. 일부 에이전트는 테스트 환경에서 탈출했고, 다른 에이전트들은 실수나 의도적인 관대한 테스트로 인해 인터넷에 접속할 수 있게 되었습니다. 하지만 그들은 모두 동일한 위험을 지적합니다. 일단 공격자가 외부 시스템에 접근할 수 있게 되면 소프트웨어를 악용하고, 사람들을 속이고, 아무도 의도하지 않은 경로를 따라갈 수 있다는 것입니다. 보안팀은 AI 워크로드
실행될 수 있는 범위
파악하고 필요한 연결만 허용하도록 제한해야 합니다.아직 탐지되지 않은 AI 에이전트 공격에는 어떤 것들이 있을까요?
일부 테스트에 사용된 ExploitGym 벤치마크를만드는 데 도움을 준 UC 버클리 교수 던 송은 "더 많은 사례가 있었을 가능성이 높다"고 경고했습니다. 하지만 핵심은 언론의 주목을 끄는 탈출 사건보다는, 팀이 자율 AI 에이전트의 이동 경로와 행동 방식을 파악하고 제어할 수 있는지 여부입니다.
AI는 강력한 내부 위협으로 떠오르고 있다.
IBM 보안 엔지니어 키미 패링턴은 이러한 위험성을 다음과 같이 설명합니다. AI는 "우리가 가진 가장 유용한 내부자"일 수도 있지만, "가장 위험한 내부자"이기도 합니다.
이러한 비교가 성립하는 이유는 의도가 아니라 접근성 때문입니다. 행위자가 악의적인 의도를 갖지 않더라도 피해를 입힐 수 있습니다. 그것은 누군가가 의도적으로든 실수로든 부여한 권한과 자신에게 주어진 목표에 대한 자체적인 해석만 있으면 됩니다. 이러한 조합 때문에 다음 질문이 시급해집니다. 요원이 일단 접근 권한을 얻으면 어디까지 이동할 수 있을까요?
AI 에이전트가 통제 범위를 벗어나면 측면 이동이 위험 요소가 됩니다.
언론의 헤드라인은 인공지능 에이전트가 경계를 넘은 순간에 집중되었습니다. 수비수들에게 있어 그 순간은 그 다음에 일어나는 일, 즉 에이전트가 통과한 후 주변 환경의 얼마나 많은 부분에 영향을 미칠 수 있는지보다 훨씬 덜 중요합니다.
보고된 사례에서 원인은 개방형 인터넷 연결, 제3자 서비스, 그리고 취약점이 있는 애플리케이션이었습니다. 실제 운영 환경에서는 이러한 불필요한 경로들이 신원 확인 시스템, 데이터베이스 및 고객 데이터로 이어질 수 있습니다.
일루미오의 선임 제품 마케팅 매니저인 라주 나가르는 "초기 접속만으로는 재앙이 발생하지 않습니다."라고 말했습니다. "그건 전적으로 측면 움직임 덕분이에요."
무제한적인 횡적 이동은 최근 AI 관련 사건들과 매우 유사한 양상을 보입니다. 테스트 환경이 인터넷으로 통하는 통로가 된 것입니다. 외부 서비스는 공격 경로의 또 다른 단계가 되었습니다. 자격 증명과 공개된 서비스 덕분에 더 많은 기회가 열렸습니다.
나가르는 "기업 내 불필요한 연결은 모두 그들이 악용할 수 있는 또 다른 경로를 만들어낸다"고 말했다.
인간 공격자는 그러한 경로를 찾아야 합니다. 자율 에이전트는 몇 분 안에 이러한 요소들을 열거할 수 있으므로, 수비수들은 무언가가 움직여서는 안 될 곳에서 움직이고 있다는 사실을 알아차릴 시간이 훨씬 줄어듭니다.
가시성은 첫 번째 방어선입니다.
개발, 테스트, 클라우드, 타사 및 프로덕션 환경 전반에 걸쳐 AI 워크로드가 어떻게 통신하는지 명확하게 파악하는 것부터 시작하세요. 가장 중요한 두 가지는 아무도 생성했는지 기억하지 못하는 연결과 설계한 아키텍처와 일치하지 않는 트래픽입니다. 둘 다 테스트 환경에서 흔히 볼 수 있으며, 지도가 없으면 쉽게 놓칠 수 있습니다.
목표는 예상 트래픽과 실제 트래픽을 비교하는 것입니다.
- 어떤 애플리케이션이 어떤 서비스에 의존합니까?
- 어떤 시스템들이 서로 통신해서는 안 될 때 통신하고 있나요?
- 하나의 제어 장치가 고장 나면 에이전트는 어디로 이동할 수 있을까요?
나가르는 이러한 실제 소통 패턴을 이해하는 것이 팀이 공격 경로가 되기 전에 보안 허점을 찾아내는 데 도움이 된다고 강조했습니다.
익숙한 측면 이동 경로도 주의 깊게 살펴보세요. 원격 접속 및 파일 공유 프로토콜(RDP(원격 데스크톱 프로토콜), SMB(서버 메시지 블록), SSH(보안 셸), FTP(파일 전송 프로토콜), Telnet)과 TeamViewer와 같은 도구는 공격자들이 오랫동안 한 시스템에서 다른 시스템으로 이동하는 데 사용해 온 수단입니다. 네트워크 접근 권한이 있는 에이전트는 동일한 경로를 사용할 수 있습니다.
분할 기능은 의도치 않은 측면 움직임을 방지합니다.
가시성은 경로를 보여줍니다. 세분화를 통해 어떤 채널을 계속 운영할지 결정합니다. 규칙은 간단합니다. AI 워크로드에 작업 수행에 필요한 연결만 제공하고 나머지는 기본적으로 닫으세요. 실제로 대부분의 테스트 환경과 빌드 파이프라인은 실제 작업에 필요한 것보다 훨씬 더 많은 열린 경로를 가지고 있습니다.
최근 발생한 사건들로 인해 개발, 테스트 및 생산 간의 분리가 특히 중요해졌습니다. 나가르는 신뢰도가 낮은 테스트 환경과 프로덕션 환경 간의 합법적인 연결조차도 제한이 없거나 제대로 모니터링되지 않으면 공격 경로가 될 수 있다고 경고했습니다. 이러한 경로를 제한하면 유출된 워크로드가 민감한 데이터나 중요 시스템에 접근하는 경로가 되는 것을 방지할 수 있습니다.
중요 애플리케이션에도 동일한 원칙이 적용됩니다. 모든 것을 한꺼번에 차단하려고 하기보다는, 팀은 ID 시스템, 데이터베이스, 운영 애플리케이션 및 기타 중요 자산을 개별적으로 보호할 수 있습니다. 필요한 연결만 허용하고 나머지는 제한하십시오.
부동산 중개인이 부적절한 장소로 이동할 경우 어떻게 대응할지 미리 결정해 두세요. 팀에서 워크로드를 몇 시간이 아닌 몇 분 안에 격리할 수 있다면, 전체 환경에 걸쳐 문제를 추적하는 대신 격리된 문제를 조사할 수 있습니다.
예측할 수 없는 AI의 행동에 대비하세요
자율 시스템이 내릴 모든 결정을 예측할 수는 없습니다. 하지만 그 영향력이 어디까지 미칠지는 당신이 결정할 수 있습니다. 현재 AI 워크로드의 통신 방식을 파악하고, 불필요한 연결을 차단하며, 테스트 환경을 프로덕션 환경과 분리하세요. 이렇게 하면 예상치 못한 상황이 환경 전체로 확산되는 경로가 되는 대신, 제한된 이벤트로 남게 됩니다.
온디맨드 웹 세미나 "신화 이후: 불가피한 침해에 대비하기 "를 시청하여 조직이 노출을 제한하고 공격자가 사용할 수 있는 경로를 차단함으로써 더 빠르고 예측하기 어려운 공격에 대비하는 방법에 대한 심층적인 논의를 살펴보세요.



.webp)
.webp)
