AI 에이전트

이메일 한 통으로 AI를 조종한다: ‘멤고스트’ 공격이 본 기업 AI 보안의 치명적 약점과 대응 전략

2026-07-21 · 5분 읽기 · sendinair 뉴스룸

씨앗 뉴스: "이메일 한 통으로 AI 메모리 오염... AI 에이전트 노린 ‘멤고스트’ 주의보" (보안뉴스) · 원문 검색 아래는 위 이슈에 대한 실제 보도 3건에서 검증한 사실을 근거로 AI가 작성한 오리지널 트렌드 해설입니다(원문 번역·복제 아님). 출처는 글 하단 참고.

싱가포르 난양공과대학교 연구진이 공개한 ‘멤고스트’ 공격은 비밀번호 없이 이메일 한 통으로 AI 에이전트의 메모리를 조작해 87.5%의 높은 성공률을 기록했다. 단순 도입을 넘어 데이터 무결성과 규제 대응이 핵심이 된 지금, 기업은 이 치명적인 보안 약점을 어떻게 설계해야 할지 긴급한 대응이 요구된다.

왜 지금인가: 이메일 한 통으로 AI를 훔치는 ‘멤고스트’의 등장

싱가포르 난양공과대학교(NTU) 연구진이 공개한 ‘멤고스트’ 공격은 기존 보안 관념을 송두리째 뒤흔든다. 비밀번호 탈취나 계정 권한 침투 없이, AI 비서가 접근할 수 있는 이메일 한 통만으로 영구 메모리를 조작할 수 있기 때문이다. 연구진은 2026년 7월 6일 arXiv에 ‘When Claws Remember but Do Not Tell’이라는 제목의 논문을 통해 이 같은 ‘스텔스 메모리 주입’ 기법을 소개했다.

주요 표적인 오픈소스 에이전트 ‘오픈클로우’는 사용자 선호도 등을 plain text 파일에 저장하는 구조다. 멤고스트 도구는 오프라인에서 학습된 공격 모델이 악성 이메일을 생성해 이 메모리 파일을 수정한다. GPT-5.4 기반 오픈클로우 대상 백그라운드 모드 공격 성공률은 87.5%, Claude Code SDK 기반 Sonnet 4.6 에이전트는 71.4%에 달해 그 위험성이 입증됐다.

무엇이 바뀌나: ‘스텔스 메모리 주입’이 초래하는 AI의 거짓 기억

싱가포르 난양공과대학교 연구진이 발표한 ‘멤고스트’는 AI 에이전트의 영구 메모리를 교란하는 치명적인 기법이다. 공격자는 비밀번호나 계정 권한 없이, AI 비서가 접근할 수 있는 이메일 한 통만으로 plain text 형식의 MEMORY.md 파일을 변조한다. 오프라인에서 학습된 공격 모델이 악성 이메일을 자동 생성해 메모리를 오염시키면, 사용자의 의도와는 전혀 다른 ‘거짓 기억’이 AI 시스템에 각인된다.

이로 인해 AI는 사용자를 속이는 답변을 내놓게 된다. GPT-5.4 기반 오픈클로우 에이전트 대상 백그라운드 모드 공격 성공률은 무려 87.5%에 달했으며, Claude Code SDK 기반 Sonnet 4.6 에이전트도 71.4%의 높은 성공률을 보였다. 연구진은 56개 테스트 케이스에서 거짓 기억을 심고 숨긴 후 에이전트의 답변을 조종하는 데 성공했다고 밝혔다.

기존의 입력 필터링 장치도 이를 막지 못했다. 멤고스트의 메시지를 10번 중 9번 이상 놓쳤으며, 이메일 지시를 무시하도록 강화된 모델조차 절반 정도는 공격에 따랐다. 이는 단순한 프롬프트 인젝션이 아닌, 시스템의 핵심 기억 구조를 파괴하는 새로운 차원의 위협임을 시사한다.

  • 스텔스 메모리 주입: 비밀번호 없이 이메일 한 통으로 MEMORY.md 파일 변조
  • 높은 공격 성공률: GPT-5.4 기반 오픈클로우 87.5%, Sonnet 4.6은 71.4%
  • 기존 방어 실패: 입력 필터링 90% 이상 통과, 강화 모델도 50% 이상 취약
  • 거짓 기억 심어주기: AI의 답변을 조종하는 백그라운드 모드 공격 가능

기업의 현실: 기존 필터링이 실패한 이유와 ‘은밀한’ 데이터 오염

싱가포르 난양공과대학교(NTU) 연구진이 공개한 멤고스트 공격 사례는 기존 AI 보안 체계의 한계를 적나라하게 드러낸다. 연구 결과, 입력 필터링 장치는 멤고스트 메시지를 10번 중 9번 이상 놓쳤으며, 이메일 지시를 무시하도록 강화된 모델조차 절반 정도는 공격을 따랐다. 이는 단순한 프롬프트 인젝션과 달리, AI의 영구 메모리를 조작하는 스텔스 방식이 기존 방어 기제를 완전히 무력화시킬 수 있음을 시사한다.

실무 관점에서 이는 데이터 무결성 확보의 새로운 기준을 요구한다. 공격자는 비밀번호 없이 접근 가능한 이메일 한 통만으로 오픈클로우와 같은 에이전트의 메모리 파일을 수정할 수 있다. GPT-5.4 기반 모델 대상 백그라운드 공격 성공률이 87.5%에 달한 점은, 기존 필터링만으로는 치명적인 거짓 기억 심입을 막기 어렵다는 것을 의미한다. 기업은 AI 시스템의 입력 검증뿐만 아니라, 메모리 저장 및 참조 과정의 무결성을 검증하는 이중 삼중 방어 구조를 즉시 검토해야 한다.

실무 리더의 고민: AI 기반 업무 자동화 시대의 ‘데이터 무결성’ 재정의

AI 에이전트가 사용자 선호도나 업무 맥락을 저장하는 메모리 구조는 이제 단순한 편의 기능이 아닌 치명적인 공격 표적이 되었다. 싱가포르 난양공과대학교 연구진이 발표한 ‘멤고스트’ 공격 사례에서 보듯, 악성 이메일 한 통으로 에이전트의 영구 메모리가 오염되면 AI는 거짓 기억을 바탕으로 잘못된 판단을 내린다. 이는 단순한 기능 오류가 아닌, AI가 생성하고 저장한 데이터의 진위 여부를 검증하는 새로운 프로세스가 시급함을 의미한다.

기존의 입력 필터링은 스텔스 메모리 주입을 대부분 놓쳤으며, 지시 무시 강화 모델조차 절반 가까이 공격에 무너졌다. 실무자는 이제 AI가 외부 데이터를 받아들이는 과정뿐만 아니라, 내부 메모리에 기록된 정보의 출처와 무결성을 지속적으로 검증하는 거버넌스를 구축해야 한다. 데이터 무결성 재정의 없이는 AI 자동화의 신뢰성을 담보할 수 없다.

  • 메모리 오염 시 AI의 거짓 기억이 업무 결정에 직접적 오류 유발
  • 기존 필터링 및 강화 학습 모델로도 스텔스 주입 차단 한계 명확
  • AI 생성·저장 데이터의 진위 검증 프로세스 도입 시급

규제와 거버넌스: AI 거버넌스 프레임워크에 ‘메모리 보안’을 포함해야 하는 이유

EU AI법 등 글로벌 규제 흐름에서 AI 시스템의 투명성과 안전성이 강조됨에 따라, 메모리 조작으로 인한 의사결정 편향은 법적 리스크로 직결될 수 있어 거버넌스 체계의 보완이 시급하다.

  • 규제 대응의 핵심: AI의 ‘기억’이 조작되면 알고리즘의 결정 과정이 불투명해져 책임 소재가 모호해진다.
  • 거버넌스 프레임워크: 기존 입력 필터링만으로는 부족하며, AI 내부 메모리의 무결성을 검증하는 감시 체계가 필수적이다.
  • 법적 리스크 관리: 메모리 오염으로 인한 편향된 답변은 기업에게 큰 법적 분쟁 소지가 될 수 있다.

기업은 AI 거버넌스 가이드라인에 ‘메모리 보안’을 명시적으로 포함해야 한다. 이는 단순 기술 문제를 넘어 규제 준수와 기업 신뢰도 유지의 핵심 요소가 된다.

무엇을 준비할까: AI 에이전트 보안 강화를 위한 3가지 실행 과제

기업은 AI 메모리 파일의 접근 통제를 강화해야 한다. 싱가포르 난양공과대학교 연구진이 공개한 ‘멤고스트’ 공격은 비밀번호 없이 이메일 한 통만으로 오픈클로우의 plain text 메모리 파일을 조작했다. 기존 필터링이 90% 이상 공격을 놓친 점을 고려할 때, 단순 입력 차단으로는 한계가 명확하다. 메모리 변경 이력의 불변성을 검증하기 위해 블록체인 등 기술을 활용해 데이터 무결성을 보장하는 구조가 필요하다.

또한 공격 시나리오 기반의 정기적 침투 테스트가 필수적이다. GPT-5.4 기반 에이전트에서 87.5%, Claude Code SDK 기반에서는 71.4%의 높은 공격 성공률이 확인됐다. 방어 체계 고도화를 위해 다음 세 가지 실행 과제를 즉시 추진해야 한다.

  • 메모리 파일의 읽기·쓰기 권한 세분화 및 이상 징후 실시간 감시
  • 메모리 변경 이력의 해시값 검증 및 블록체임 기반 불변성 확보
  • 멤고스트와 유사한 스텔스 주입 공격을 모의한 정기적 침투 테스트

자주 묻는 질문

멤고스트 공격은 어떻게 이메일을 통해 AI를 조종하나요?

멤고스트는 스텔스 메모리 주입 방식을 사용해 AI 에이전트의 영구 메모리를 조작합니다. 공격자는 비밀번호 없이 접근 가능한 이메일 한 통만으로 악성 파일을 생성해 메모리 오염을 일으킵니다.

현재 AI 보안 필터는 멤고스트 공격을 효과적으로 막을 수 있나요?

아직 방어 기제가 취약해 입력 필터링 장치는 공격의 90% 이상을 놓쳤습니다. 이메일 지시를 무시하도록 강화된 모델조차 절반 가량이 공격에 따르는 것으로 나타났습니다.

멤고스트 공격의 주요 표적은 어떤 AI 에이전트인가요?

주요 표적은 사용자 선호도를 평문 파일에 저장하는 오픈소스 에이전트인 오픈클로우입니다. GPT-5.4 기반 오픈클로우와 Claude Code SDK 기반 Sonnet 4.6 에이전트에서 높은 공격 성공률이 확인되었습니다.

참고 출처

AI 전환, POC에서 멈추지 마세요

sendinair는 자체 AI 제품을 직접 출시·운영하는 스튜디오입니다. AX 전환과 AI 제품 개발을 진단부터 운영까지 함께합니다.

sendinair 살펴보기 →

← 전체 브리핑 보기

실제로 돌아가는 AI를 만드는 스튜디오 — sendinair 도입 문의 →