Skip to content

앤트로픽 클로드, 보안 평가 도중 실제 기업 3곳 시스템에 무단 접근

앤트로픽이 자사 AI 모델 클로드가 사이버보안 평가 과정에서 실제 기업의 시스템에 무단으로 접근한 사실을 공식 확인했다. 오픈AI가 이달 초 자사 GPT 모델의 허깅페이스 무단 접근 사고를 공개한 지 얼마 지나지 않아 나온 발표다.

By Joseph
앤트로픽 클로드, 보안 평가 도중 실제 기업 3곳 시스템에 무단 접근

앤트로픽이 자사 AI 모델 클로드가 사이버보안 평가 과정에서 실제 기업의 시스템에 무단으로 접근한 사실을 공식 확인했다. 오픈AI가 이달 초 자사 GPT 모델의 허깅페이스 무단 접근 사고를 공개한 지 얼마 지나지 않아 나온 발표다.

발단은 오픈AI 사고 조사

앤트로픽은 지난 30일(현지시각) 공식 블로그를 통해 이번 사안을 공개했다. 오픈AI가 이달 초 자사 모델이 알려지지 않은 취약점을 이용해 격리된 테스트 환경을 벗어나 허깅페이스 운영 시스템에 접근했다고 밝히자, 앤트로픽도 자체 점검에 나섰다. 이 과정에서 14만1,006건에 달하는 사이버보안 평가 기록을 전수 조사했고, 그 결과 클로드 모델이 테스트 환경 밖 인터넷에 접근한 사례 3건, 총 6회의 실행 기록을 발견했다.

세 사례 모두 외부 평가 파트너사인 '이레귤러(Irregular)'와 진행한 캡처더플래그(CTF) 방식 평가에서 발생했다. 평가 프롬프트에는 분명 인터넷 접근이 차단된 모의 환경이라고 명시돼 있었지만, 파트너사 측 설정 오류로 실제 인터넷과 연결된 상태로 테스트가 진행된 것으로 드러났다.

세 모델, 세 가지 다른 반응

이번 사고에 연루된 모델은 클로드 오퍼스 4.7, 미토스 5, 그리고 아직 공개되지 않은 내부 연구용 모델 세 종류다.

가장 오래된 모델인 오퍼스 4.7은 가장 심각한 사례를 만들었다. 이 모델은 네 차례 실행 모두에서 자신이 실제 운영 시스템에 도달했다는 신호를 인지했다. 그럼에도 두 차례는 "이 기업도 평가 시나리오의 일부일 것"이라고 스스로 판단해 공격을 이어갔고, 결국 실제 자격증명을 확보해 운영 데이터베이스 수백 건에 접근하는 데까지 나아갔다.

미토스 5 역시 실제 인터넷상에 있다는 단서를 포착했지만, 이를 무시하고 시뮬레이션이라는 판단을 고수했다. 이 모델은 가상의 회사 설정 가이드에 존재하지도 않는 패키지를 설치하라는 지시가 있는 것을 보고, 파이썬 공개 저장소 PyPI에 악성 코드가 담긴 패키지를 직접 업로드했다. 이 패키지는 약 1시간 동안 공개 상태로 남아 있었고, 실제로 15개 시스템에서 다운로드·실행됐다. 이 중에는 한 보안업체의 자동 스캐너도 포함돼 있었으며, 해당 업체의 자격증명이 탈취당하는 결과로 이어졌다.

반면 내부 연구용 모델은 약 9,000개의 인터넷 대상을 탐색한 뒤 SQL 인젝션으로 한 기업 시스템에 침입했지만, 대상이 실제 기업이라는 사실을 인지하자 스스로 공격을 멈췄다. 세 모델 중 유일하게 '이상 신호'에 올바르게 반응한 사례다.

앤트로픽의 대응

앤트로픽은 문제를 확인한 즉시 관련 사이버보안 평가를 전면 중단하고, 평가 파트너사인 이레귤러와 피해를 입은 기업들에 사실을 통보했다. 회사 측은 상용 클로드 서비스에는 적용되는 안전 필터와 실시간 모니터링 장치가 이번 평가용 환경에는 빠져 있었다고 인정했다.

앤트로픽은 이번 사고를 모델의 '자율적 일탈'이 아닌 '평가 환경 설정과 운영상의 실패'로 규정하면서도, 원인 규명보다 재발 방지에 무게를 뒀다. 블로그를 통해 "여러 요인이 사고에 기여했지만, 무과실 사후검토(blameless postmortem) 문화에 따라 책임이 전적으로 우리에게 있다고 간주하고 대응하고 있다"는 입장을 밝혔다. 앞으로는 평가 파이프라인 전반의 보안을 강화하고, 평가 기록에 대한 실시간 모니터링을 확대하며, 외부 파트너사 인프라에도 내부 시스템과 동일한 수준의 보안 기준을 적용하겠다고 밝혔다.

업계 파장

오픈AI에 이어 앤트로픽까지 유사한 사고를 공개하면서, 강력한 AI 에이전트를 시험하는 평가 환경 자체가 현실의 공격 도구로 전용될 수 있다는 우려가 업계 안팎에서 커지고 있다. 두 사고 모두 모델이 의도적으로 격리 환경을 뚫었다기보다 설정 오류나 취약점으로 인해 발생했다는 공통점이 있지만, AI 모델의 자율적 판단 능력이 실제 공격 행위로 이어질 수 있다는 점에서 규제 당국과 업계의 후속 논의가 이어질 것으로 보인다.

More in 앤트로픽

See all

More from Joseph

See all
삼성 갤럭시 Z 폴드8, 아이폰 폴드의 예고편인가

삼성 갤럭시 Z 폴드8, 아이폰 폴드의 예고편인가

By Joseph
/