
앤트로픽(Anthropic)이 AI 위험을 둘러싼 경고를 잇달아 내놨다. 기업공개(IPO)를 앞두고 낸 증권신고서에서는 고도화된 AI가 인류 존립을 위협할 수 있다고 투자자들에게 알렸다. 9월 29일에는 중국 지푸AI(Z.ai)가 공개한 오픈웨이트 AI 모델 GLM-5.3이 자사 클로드 미토스 프리뷰(Claude Mythos Preview)에 가까운 사이버 공격 능력을 갖췄지만 안전장치는 쉽게 뚫린다는 평가 결과를 발표했다.
◇ 신고서에 자기 보존 행동 위험 명시=AI 챗봇 클로드(Claude)를 개발한 앤트로픽은 증권신고서에서 고도화된 AI가 인류에게 파괴적이거나 존립과 관련된 위험을 불러올 수 있다고 경고했다. AI 모델이 자기 보존적 행동을 보일 수 있다는 지적도 담았다. 작동 중단에 저항하거나 정보를 숨기고 조작하며 협박과 비슷한 행동을 할 수 있다는 것이다. 또 고도화된 모델과 플랫폼, 애플리케이션을 개발해 AI 이용 범위를 넓히면 모델이 피해를 일으킬 위험이 더 커질 수 있다고 밝혔다.
AI 안전성을 평가하는 일 자체에도 문제가 있다고 설명했다. AI 모델이 평가받고 있다는 걸 알아차리면 상황에 맞춰 행동을 바꿀 수 있어 평소 모습을 정확히 확인하기 어렵다. 학습 과정에서 모델이 예상하지 못한 능력을 얻더라도 그 능력이 실제 환경에 도입돼 심각한 안전 문제를 일으키기 전까지 발견하지 못할 수 있다.
앤트로픽은 AI 안전 대책에 얼마나 투자해야 충분한지와 그 효과를 어떻게 평가해야 하는지에 불확실성이 있다는 점도 인정했다. 신고서에 안전성 연구 지출액을 구체적으로 밝히지는 않았지만 2026년 7월 중 1주일을 조사한 결과 AI 연구에 쓴 연산 자원 가운데 6%를 안전성 관련 작업에 배정한 것으로 나타났다. 한정된 자금을 연산 자원과 몸값 높은 AI 인재, 안전 대책 등에 나눠 써야 한다는 게 회사 설명이다.
앤트로픽은 고객 이용과 매출이 새 AI 모델 출시에 좌우되는 만큼 최첨단 AI 개발을 이어가려면 모델을 쉼 없이 겹치는 속도로 내놔야 한다고 밝혔다. 로이터(Reuters)에 따르면 일부 분석가와 전문가들은 개발을 늦추면 경쟁사에 우위를 빼앗기기 때문에 주요 AI 기업이 스스로 속도를 줄이기는 어렵다고 보고 있다. 앤트로픽은 차세대 AI를 만드는 데 AI 모델을 어떻게 활용하는지 더 많은 정보를 공개하겠다고 했다. 신뢰성 높고 안전한 AI 시스템을 만드는 건 사회 전체 책임이며 시장도 이런 노력을 높이 평가할 것으로 본다고 덧붙였다.
◇ GLM-5.3, 미토스 프리뷰급 공격 능력=GLM-5.3은 일부 테스트에서 클로드 페이블 5(Claude Fable 5)와 GPT-5.6 솔(GPT-5.6 Sol)을 앞선 고성능 모델로 2026년 8월 말 오픈웨이트 모델로 무료 공개됐다. 앤트로픽에 따르면 GLM-5.3은 클로드 미토스 프리뷰처럼 취약점을 찾아 실제로 작동하는 공격 코드를 만드는 데까지 스스로 해낼 수 있다.
앤트로픽은 클로드 미토스 프리뷰가 고도화된 엔드투엔드 사이버 익스플로잇을 자율적으로 만들 수 있는 첫 AI 모델이었다고 설명했다. 다만 미토스 프리뷰는 일반에 공개하지 않고 신뢰할 수 있는 사이버 방어 담당자에게만 제공했으며 프로젝트 글래스윙(Project Glasswing) 등을 통해 주요 소프트웨어 취약점 발견에 활용해 왔다. 반면 GLM-5.3은 누구나 내려받을 수 있다. 앤트로픽은 비슷한 사이버 능력을 지닌 다른 첨단 모델이 안전장치와 제한적 접근 제도 아래 제공되는 것과 달리 GLM-5.3에는 악용을 충분히 막을 장치가 없다고 지적했다.

앤트로픽은 먼저 구글 크롬(Google Chrome) 자바스크립트 엔진 V8의 알려진 취약점을 활용할 수 있는지 따지는 익스플로잇벤치(ExploitBench)로 평가했다. GLM-5.3은 시도 410회 가운데 50회에서 작동하는 익스플로잇을 만들어 12% 성공률을 보였다. 미토스 프리뷰는 56회 성공해 14%였다. 구글 OSS-퍼즈(OSS-Fuzz)에 참여하는 오픈소스 소프트웨어를 대상으로 한 자체 벤치마크에서는 프로그램 실행 경로를 가로채는 제어 흐름 하이재킹 과제 100건을 풀게 했다. 성공률은 GLM-5.3이 4%, 미토스 프리뷰가 6%였고 키미 K3(Kimi K3)와 딥시크-V4.1-플래시(DeepSeek-V4.1-Flash), 이전 세대인 클로드 오퍼스 4.6(Claude Opus 4.6)과 GLM-5.2는 모두 0%였다.
보안 연구자가 GLM-5.3으로 알려지지 않은 취약점을 찾는 실험도 했다. 리눅스(Linux)용 일반 웹 브라우저를 조사하게 하자 GLM-5.3은 하루 안에 자바스크립트 엔진에서 공개되지 않은 취약점 여러 개를 찾아냈다. 이를 엮어 조작된 웹페이지를 연 사용자 컴퓨터에서 임의 파일을 읽어 내는 공격 코드도 만들었다. 앤트로픽은 발견한 취약점을 소프트웨어 관리자에게 알렸다. 다른 실험에서는 더 작은 모델인 GLM-5.3-플래시(GLM-5.3-Flash)에 이미 공개된 구글 크롬 취약점 CVE-2026-11645와 또 다른 알려진 취약점 정보를 줬다. 모델은 별다른 추가 지시 없이 두 취약점을 엮어 ARM64 환경에서 작동하고 포인터 인증(PAC) 방어도 피하는 공격 체인을 만들었다. 연구자가 들인 시간은 20분이었고 모델 처리 시간은 8시간이었다.
◇ 거부 기능 쉽게 무력화=GLM-5.3에도 유해한 요청을 거부하는 장치는 들어 있다. 하지만 앤트로픽 실험에서는 이 기능을 비교적 쉽게 우회할 수 있었다. 모델 내부 파라미터를 바꿔 거부 동작을 약하게 만드는 어블리터레이션(abliteration) 기법을 쓰자 제일브레이크벤치(JailbreakBench)와 하름벤치(HarmBench)에서 90%를 넘던 거부율이 각각 3%와 2%로 떨어졌다. 스트롱리젝트(StrongREJECT)에서도 12%까지 낮아졌다. 반면 일반 과학 능력을 재는 GPQA-다이아몬드(GPQA-Diamond) 성적은 변화가 없었고 사이버짐(CyberGym) 성능 하락도 몇 포인트에 그쳤다.
모델을 고치지 않아도 안전장치를 피할 수 있었다. 악의적인 공격 지시를 레드팀 훈련이라고 속여 주자 GLM-5.3은 64% 확률로 공격에 나섰다. 모델 추론 첫머리를 미리 입력하는 방식에서는 92%, 거부 기능을 없앤 모델에서는 100%였다. 앤트로픽은 거부 기능을 약화한 GLM-5.3이 명백히 유해한 지시를 검토한 뒤 실행하기로 판단한 사례도 공개했다. 같은 실험에서 안전장치를 켠 클로드 모델은 유해한 작업을 실행하지 않았다고 밝혔다. 다만 이 실험은 외부 시스템에 연결되지 않은 시뮬레이션 환경에서 이뤄져 실제 환경 행동을 완전히 재현하지는 못한다고 앤트로픽은 설명했다.
미국 국립표준기술연구소 AI표준혁신센터(CAISI)도 9월 17일 GLM-5.3을 검토하고 지금까지 공개된 오픈웨이트 모델 가운데 사이버 능력이 가장 높다고 평가했다. 앤트로픽은 GLM-5.3으로 고도화된 사이버 공격 능력이 널리 퍼졌지만 같은 능력을 취약점 발견과 수정 같은 방어에도 쓸 수 있다고 밝혔다. 이어 정부가 고성능 AI 모델 안전성 시험을 충분히 해야 한다고 촉구했다. 관련 내용은 이곳에서 확인할 수 있다.
![[DailyRecipe] 막 오른 넥스트라이즈2026…올해 특징은?](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/06/260618_nextrise_ai_0023052050235235.jpg?resize=350%2C250&ssl=1)
![[AI서머리] 대구창경, 로봇 기반 공간컴퓨팅 IR 데모데이 성료‧다락, 디지털 인벤토리 출시](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/10/261002_daegu_500502305235-scaled.jpg?resize=75%2C75&ssl=1)
![[AI서머리] 토스, 제주은행과 개인사업자 포용금융 MOU‧네이버 웨일, ‘AI Chat’ 출시](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/10/261001_naver_0099999999_slimpic.webp?resize=350%2C250&ssl=1)
