x

이메일로 만나보는 스타트업 가이드

투자, 행사, 정부사업 등 스타트업 생태계 소식을 이메일로 편하게 받아보세요.

오픈AI가 이용자 1만 5,000명 이상이 가담한 조직적 적대적 증류 공격을 탐지했다고 밝혔다. 오픈AI는 공격 활동 중심에 키미(Kimi) 시리즈 개발사인 중국 기업 문샷AI(Moonshot AI)와 관련된 인물이 있었던 것으로 추정된다고 설명했다.

증류는 AI 모델 학습 기법 가운데 하나로 개발 중인 모델에 기존 모델 사고 내용이나 출력을 학습시켜 기존 모델과 닮은 모델로 만드는 방식이다. 증류 자체는 유용한 기법이며 대형 모델 지식을 뽑아내 소형 모델에 비슷한 능력을 부여하는 용도 등에 쓰인다. 하지만 증류를 금지한 기업 모델에 증류 목적으로 부정하게 접근하는 적대적 증류라는 행위도 관측되고 있다.

◇ 금지에도 이어지는 적대적 증류=오픈AI와 앤트로픽(Anthropic) 등은 이용약관으로 자사 모델을 증류에 쓰는 걸 금지하고 있다. 증류 목적으로 의심되는 접근을 차단하거나 사고 내용을 암호화하는 대책도 시행 중이다. 오픈AI 이용약관에는 출력물을 활용해 오픈AI와 경쟁하는 모델을 개발하는 행위가 금지 사항으로 명시돼 있다. 그럼에도 적대적 증류는 계속되고 있다. 2026년 9월에는 미국 연방수사국(FBI)과 국가안보국(NSA)이 딥시크(DeepSeek), 문샷AI, 알리바바(Alibaba), 미니맥스(MiniMax), 스텝펀(StepFun), 지에이아이(Z.ai) 같은 중국 기업이 오픈AI와 앤트로픽 등 미국 기업을 상대로 적대적 증류를 하고 있다는 성명을 발표했다.

◇ 암호화된 사고 내용 빼낸 수법=오픈AI가 새로 밝힌 사례는 2026년 7월 1일 시작된 조직적 적대적 증류다. 오픈AI 발표에 따르면 일련의 활동은 AI 사고 내용을 빼내는 게 목적이었다. AI 모델은 최종 텍스트를 출력하기 전에 사고라 불리는 과정을 거치며 이 과정 정확도가 최종 출력 품질을 좌우한다. 오픈AI는 사고 내용을 암호화하고 있다. 하지만 공격자는 고성능 모델 사고 내용을 같은 회사 저성능 모델에 읽힌 뒤 저성능 모델에 탈옥 공격을 가해 사고 내용을 평문으로 출력하게 하는 수법으로 이를 빼냈다.

오픈AI에 따르면 조직적 적대적 증류는 2026년 7월 1일 소수 이용자가 시작했다. 7월 24일부터 25일 사이 가담 이용자가 4,000명 이상으로 급증하면서 공격 요청 1만6,000건이 전송됐다. 추가 조사 결과 이용자 1만5,000명 이상으로 이뤄진 공격 집단이 확인됐고 오픈AI는 7월 28일 공격을 차단했다. 오픈AI는 기간 중 관측된 공격자 모두가 단일 조직 관리 아래 있었는지는 확실하지 않다면서도 공격 활동 중심에는 문샷AI와 관련된 인물이 있었던 것으로 추정된다고 밝혔다.

이번 공격은 조직화된 이용자들이 자신이 입력한 내용에 대한 사고 내용을 빼낸 것으로 챗GPT(ChatGPT) 이용자 개인정보가 침해된 건 아니다. 오픈AI는 적대적 증류 대응을 강화하고 있으며 업계 단체인 프런티어모델포럼(Frontier Model Forum)을 통해 다른 AI 기업과도 정보를 공유했다고 밝혔다. 관련 내용은 이곳에서 확인할 수 있다.

뉴스 레터 구독하기

Related Posts

Next Post