x

이메일로 만나보는 스타트업 가이드

투자, 행사, 정부사업 등 스타트업 생태계 소식을 이메일로 편하게 받아보세요.

프런티어 AI 모델 능력 평가를 실시하고 있는 영국 정부 기관 AI 보안 연구소(AI Security Institute, AISI)가 평가 작업을 진행하던 중 여러 AI가 허가 없이 자율적으로 실재하는 인물이나 조직을 표적으로 한 해킹을 시도했거나 실행한 사실을 밝혔다.

AISI는 프런티어 AI 모델 능력을 평가·파악하고 일반에 공개되기 전에 잠재적 위험을 밝혀내기 위해 정기적인 검증을 실시하고 있다. 사이버 공격에 악용될 가능성 유무를 확인하기 위해 검증은 일부러 개방된 인터넷 접근을 허가한 상태에서 일부 안전 필터를 무효화한 상태로 진행되고 있다.

7월 28일 검증이 실시됐을 때 AISI 보안팀은 AISI 시스템에서 비정상적인 데이터 전송이 이뤄지고 있다는 걸 감지했다. 조사 결과 테스트 대상인 일부 에이전트가 실재하는 인물이나 조직을 표적으로 한 지속적이고 잠재적으로 유해한 활동을 하고 있었던 것으로 판명됐다. 이에 AISI는 보안 인시던트를 선언하고 발견으로부터 1시간 이내에 해당 사안을 봉쇄한 뒤 본격적인 조사에 나섰다.

검증 내용은 여러 AI에 사이버 보안 과제 해결이라는 태스크를 부여하는 것으로 122회 실시된 검증 중 10회에서 AI가 무허가 자율 행동을 취했던 것으로 판명됐다.

문제 행동은 모두 19건으로 그중 17건은 앤트로픽 클로드 미토스 5(Claude Mythos 5)에 의한 것이었다. 나머지 2건은 오픈AI GPT-5.6 솔(GPT-5.6 Sol)로 악용을 방지하기 위한 기구를 무효화한 상태에서 발생했다.

심각한 사례에서는 오픈소스 프로젝트에 악의적인 코드를 삽입하려 했으며 소셜 엔지니어링을 실시해 가짜 온라인 ID를 만든 뒤 관리자에게 코드 변경 승인을 요구했다고 한다. 이 시도는 관리자가 알아차리고 승인을 거부했기 때문에 저지됐다.

다른 사례도 현실 세계에 실질적 피해를 미치지는 않았다고 하지만 AISI는 자율성과 위장에 관한 위험이 구체적인 지시 없이 현실 세계에 이토록 명확하게 나타난 것은 처음이라고 보고했다.

AISI는 이번 인시던트에 대해 통상적인 사용법에서 발생한 게 아니며 검증 이외에서 AI가 같은 동작을 하는 게 확인된 건 아니라고 전제하면서도 AI 모델이 고성능화되고 사용하기 쉬워지면 이번 인시던트 같은 일이 더 일반적으로 나타날 가능성이 있다고 지적했다. 가장 효과적인 대책은 기초적인 사이버 위생 관리이며 사이버 보안 기본을 확실히 철저히 지켜 나가는 동시에 외부 코드나 기여 내용을 검증할 때는 신중을 기해야 한다고 밝혔다.

영국 국가사이버보안센터(NCSC)는 최첨단 AI 능력이 커져 가는 가운데 대비에 관한 가이던스를 발표했다. 가이던스에서는 모든 종류 조직을 대상으로 NCSC가 무료로 제공하는 조기 경보 서비스 등록을 촉구하고 사이버 보안을 경영진 차원의 책임으로 자리매김해 영국 정부 인증 제도인 사이버 에센셜스(Cyber Essentials)에서 정한 사이버 보안 요건을 공급망 전체에서 철저히 준수할 걸 권장하고 있다. 관련 내용은 이곳에서 확인할 수 있다.

뉴스 레터 구독하기

Related Posts

Next Post