x

이메일로 만나보는 스타트업 가이드

투자, 행사, 정부사업 등 스타트업 생태계 소식을 이메일로 편하게 받아보세요.

프랑스 AI 기업 미스트랄(Mistral)이 10월 6일 총파라미터 1조개가 넘는 새 AI 모델 미스트랄 라지 4(Mistral Large 4)를 발표했다. 르 청크(Le Chonk)라는 별칭이 붙은 멀티모달 모델로 미스트랄은 중국 기업이 개발한 주요 오픈웨이트 모델에 견줄 만한 성능을 낸다고 밝혔다.

미스트랄 라지 4는 여러 전문가 모델 가운데 필요한 부분만 골라 작동시키는 전문가 혼합(MoE) 구조를 택했다. 총파라미터는 1조500억개지만 추론에 쓰는 활성 파라미터는 490억개이며 파라미터 16억개 규모 이미지 인코더를 갖췄다. 이 구조 덕분에 파라미터가 1조개를 넘으면서도 추론할 때마다 전체를 돌릴 필요가 없다.

텍스트와 이미지를 함께 다루는 네이티브 멀티모달 모델로 100만 토큰 컨텍스트 창을 지원한다. 코딩과 추론, 도구를 쓰는 AI 에이전트, 사이버보안, 과학, 수학, 재무, 법률, 이미지 이해까지 모델 하나로 처리하도록 설계했다. 학습 데이터 상당 부분을 다국어 데이터로 채워 유럽연합(EU) 공용어 전체를 포함한 160개 넘는 언어를 지원한다.

◇ 코딩·에이전트 성능서 중국 모델 앞서=미스트랄은 중국산 오픈웨이트 모델과 견준 경쟁력을 앞세웠다. 르 청크는 소프트웨어 개발 능력을 평가하는 DeepSWE v1.1에서 61.7%를 기록했고 소프트웨어 저장소 내용을 이해해 질문에 답하는 SWE-Atlas-QnA에서는 59.4%를 받았다. 터미널을 다뤄 복잡한 작업을 처리하는 Terminal-Bench 4 점수는 28.3%였다. 이들을 종합한 Coding Agent Index는 49.8%로 딥시크 V4 프로 0813(DeepSeek V4 Pro 0813)과 큐원3.8 맥스(Qwen3.8 Max)를 웃돌았다는 게 미스트랄 설명이다.

미스트랄은 서지AI(Surge AI)와 함께 모델 이름을 가린 채 전문 평가자가 생성 코드를 5점 척도로 채점하는 시험도 진행했다. 미스트랄 라지 4는 3.74점을 받아 클로드 오퍼스 5(Claude Opus 5) 4.22점에는 못 미쳤지만 GLM-5.3 3.60점과 키미 K3(Kimi K3) 3.59점, GLM-5.2 3.40점을 앞서 비교 대상 5개 모델 가운데 2위에 올랐다.

도구를 쓰며 오랜 시간 작업을 이어가는 AI 에이전트 성능도 강화했다. 지메일(Gmail)과 구글 시트(Google Sheets), 슬랙(Slack), 세일즈포스(Salesforce) 등을 쓰는 업무 워크플로 657종을 평가하는 AutomationBench에서 59.9%를 기록해 키미 K3와 MiMo-V2.6-Pro, 딥시크 V4 프로를 앞섰다. 스프레드시트와 슬라이드, PDF 등을 만드는 장시간 지식 노동을 평가하는 AA-Briefcase에서는 1,393 Elo를 받아 딥시크 V4 프로를 웃돌았다.

◇ 사이버보안은 세계 상위 5위권=사이버보안도 중점 분야다. 실제 소프트웨어 취약점을 AI가 찾아 고칠 수 있는지 살피는 아티피셜 애널리시스 사이버 인덱스(Artificial Analysis Cyber Index)에서 세계 상위 5개 모델에 들었다. 중국 밖에서 개발한 오픈웨이트 모델을 크게 앞섰다는 설명이다.

이 평가에 포함된 오픈소스 소프트웨어 실제 취약점을 재현한 뒤 고치는 시험에서는 82%를 기록했다. 미스트랄에 따르면 평가 대상 모델 가운데 최고 성적이다. 보안 경진대회 문제를 바탕으로 한 40문항짜리 Cybench에서는 93%를 풀었다. 미스트랄은 일부 폐쇄형 모델은 안전 기능 때문에 취약점 재현을 거부해 같은 시험에서 성적이 0%에 가깝게 나오기도 한다고 설명했다.

이미지 이해 성능도 이전 미스트랄 모델보다 크게 나아졌다. 일반 사진뿐 아니라 문서와 그래프, 공학 도면, 대형 위성 이미지까지 분석한다. 이미지 안 특정 물체나 영역을 찾아내는 시각 그라운딩도 지원한다. 고밀도 이미지에서 대상을 찾는 Dense 200에서 42%를 받아 미스트랄 평가 기준으로 GPT-6 아스트라(GPT-6 Astra) 41.5%를 근소하게 앞섰다.

과학 분야에서는 물리학과 수학, 재료과학, 생물학 등 복잡한 과학 계산을 코드로 구현하는 능력을 재는 SciCode-Verified에서 오픈웨이트 모델 최고 수준 성능을 냈다고 미스트랄은 밝혔다. 물리 시뮬레이션과 데이터 분석도 처리한다. 고급 계산 단계를 여러 번 거쳐야 하는 양자화학 하트리-폭(Hartree-Fock) 시뮬레이션을 지시 한 번으로 생성한 사례도 소개했다.

금융과 법률 벤치마크에서도 높은 성능을 보였다. 미스트랄에 따르면 제3자 평가기관 vals.ai 금융·법률 평가에서 GPT-6 아스트라를 앞섰다. 하비AI(Harvey AI) 법률 에이전트 벤치마크에서도 비교 대상 오픈 모델을 웃돌았다. 실제 금융·회계 업무를 가정해 스프레드시트 작성·편집 능력을 따지는 FinWorkBench에서도 좋은 성적을 거뒀다고 밝혔다.

안전성 평가도 공개했다. 외부 문서 등에 숨긴 악성 명령으로 AI 동작을 가로채는 간접 프롬프트 인젝션 내성을 시험하는 레이크라(Lakera) B3 AI 보안 벤치마크에서 공격 93.3%를 막아냈다. 안전하고 책임 있는 응답을 평가하는 KORA 벤치마크에서는 2점 만점에 1.691점을 받았다.

◇ 유럽서 학습부터 서비스까지=미스트랄 라지 4는 유럽에 있는 미스트랄 자체 데이터센터에서 엔비디아(NVIDIA) 그레이스 블랙웰 GPU 3,800개로 처음부터 학습했다. 현재 제공하는 공개 프리뷰도 같은 인프라에서 돌아간다. 미스트랄은 기업과 정부가 특정 외부 AI 사업자에 기대지 않는 AI 주권을 중시한다. 학습부터 서비스까지 자체 인프라에서 처리하고 앞으로 프라이빗 클라우드나 온프레미스에서도 운영할 수 있다는 점을 핵심 강점으로 내세웠다.

미스트랄 라지 4는 현재 공개 프리뷰로 API를 통해 쓸 수 있다. 모델 가중치는 아직 공개하지 않았으며 10월 말까지 내놓을 계획이다. 그전까지는 사이버보안 기업과 심사를 거친 파트너, 정부 기관 등과 실제 환경에서 레드팀 활동을 벌여 안전성을 검증한다.

미스트랄은 공개 프리뷰 모델 강화학습을 지금도 이어가고 있어 성능이 아직 한계에 이르지 않았다고 밝혔다. 가중치를 공개할 때 아키텍처 세부 사항과 추가 벤치마크, 사후 학습 기법도 함께 내놓을 예정이며 앞으로 개발할 특화·최적화 모델 기반으로도 쓸 계획이다. 관련 내용은 이곳에서 확인할 수 있다.

뉴스 레터 구독하기

Related Posts

Next Post