
AI 기업 인셉션(Inception)이 2026년 9월 8일 확산 모델로 문장을 만드는 AI 모델 머큐리 2.5(Mercury 2.5)를 발표했다. 일반적인 대규모언어모델(LLM)이 문장을 왼쪽부터 차례로 만드는 것과 달리 머큐리 2.5는 토큰 여러 개를 동시에 생성하고 수정하는 구조를 써서 초당 1,107토큰을 출력한다. 성능은 GPT-5.6 루나(GPT-5.6 Luna) 로우 설정 등에 맞먹으며 통상 요금은 100만 출력 토큰당 0.75달러(1,050원대)다.
일반적인 LLM 상당수는 직전까지 만든 토큰을 바탕으로 다음 토큰 1개를 정하는 처리를 반복하는 자기회귀 방식으로 문장을 만든다. 순서대로 생성하는 구조라 긴 답변을 만들수록 대기 시간이 쌓인다. 단순한 대화라면 몇 초로 끝나지만 검색 AI는 검색어 재작성과 검색 결과 재정렬, 정보 요약, 답변 작성 같은 처리마다 AI 모델을 쓰기 때문에 한 번씩 생기는 지연이 최종 응답 시간에 쌓인다.
인셉션이 속도를 끌어올리려고 택한 게 확산 대규모언어모델(dLLM)이다. 머큐리 시리즈는 처음부터 완성된 문장을 순서대로 확정하지 않는다. 답변 전체를 거친 상태에서 만들기 시작해 토큰 여러 개를 나란히 고쳐 가며 몇 단계 처리로 완성한다. 노이즈에서 이미지를 서서히 다듬어 가는 확산 모델 개념을 텍스트 생성에 옮긴 방식으로 이미지 생성 AI에서 많이 쓰인다.
인셉션은 2026년 2월 확산 모델 기반 AI 모델 머큐리 2를 발표하며 세계에서 가장 빠르다고 내세웠다. 머큐리 2.5는 머큐리 2를 강화한 모델이다. 머큐리 2 출력 속도는 엔비디아 블랙웰(NVIDIA Blackwell) GPU에서 초당 1,009토큰이었고 컨텍스트 길이는 12만8,000토큰이었다. 머큐리 2.5는 출력 속도가 초당 1,107토큰으로 올라갔고 컨텍스트 길이도 26만 토큰으로 늘었다.
속도만 올리려면 소형 모델을 쓰는 방법도 있지만 모델 능력이 떨어지면 복잡한 추론이나 코딩에 쓰기 어려워진다. 인셉션은 머큐리 2.5가 머큐리 2보다 성능을 끌어올려 비용 효율을 중시한 최신 모델인 GPT-5.6 루나 로우와 제미나이 3.5 플래시-라이트(Gemini 3.5 Flash-Lite), 클로드 하이쿠 4.5(Claude Haiku 4.5)와 비슷한 수준 품질에 도달했다고 밝혔다. 실제 사용자가 보낸 피드백과 운영 중 나온 실패 사례를 평가 방식과 학습에 반영해 머큐리 2.5로 이었다는 설명이다.
◇ 입력 요금 낮추고 출시 할인=요금은 100만 입력 토큰당 0.20달러 100만 출력 토큰당 0.75달러다. 머큐리 2가 100만 입력 토큰당 0.25달러 100만 출력 토큰당 0.75달러였던 만큼 입력 쪽 요금이 내려갔다. 출시 시점에는 80% 할인을 적용해 오픈라우터(OpenRouter)에서 100만 입력 토큰당 0.04달러 100만 출력 토큰당 0.15달러에 쓸 수 있다.
머큐리 2.5는 용도에 맞춰 추론 강도를 조절하는 기능도 지원한다. 외부 도구 여러 개를 동시에 호출하는 기능과 지정한 JSON 스키마에 맞춰 답변을 출력하는 기능도 갖췄다.
도입 사례를 보면 AI 전화 에이전트를 개발하는 오픈콜(OpenCall)에서는 모델 응답 시간 중앙값이 170밀리초까지 짧아졌다. 코딩 AI를 개발하는 오그먼트 코드(Augment Code)는 긴 작업 이력을 짧게 요약하는 컨텍스트 압축 처리를 머큐리로 바꾼 결과 처리 시간이 150초에서 27초가 됐고 비용도 90% 줄었다고 인셉션은 전했다.
머큐리 2.5는 인셉션 API와 베이스텐(Baseten), 오픈라우터에서 쓸 수 있다. 인셉션은 머큐리 2.5와 함께 음성 AI용 머큐리 보이스(Mercury Voice)와 입력 내용에 따라 적절한 AI 모델로 나눠 보내는 머큐리 라우터(Mercury Router) 미리보기 버전도 발표했다. 역대 최대 규모 차세대 모델 학습도 이미 시작했다고 밝혔다. 확산 모델 특유 속도와 토큰 효율을 유지하면서 능력을 더 끌어올려 앞으로 몇 달 안에 공개하는 걸 목표로 삼고 있다. 관련 내용은 이곳에서 확인할 수 있다.
![[DailyRecipe] 막 오른 넥스트라이즈2026…올해 특징은?](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/06/260618_nextrise_ai_0023052050235235.jpg?resize=350%2C250&ssl=1)
![[AI서머리] 에어빌리티, R&D·생산 통합 ‘기흥 캠퍼스’ 출범‧배민, 추석 앞두고 정산대금 조기 지급](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/09/260915_google-cloud_005025235_slimpic.webp?resize=350%2C250&ssl=1)
