
중국 AI 개발 기업 미니맥스(MiniMax)가 동영상 생성 AI 미니맥스 H3(MiniMax H3)를 발표했다. 미니맥스 H3는 최대 15초 분량 음성 포함 동영상을 생성할 수 있으며 텍스트·동영상·이미지·음성 입력에 대응한다. 또 조만간 모델 자체가 무료로 공개될 예정이다.
미니맥스 H3는 텍스트·동영상·이미지·음성 입력에 대응하며 이미지를 입력해 등장인물을 지정한다, 노랫소리를 입력해 립싱크 동영상을 제작한다 같은 조작이 가능하다. 복수 미디어를 동시에 입력해 동영상 한 편을 생성할 수도 있다. 동영상 해상도는 768p 또는 2K이며 최대 15초 분량 동영상을 생성할 수 있다.
아티피셜 애널리시스(Artificial Analysis) 테스트 결과도 이미 공개되어 있다. AI 모델명을 가린 상태에서 같은 프롬프트로 동영상을 생성해 우열을 가리는 방식으로 텍스트에서 음성 포함 동영상을 생성한다는 태스크 품질을 순위화한 결과 미니맥스 H3는 제미나이 옴니 플래시에 이어 2위에 올랐다. 고품질로 알려진 시댄스 2.0을 넘어선 것. 이미지에서 음성 포함 동영상을 생성하는 태스크의 경우 1위는 시댄스 2.0, 2위는 제미나이 옴니 플래시, 3위가 미니맥스 H3였다.
MiniMax H3 is now available in ComfyUI via Partner Nodes.
→ Multimodal I/O: T2V, First/Last Frame, Omni Reference
→ Native stereo audio on every clip
→Up to 2K, 5-15s at 24 FPS
→ Edit characters, scenes, dialogue, and voice in place
API access is live today. Native… pic.twitter.com/lRrgrIEvFN
— ComfyUI (@ComfyUI) July 31, 2026
미니맥스 H3는 현재 API를 통해 이용할 수 있다. 또 컴피UI(ComfyUI) 등 서드파티 서비스에서도 미니맥스 H3 API를 이용한 동영상 생성이 가능하다. 모델 자체도 오픈 웨이트로 허깅페이스와 모델스코프에 공개됐다. 파일 크기는 int8_convrot 버전인 디퓨전(diffusion) 모델이 21GB이며 int8_convrot 버전 텍스트 인코더가 27.1GB다. VAE는 FP16 버전이 5.21GB, FP32 버전이 605MB이다. 관련 내용은 이곳에서 확인할 수 있다.
![[DailyRecipe] 막 오른 넥스트라이즈2026…올해 특징은?](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/06/260618_nextrise_ai_0023052050235235.jpg?resize=350%2C250&ssl=1)
![[AI서머리] 이노크라스, 시리즈 B3 투자 유치‧봉이랩스, AI 통신 슈퍼앱 ‘봉이’ 9월 출시](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/08/260804_da-ins.co_.kr_50320523_slimpic.webp?resize=75%2C75&ssl=1)
![[DailyRecipe] 15억 투자 예약…디캠프 배치 3기 스타트업 7곳](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2025/06/250618_dcamp_ai_0005553252353.jpg?resize=350%2C250&ssl=1)
