x

이메일로 만나보는 스타트업 가이드

투자, 행사, 정부사업 등 스타트업 생태계 소식을 이메일로 편하게 받아보세요.

중국 AI 개발 기업 미니맥스(MiniMax)가 동영상 생성 AI 미니맥스 H3(MiniMax H3)를 발표했다. 미니맥스 H3는 최대 15초 분량 음성 포함 동영상을 생성할 수 있으며 텍스트·동영상·이미지·음성 입력에 대응한다. 또 조만간 모델 자체가 무료로 공개될 예정이다.

미니맥스 H3는 텍스트·동영상·이미지·음성 입력에 대응하며 이미지를 입력해 등장인물을 지정한다, 노랫소리를 입력해 립싱크 동영상을 제작한다 같은 조작이 가능하다. 복수 미디어를 동시에 입력해 동영상 한 편을 생성할 수도 있다. 동영상 해상도는 768p 또는 2K이며 최대 15초 분량 동영상을 생성할 수 있다.

아티피셜 애널리시스(Artificial Analysis) 테스트 결과도 이미 공개되어 있다. AI 모델명을 가린 상태에서 같은 프롬프트로 동영상을 생성해 우열을 가리는 방식으로 텍스트에서 음성 포함 동영상을 생성한다는 태스크 품질을 순위화한 결과 미니맥스 H3는 제미나이 옴니 플래시에 이어 2위에 올랐다. 고품질로 알려진 시댄스 2.0을 넘어선 것. 이미지에서 음성 포함 동영상을 생성하는 태스크의 경우 1위는 시댄스 2.0, 2위는 제미나이 옴니 플래시, 3위가 미니맥스 H3였다.

 

미니맥스 H3는 현재 API를 통해 이용할 수 있다. 또 컴피UI(ComfyUI) 등 서드파티 서비스에서도 미니맥스 H3 API를 이용한 동영상 생성이 가능하다. 모델 자체도 오픈 웨이트로 허깅페이스와 모델스코프에 공개됐다. 파일 크기는 int8_convrot 버전인 디퓨전(diffusion) 모델이 21GB이며 int8_convrot 버전 텍스트 인코더가 27.1GB다. VAE는 FP16 버전이 5.21GB, FP32 버전이 605MB이다. 관련 내용은 이곳에서 확인할 수 있다.

뉴스 레터 구독하기

Related Posts

Next Post