
알리바바가 개발하는 AI 모델 큐웬(Qwen) 시리즈에 차세대 네이티브 옴니모달 모델 큐웬3.8 옴니 플래시(Qwen3.8-Omni-Flash)가 추가됐다. 이 모델은 동영상 편집·뮤직비디오 제작·영화 제작·시청각 요약·실시간 대화 등 작업 흐름 전반에서 뛰어난 성과를 냈다.
큐웬3.8 옴니 플래시는 100만 토큰 컨텍스트 윈도를 지원한다. 같은 크기 텍스트 전용 모델과 맞먹는 텍스트 성능을 유지하면서 옴니모달 기능을 크게 끌어올렸다.
벤치마크 29종 평균 점수는 큐웬3.5 옴니 플러스(Qwen3.5-Omni-Plus)보다 25% 넘게 올랐다. 반면 API 가격은 음성 입력 1시간당 98% 넘게 내려갔고 음성과 영상 입력 1시간당으로는 93% 넘게 싸졌다.
음성·영상 기반 에이전트와 코딩, 장기 과제를 다루는 벤치마크에서도 높은 점수를 냈다. WildClawBench-MM에서는 큐웬3.5 옴니 플러스보다 36.5 오른 71.0을 기록했고 UniClawBench에서도 69.6을 받았다.
장시간 음성과 음성·영상 이해, 음성·영상 추론, 음성·영상 캡션, 다중 화자 인식 같은 핵심 기능도 크게 나아졌다. 장시간 음성 이해력을 평가하는 LongAudioSpan에서는 82.7을 기록했다. 멀티모달 모델의 음성·영상 협조 추론 능력을 보는 OmniVideoBench에서는 63.4를 받았다. 동영상 캡션 생성 시 지시 이행 능력을 평가하는 OmniCap-IF에서는 28.2를 얻었고 중국어 다자·다채널 회의 음성 받아쓰기 벤치마크인 AliMeeting에서는 89.7을 냈다. 여러 벤치마크에서 제미나이 3.8 플래시(Gemini 3.8 Flash)를 앞섰다.
알리바바는 데이터와 컨텍스트, 에이전트 환경을 확장해 제미나이 3.8 플래시에 근접한 음성·영상 성능과 이를 넘어서는 전반적 음성 성능을 구현했다고 설명했다. 이런 진전은 음성과 영상이 단순한 지각 입력을 넘어 에이전트가 환경을 이해하고 추론하며 과제를 수행하는 핵심 매체로 진화하고 있다는 뜻이라고 덧붙였다.
음성 인식은 74개 언어를 지원한다. 음성 생성은 29개 언어를 지원한다. 큐웬3.8 옴니 플래시는 첸원AI(Qianwen AI)에서 쓸 수 있다. 알리바바는 음성과 동영상이 에이전트를 현실 업무 현장에 끌어들이는 데 중요한 매체지만 동시에 새로운 시스템 차원 과제도 낳는다고 설명했다. 긴 음성과 동영상은 여러 차례 추론을 거치는 동안 저장과 전송, 처리에 비용이 든다는 것이다. 알리바바는 기존 에이전트 하네스 프레임워크가 이런 모달리티를 네이티브로 지원하지 않는다고 지적했다. 옴니모달 이해와 처음부터 끝까지의 과제 실행을 잇는 작업 흐름도 아직 초기 단계라는 설명이다.
이런 과제를 풀려면 모델과 하네스 도구, 런타임 환경이 함께 발전해야 한다. 알리바바는 큐웬 MM 플러그인(Qwen-MM-Plugins)을 확장해 긴 음성·영상을 필요할 때 지각하는 기능과 도구 사용, 작업 흐름 실행 기능을 더했다. 또 큐웬3.8 옴니 플래시 리얼타임(Qwen3.8-Omni-Flash-Realtime) API를 바탕으로 설계한 종합 하네스 큐웬 라이브 하네스(Qwen-Live Harness)를 오픈소스로 공개했다. 다만 원문 작성 시점에는 큐웬 라이브 하네스 깃허브(GitHub) 페이지가 404 오류로 열리지 않았다. 관련 내용은 이곳에서 확인할 수 있다.
![[DailyRecipe] 막 오른 넥스트라이즈2026…올해 특징은?](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/06/260618_nextrise_ai_0023052050235235.jpg?resize=350%2C250&ssl=1)
![[AI서머리] 어피닛, 인도 시장 개척기 출간‧더핑크퐁컴퍼니 씰룩, 韓 넷플릭스 키즈 1위](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/09/2260921_woowayouths.com_5030052035_slimpic.webp?resize=75%2C75&ssl=1)

