
스페이스X AI(SpaceXAI)가 음성 AI 모델인 그록 보이스 싱크 패스트 2.0(Grok Voice Think Fast 2.0)을 발표했다. 사용자와의 대화를 음성으로 주고받을 수 있는 모델로 전 모델을 기반으로 음성 추론 능력·대화 능력·도구를 사용할 때 신뢰성에서 대폭적인 향상을 실현했다.
아티피셜 애널리시스(Artificial Analysis) 벤치마크 중 대화 다이내믹스를 제외한 4개 항목에서 그록 보이스 싱크 패스트 2.0은 비교 대상 중 최고 점수 또는 최고 속도를 기록했다. 아티피셜 애널리시스에 따르면 그록 보이스 싱크 패스트 2.0은 스피치 투 스피치 퀄리티 인덱스(Speech-to-Speech Quality Index)에서 큐웬 오디오 3.0 TTS 플러스(Qwen Audio 3.0 TTS Plus)에 이어 2위, 에이전트 퍼포먼스에서 1위를 차지하면서도 첫 음성까지의 속도가 0.70초로 최고 속도 수준이라고 한다.
그록 보이스 싱크 패스트 2.0은 음성 대화뿐만 아니라 받아쓰기 모델로서도 뛰어나다. 24개 언어에 걸쳐 짧은 구문 수천 개를 대상으로 한 평가에서 음성 인식과 음성 합성에 특화된 딥그램 노바 3(Deepgram Nova 3) 및 일레븐랩스가 150ms 저지연으로 가장 정확한 실시간 받아쓰기라고 내세우는 음성 인식 모델인 스크라이브 v2(Scribe v2)와 비교해 그록 보이스 싱크 패스트 2.0은 1.5~2.0배 개선을 기록했다. 전 모델인 그록 보이스 싱크 패스트 1.0과 비교하면 1.4배 개선을 실현했다. 또 스페이스X AI에 따르면 그록 보이스 싱크 패스트 2.0은 배경 소음이나 전화 통화의 열화 음성 등 실제 환경에서 매우 뛰어난 퍼포먼스를 발휘할 수 있도록 개발에 주력했으며 소음이 심한 환경에서는 기타 음성 인식 모델과의 격차가 10배까지 벌어진다고 한다.
그록 보이스 싱크 패스트(Grok Voice Think Fast) 모델의 특징은 발화하면서 동시에 쿼리를 추론하기 때문에 다른 음성 대화 모델보다 훨씬 뛰어난 지능을 보이면서도 지연 시간을 증가시키지 않도록 설계됐다. 나아가 그록 보이스 싱크 패스트 2.0에서는 전 모델 대비 추론 토큰 처리 효율이 높아지도록 훈련되어 추론 토큰을 60% 삭감했다고 한다. 이에 따라 실제 운용 환경에서는 도구 호출이 보다 신속해져 보통 에이전트 첫 문장이 끝나기 전에 실행된다고 한다.
grok-voice-latest라는 지정으로 사용하고 있는 경우 8월 5일부터 자동으로 그록 보이스 싱크 패스트 2.0으로 전환된다. 업그레이드를 위해 별도 조작은 필요 없지만 전 모델을 계속 사용하고 싶은 경우에는 grok-voice-think-fast-1.0을 지정해 버전을 고정해야 한다. 그록 보이스 싱크 패스트 2.0 요금은 음성 1분당 0.08달러다. 관련 내용은 이곳에서 확인할 수 있다.
![[DailyRecipe] 막 오른 넥스트라이즈2026…올해 특징은?](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/06/260618_nextrise_ai_0023052050235235.jpg?resize=350%2C250&ssl=1)
![[DailyRecipe] 15억 투자 예약…디캠프 배치 3기 스타트업 7곳](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2025/06/250618_dcamp_ai_0005553252353.jpg?resize=350%2C250&ssl=1)
