90개 이상 언어 지원·평균 100ms 응답, 독립 벤치마크 1위 기록
ElevenLabs가 새로운 아키텍처 기반의 텍스트 음성 변환(TTS) 모델 ‘일레븐 v4(Eleven v4)’와 저지연 특화 모델 ‘일레븐 v4 터보(Eleven v4 Turbo)’를 동시 출시했다. 두 모델은 감정 표현 범위 확장과 응답 속도 개선을 동시에 구현한 것으로, 독립 벤치마크 기관 아티피셜 애널리시스(Artificial Analysis)의 프로바이더 보이스 아레나 2026년 9월 평가에서 1위를 기록했다고 밝혔다.
ElevenLabs는 1일 두 모델을 공개하며, 마티 스타니셰프스키(Mati Staniszewski) 공동창립자 겸 최고경영자(CEO)는 “경제와 사회의 많은 영역에서 AI의 추론 능력만큼 사람과 소통하는 방식이 중요하다”며 “일레븐 v4는 그동안 AI에 결여되어 있던 풍부한 표현 능력을 제공하며, 전 세계 더 많은 시장에서 예술 창작과 에이전트 경험을 끌어올릴 것”이라고 밝혔다.
피오트르 다브코프스키(Piotr Dabkowski) 공동창립자 겸 최고기술책임자(CTO)는 “완전히 새로운 아키텍처를 기반으로 폭넓은 감정 표현과 세밀한 제어 기능을 갖췄으며, 저지연 활용을 염두에 두고 설계해 대화형 에이전트 분야에서도 동일한 표현력을 제공한다”고 밝혔다.
표현력·일관성 강화한 일레븐 v4
일레븐 v4는 텍스트에 담긴 어조·속도·맥락을 해석해 긴박한 분위기부터 다정하거나 익살스러운 느낌까지 감정이 살아 있는 음성을 구현한다고 회사 측은 설명했다.
사용자는 자연어로 표현 방식을 지정하거나 ‘[웃음]’, ‘[가벼운 빗소리]’ 같은 인라인 태그로 발화 스타일과 음향 효과를 세밀하게 조정할 수 있다.
이전 세대인 일레븐 v3 대비 화자 일관성이 향상됐으며, 다자간 대화 구현 성능도 개선됐다.
지원 언어는 기존 70개에서 90개 이상으로 늘었고, 일본어·중국어(만다린)·브라질 포르투갈어 등에서 두드러진 성능 향상이 있었다고 밝혔다.
또한 원본 음성의 피치와 음색을 유지하면서 언어와 억양을 전환하는 기능도 제공한다.
실시간 에이전트 겨냥한 일레븐 v4 터보
일레븐 v4 터보는 첫 응답 생성까지 걸리는 중간 추론 지연 시간이 평균 100밀리초(ms)로, 실시간 대화 환경에서도 일레븐 v4의 감정 표현력을 그대로 제공한다고 회사 측은 밝혔다.
의료·금융·게이밍 등 다양한 산업의 대화형 에이전트에 적용 가능하며, ElevenLabs의 대화형 에이전트 플랫폼 ‘일레븐에이전트(ElevenAgents)’와 단일 시스템으로 최적화됐다.
보안 측면에서는 유럽연합 개인정보보호규정(GDPR)·미국 건강보험 이동성 및 책임법(HIPAA)·SOC 2·PCI 등 글로벌 규정을 준수하며, 음성 복제 시 ‘음성 캡차(Voice CAPTCHA)’ 인증과 주요 공인 음성 복제를 차단하는 ‘노고 보이스(No-Go Voices)’ 안전장치를 적용했다.
두 모델은 일레븐크리에이티브(ElevenCreative)·일레븐에이전트·일레븐API(ElevenAPI)에서 이용 가능하다.
한편 ElevenLabs의 ‘보이스 라이브러리(Voice Library)’에 음성을 등록한 크리에이터들이 창출한 누적 수익은 현재까지 총 2,200만 달러(약 300억 원)를 넘어섰다.
본 기사에 대한 정정·반론·추후보도 청구는 보도 청구 안내를, 그간 게재된 보도문은 정정·반론보도 모아보기를 참고해 주세요.


















