음성 AI 기업 인월드 AI가 대화의 맥락과 감정을 실시간으로 파악해 반영하는 음성 생성 모델 '실시간 TTS-2'와 경량형 '실시간 TTS-2 플래시'를 공개했다. 텍스트가 아닌 오디오 맥락을 분석해 말투·속도·감정을 파악하며, 자연어 지시와 웃음·한숨 등 비언어적 표현까지 지원한다. 아티피셜 애널리시스의 '제어 음성 아레나'에서 Elo 1123점으로 1위(카르테시아 소닉 3.6 앞섬)를 기록했고, 지연시간은 99번째 백분위 기준 100ms 미만이다. 가격은 100만 문자당 20.83달러로 경쟁 모델보다 저렴하다.
- •인월드 AI, 대화 맥락·감정을 실시간 반영하는 '실시간 TTS-2'·'플래시' 버전 공개
- •아티피셜 애널리시스 제어 음성 아레나에서 Elo 1123점으로 1위 등극
- •100개 이상 언어에서 음성 정체성 유지, 200개 이상 언어·500개 방언 지원
- •지연시간 100ms 미만(99번째 백분위), 가격은 100만 문자당 20.83달러
- •언어학습 서비스 톡팔은 TTS 비용 40% 절감, 소셜 시뮬레이션 스테이터스는 AI 비용 95% 절감 보고
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
인월드 AI, 맥락·감정 읽는 음성 모델 '실시간 TTS-2' 공개...아티피셜 애널리시스 1위 등극
- 1.인월드 AI, 대화 오디오 맥락과 감정을 실시간 분석해 반영하는 '실시간 TTS-2' 공개
- 2.아티피셜 애널리시스 '제어 음성 아레나'서 Elo 1123점으로 1위, 카르테시아 소닉 3.6 앞서
- 3.99번째 백분위 기준 100ms 미만 지연시간, 200개 이상 언어·500개 이상 방언 지원
- 4.가격은 100만 문자당 20.83달러로 소닉 3.6(49달러)·일레븐 v3(100달러)보다 저렴
왜 중요한가?
텍스트뿐 아니라 실제 대화 오디오의 어조·속도·감정까지 반영해 음성을 생성한다는 점에서, 기존 TTS 대비 자연스러운 실시간 음성 에이전트 구현을 앞당길 수 있는 기술이다.
언급 프로젝트
본문 미리보기
AI 음성 기술이 단순히 사람의 목소리를 흉내 내는 수준을 넘어 실제 대화의 맥락과 감정까지 이해하는 단계로 발전하고 있다. 음성 AI 전문 인월드 AI(Inworld AI)가 사용자의 말투와 속도, 감정 상태를 실시간으로 파악하고 자연어로 입력한 연출 지시까지 반영하는 차세대 음성 생성 모델을 공개했다 인월드 AI는 2일(현지시간) 사람과 AI가 실제로 대화하는 것처럼 자연스럽게 소통할 수 있도록 설계한 실시간 음성 생성 모델 ‘실시간(Realtime) TTS-2’를 출시했다.단순히 텍스트를 음성으로 변환하는 기존 TTS(Text
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
