알리바바가 23일(현지시간) 음성인식·음성합성·실시간 대화 기능을 강화하고 효과음·배경음까지 한 번에 생성하는 디퓨전 기반 모델을 더한 '큐원-오디오-3.1' 시리즈 5종을 공개했다. 신모델은 TTS 가격을 70%, 실시간 대화는 85%, 음성인식(ASR)은 최대 95% 인하해 입력 단가를 100만 토큰당 0.8위안(약 150원) 수준까지 낮췄다. '큐원-오디오-3.1-ASR'은 30개 언어와 16개 중국어 방언을 지원하며 저지연 스트리밍에서 160밀리초의 응답 속도를 달성했고, 'TTS-넥스트'는 아티피셜 애널리시스 TTS 리더보드 1위에 올랐다. 알리바바는 이를 AI 안경, 데스크톱 로봇 '에바', 오피스·코딩 에이전트 등 자사 생태계 전반에 연동해 온디바이스 음성 시장 공략에 나설 계획이다.
- •알리바바, '큐원-오디오-3.1' 시리즈 5종 공개하며 오픈AI·바이트댄스 겨냥 가격 경쟁 돌입
- •ASR 최대 95%, 실시간 대화 85%, TTS 70% 가격 인하로 입력 단가 100만 토큰당 0.8위안
- •ASR-넥스트, 화자·감정·환경음까지 통합 분석하는 종합 오디오 이해 기능 탑재
- •TTS-넥스트, 언어 모델과 디퓨전을 결합해 대화·효과음·배경음을 한 번에 생성
- •AI 안경·데스크톱 로봇 '에바' 등 알리바바 하드웨어 생태계 전반과 연동 예정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
알리바바, ‘큐원-오디오-3.1’ 공개...최대 95% 가격 파괴
- 1.알리바바, '큐원-오디오-3.1' 5종 공개…ASR 최대 95%·TTS 70%·리얼타임 85% 가격 인하
- 2.ASR-넥스트·TTS-넥스트, 화자분리·감정·배경음까지 통합 분석·생성하는 종합 오디오 모델로 확장
- 3.TTS-넥스트, 아티피셜 애널리시스 TTS 리더보드 1위 등극
- 4.ASR 입력 단가 100만 토큰당 0.8위안(약 150원)까지 하락, 저지연 스트리밍 160ms 달성
왜 중요한가?
오픈AI·바이트댄스가 주도하던 글로벌 음성 API 시장에 파격적 가격 인하로 진입해 개발자의 초기 도입 비용 부담을 크게 낮췄다는 점에서, 음성 에이전트·오디오북 등 B2B 오디오 서비스 개발 진입장벽을 낮추는 신호로 볼 수 있다.
언급 프로젝트
본문 미리보기
알리바바가 고비용 구조에 머물러 있던 글로벌 오디오 API 시장의 판도를 흔들고, 중국 내 B2B 음성 에이전트 주도권을 확보하기 위한 본격적인 가격 경쟁에 나섰다. 오픈AI와 바이트댄스 등에 맞서 파격적인 단가 인하로 개발자 생태계를 조준하겠다는 전략이다.알리바바는 23일(현지시간) 음성인식(ASR)과 음성합성(TTS), 실시간 대화 기능을 강화하고 오디오 이해 및 디퓨전 기반 생성 모델을 새롭게 추가한 ‘큐원-오디오-3.1(Qwen-Audio-3.1)’ 시리즈 5종을 공개했다.이번 모델을 AI 안경과 데스크톱 로봇 '에바', 오
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

