알리바바가 최신 음성 인식(ASR) 모델 '큐원-오디오-3.0-ASR-플래시'를 출시하고 바이롄(BaiLian) 플랫폼에서 API로 제공한다. 수시간 분량 회의·강연에서도 앞선 문맥을 기억해 인명·기술 용어를 일관되게 표기하며, 사전 설정 없이 내부 테스트 기준 의료 용어 재현율 95.36%, 산업 93.24%, IT 프로그래밍 91.87%를 기록했다. 기업용 커스텀 핫워드 기능은 등록 즉시 반영되며 대부분 환경에서 99% 이상 재현율을 보였고, 말버릇 제거·문맥 재구성으로 후처리 없이 회의록 형태 문서를 자동 생성한다. 30개 이상 언어를 지원하고, 함께 공개된 스트리밍 모델은 약 300ms 지연으로 실시간 자막을 만들며 중국어 산업 환경 문자 오류율 7.80%를 기록했다. 전문 분야 실무에 바로 쓸 수 있는 ASR 경쟁이 한층 치열해지는 모습이다.
- •장시간 음성에서 문맥 유지해 인명·전문 용어 일관 표기, 구간별 문맥 단절 문제 개선
- •의료 용어 재현율 95.36%, 산업 93.24%, IT 프로그래밍 91.87%(내부 테스트)
- •커스텀 핫워드 기능은 등록 즉시 반영되며 대부분 환경에서 99% 이상 재현율
- •30개 이상 언어 지원, 7개 주요 언어 평균 의미 오류율 17.09%
- •스트리밍 모델은 약 300ms 지연으로 실시간 자막 생성, 중국어 산업 환경 CER 7.80%
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
알리바바, 음성 인식 모델 '큐원-오디오-3.0-ASR-플래시' 출시..."전문 용어 정확도 향상"
- 1.알리바바, 장시간 문맥 유지형 ASR 모델 '큐원-오디오-3.0-ASR-플래시' 출시
- 2.의료 용어 재현율 95.36%·산업 93.24%·IT 91.87%, 핫워드 등록 시 99% 이상
- 3.30개 이상 언어 지원, 추임새 제거·문서화 기능으로 회의록 자동 생성
- 4.스트리밍 버전은 약 300ms 지연으로 실시간 자막 생성, 중국어 CER 7.80% 기록
왜 중요한가?
기존 ASR의 고질적 약점인 구간별 문맥 단절과 전문 용어 오인식을 사전 설정 없이 해결했다는 점이 차별점이다. 회의록·의료 기록·다국어 고객 지원 등 기업용 음성 전사 시장에서 바로 쓸 수 있는 수준의 수치를 제시하며 API로 즉시 제공된다.
본문 미리보기
알리바바가 최신 음성 인식(ASR) 모델 '큐원-오디오-3.0-ASR-플래시(Qwen-Audio-3.0-ASR-Flash)'를 공개했다. 긴 음성에서도 문맥을 일관되게 유지하며 전문 용어 인식 정확도를 크게 높인 것이 특징으로, 의료와 산업 현장 등 전문 분야는 물론 실시간 회의록 작성과 글로벌 고객 지원까지 폭넓은 활용이 가능하도록 설계됐다.알리바바는 31일(현지시간) '큐원-오디오-3.0-ASR-플래시' 시리즈를 출시하고, 알리바바 클라우드 바이롄(BaiLian) 플랫폼에서 API를 사용할 수 있다고 발표했다. 이번 모델의 가장
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안

