메타가 실시간 음성 인식과 화자 분리, 발화 종료 감지를 하나의 모델에서 처리하는 음성 AI '뮤즈 보이스 트랜스크라이브'를 공개했다. 이 모델은 스트리밍 음성 인식 벤치마크에서 단어 오류율 3.1%로 1위를 차지했으며, 80밀리초 단위로 속도와 정확도를 스스로 조절하는 '적응형 지연' 기술을 갖췄다. 20명 이상이 참여하는 1시간 이상의 긴 음성에서도 후처리 없이 화자를 구분할 수 있고, 한 문장 안에서 언어가 바뀌는 코드 스위칭도 지원하며 70개 이상 언어를 학습해 초기에는 한국어를 포함한 25개 언어를 검증된 언어로 지원한다. 메타는 이 모델을 메타 AI와 코딩 에이전트 '뮤즈 코드'의 음성 입력에도 적용했지만 모델 가중치는 공개하지 않기로 했다.
- •'뮤즈 보이스 트랜스크라이브'는 실시간 음성 인식·화자 분리·발화 종료 감지를 한 모델에서 처리한다.
- •스트리밍 음성 인식 벤치마크에서 단어 오류율 3.1%로 1위를 기록했다.
- •80ms 단위로 속도와 정확도를 스스로 조절하는 '적응형 지연' 기술을 적용했다.
- •70개 이상 언어를 학습했으며 초기에는 한국어 등 25개 언어를 검증된 언어로 지원한다.
- •메타 AI와 뮤즈 코드 음성 입력에 적용됐지만 모델 가중치는 비공개로 유지된다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
메타, 실시간 음성 '뮤즈 보이스 트랜스크라이브' 공개...단어 오류율 1위
- 1.메타, 음성인식·화자분리·발화종료감지를 하나의 모델로 처리하는 '뮤즈 보이스 트랜스크라이브' 공개
- 2.단어 오류율 3.1%로 스트리밍 음성인식 벤치마크 1위, 화자분리 벤치마크도 평균 오류율 17.5%로 최상위
- 3.80ms 단위로 정확도와 지연시간을 스스로 조절하는 '적응형 지연' 기술 탑재, 20명 이상 화자·1시간 이상 음성도 처리
- 4.70개 이상 언어 학습, 초기 한국어 포함 25개 언어 지원하나 모델 가중치는 비공개로 API·서비스 중심 제공
왜 중요한가?
음성 인식·화자분리·발화종료감지를 별도 파이프라인 없이 단일 모델로 실시간 처리하면서 정확도까지 1위를 달성한 점은, 음성 기반 AI 에이전트·코딩 도구의 응답 지연을 줄이는 실용적 개선으로 이어질 수 있다.
메타의 '뮤즈 보이스 트랜스크라이브'는 실시간 음성 인식 분야에서 벤치마크 1위를 기록하며 주목받고 있습니다. 이는 국내 음성 비서, 콜센터, 회의록 자동화 등 실시간 음성 처리 기술을 활용하는 다양한 산업에서 새로운 기술 표준과 경쟁력 확보의 기회가 될 수 있습니다.
본문 미리보기
메타가 실시간 음성 인식과 화자 분리, 발화 종료 감지를 하나의 모델에서 처리할 수 있는 새로운 음성 AI 모델을 공개했다. 단어 오류율 3.1%를 기록하며 스트리밍 음성 인식 벤치마크 1위에 오른 것은 물론, 80밀리초(ms) 단위로 속도와 정확도를 스스로 조절하는 기술을 갖췄다.메타는 1일(현지시간) 실시간 음성 인식 모델 ‘뮤즈 보이스 트랜스크라이브(Muse Voice Transcribe)’를 출시했다.메타 슈퍼인텔리전스 랩스(MSL)가 개발한 첫 실시간 오디오 인식 모델로, 실시간 스트리밍 자동음성인식(ASR)을 기반으로
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
