메타가 실시간으로 음성을 받아쓰며 화자까지 구분하는 첫 실시간 오디오 인식 모델 '뮤즈 보이스 트랜스크라이브'를 지난 1일 공개했다. 메타 슈퍼인텔리전스 랩스(MSL)가 개발한 이 모델은 자동음성인식(ASR)과 화자 분리, 발화 종료 감지를 하나로 처리하며 음성을 80밀리초 단위로 처리하는 적응형 지연 기술을 적용했다. 아티피셜 애널리시스의 스트리밍 음성인식 평가에서 단어오류율(WER) 3.1%로 1위를 기록했고, 이용료는 음성 1시간당 0.18달러로 경쟁 모델 대비 낮다. 70개 이상 언어를 학습했으며 한국어 등 25개 언어는 광범위한 검증을 거쳤고, 20명 이상 참여하는 장시간 대화도 처리할 수 있어 회의록·인터뷰·콜센터 등에 활용이 기대된다.
- •메타, 첫 실시간 오디오 인식 모델 '러즈 보이스 트랜스크라이브' 공개
- •스트리밍 음성인식 평가에서 단어오류율(WER) 3.1%로 1위
- •이용료 음성 1시간당 0.18달러로 가격 경쟁력 강조
- •70개 이상 언어 학습, 한국어 등 25개 언어는 광범위 검증
- •20명 이상 참여 장시간 대화 처리 가능, 회의록·콜센터 등에 활용 기대
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
메타, 실시간 음성인식 모델 '뮤즈 보이스 트랜스크라이브' 공개

- 1.메타가 실시간 음성인식 모델 '뮤즈 보이스 트랜스크라이브'를 9월 1일 공개, 20명 이상 화자 구분과 다국어 코드스위칭을 지원
- 2.아티피셜 애널리시스 스트리밍 ASR 평가에서 최종 전사 단어오류율(WER) 3.1%로 1위를 기록
- 3.가격은 음성 1시간당 0.18달러(1000분당 3달러)로 경쟁 모델 대비 낮은 수준
- 4.70개 이상 언어로 학습했고 한국어를 포함한 25개 언어는 광범위하게 검증했으며, 메타 모델 API·맥용 메타 AI·뮤즈 코드에서 이용 가능
왜 중요한가?
실시간 다중화자 인식과 언어 코드스위칭을 하나의 모델로 처리하면서도 가격을 낮게 책정해, 회의록·콜센터 등 상용 STT 시장에서 가격 경쟁력을 앞세운 진입으로 볼 수 있다.
언급 프로젝트
본문 미리보기
[디지털투데이 최재원 기자] 메타가 실시간으로 음성을 받아쓰면서 화자까지 구분하는 AI 모델 '뮤즈 보이스 트랜스크라이브'(Muse Voice Transcribe)를 지난 1일(이하 현지시간) 공개했다. 20명 이상의 대화를 처리하고 한국어를 포함한 다국어와 언어가 뒤섞인 대화도 인식하는 것이 특징이다.트랜스크라이브는 메타 슈퍼인텔리전스 랩스(MSL)가 개발한 첫 실시간 오디오 인식 모델이다. 멀티모달 추론 모델 '뮤즈 스파크' 계열의 자기회귀 모델로, 실시간 자동음성인식(ASR)과 화자 분리, 발화 종료 감지를 하나의 모델에서 처
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
