마이크로소프트 AI가 실시간 음성 인식 모델 'MAI-Transcribe-2-Streaming'과 음성합성 모델 두 종을 새로 출시했다. 전사 모델은 60개 언어를 지원하며 첫 부분 결과를 100밀리초 만에 내놓아 음성 에이전트가 사용자의 말이 끝나기 전에도 응답할 수 있도록 하고, 아티피셜 애널리시스 기준 정확도 1위라고 회사는 밝혔다. 연말까지 도입가로 오디오 1시간당 0.54달러에 제공된다. 음성합성 모델 'MAI-Voice-2.1'은 23개 언어를 하나의 목소리로 각 언어의 네이티브 억양까지 구현하며, 지연시간 150밀리초의 경량판 'Flash'는 100만 자당 22달러에서 15달러로 가격을 낮췄다. 두 음성 모델 모두 몇 초 분량의 음성만으로 목소리를 복제할 수 있으며, 한 테스트에서는 참가자 약 4000명 중 절반이 해당 음성을 실제 사람으로 인식했다.
- •MAI-Transcribe-2-Streaming은 60개 언어를 지원하고 100밀리초 내 첫 부분 결과를 제공, 아티피셜 애널리시스 정확도 1위라고 주장.
- •음성 전사 모델은 연말까지 도입가로 오디오 1시간당 0.54달러.
- •MAI-Voice-2.1은 23개 언어를 네이티브 억양으로 구현, 경량판 Flash는 지연 150밀리초·100만 자당 15달러로 가격 인하.
- •두 음성 모델 모두 몇 초 분량 음성으로 보이스 클로닝이 가능하며, 테스트에서 참가자 절반이 실제 사람 목소리로 오인.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Microsoft AI releases new transcription and text-to-speech models for voice agents

- 1.MS, 실시간 전사모델 MAI-Transcribe-2-Streaming 공개—Artificial Analysis 정확도 1위
- 2.60개 언어 지원, 첫 부분 결과를 100밀리초 내 제공해 끊김없는 음성 응답 가능
- 3.TTS 모델 MAI-Voice-2.1(23개 언어)과 저지연 Flash 버전(150ms, 문자당 $15)도 함께 출시
- 4.참가자 4000명 중 약 절반이 AI 음성을 실제 사람 목소리로 오인
왜 중요한가?
전사·TTS 모두 초저지연(100~150ms)을 달성해 실시간 음성 에이전트의 응답 지연 문제를 해결하는 한편, 소수 샘플만으로 음성 복제가 가능해 오용 방지 장치의 실효성이 중요한 과제로 떠오른다.
본문 미리보기
Microsoft AI has released MAI-Transcribe-2-Streaming, a new model for real-time transcription. The article Microsoft AI releases new transcription and text-to-speech models for voice agents appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안

