구글이 26일 실시간 음성 인터랙션에 최적화된 신규 음성-텍스트 변환 모델 '제미나이 3.5 트랜스크라이브'를 공개했다. 배경 소음, 전문 용어, 발화 수정 등을 처리해 원시 오디오를 정확하고 정돈된 형식의 텍스트로 바로 변환하며, 실시간 스트리밍용과 사전 녹음 오디오 처리용(화자 구분·단어별 타임스탬프 포함) 두 가지 API로 제공된다. 아티피셜 애널리시스 측정 기준 단어 오류율(WER)은 스트리밍 4.0%, 비스트리밍 2.6%로 이전 모델 '처프3' 대비 크게 개선됐으며, 최종 전사 완료 시간도 70% 단축됐다. 85개 이상 언어를 자동 감지·전사하며, 안드로이드의 '램블러', 맥OS 제미나이 앱, 구글 앤티그래비티 등에 이미 적용됐고 크롬에도 곧 도입될 예정이다.
- •구글, 실시간 음성-텍스트 모델 '제미나이 3.5 트랜스크라이브' 공개
- •단어오류율(WER) 스트리밍 4.0%·비스트리밍 2.6%로 이전 모델 대비 대폭 개선
- •최종 전사 완료 시간 70% 단축, 85개 이상 언어 자동 감지·전사
- •화자 최대 3명 식별, 단어별 타임스탬프 지원
- •안드로이드 램블러·맥OS 제미나이 앱 등에 우선 적용, 크롬에도 곳 도입 예정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Intelligent transcription with Gemini 3.5 Transcribe
- 1.구글, 신규 음성인식 모델 '제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)' 공개
- 2.아티피셜 애널리시스 기준 단어오류율(WER) 스트리밍 4.0%, 비스트리밍 2.6%로 정밀도 향상
- 3.이전 모델 처프3 대비 최종 텍스트 변환 속도 70% 개선, 85개 이상 언어 지원
- 4.안드로이드 램블러·제미나이 맥OS 앱·구글 앤티그래비티에 이미 적용, 크롬엔 곧 도입
왜 중요한가?
잡음·전문용어·말더듬까지 처리하는 정밀 음성인식 모델을 API로 개방해, 음성 에이전트·실시간 자막·통화 분석 등 개발자용 음성 애플리케이션 구축 문턱을 낮췄다.
본문 미리보기
Now you can get more intelligent speech-to-text transcription with Gemini 3.5 Transcribe.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
