구글이 26일 실시간 음성 인식에 특화된 AI 모델 '제미나이 3.5 트랜스크라이브'를 공개했다. 소음과 전문용어가 섞인 환경에서도 말실수와 자체 수정을 이해해 자연스러운 텍스트로 정리하는 것이 핵심으로, 아티피셜 애널리시스 측정에서 스트리밍 환경 단어 오류율(WER) 4.0%, 비스트리밍 2.6%를 기록해 이전 모델 '처프 3' 대비 완성 시간을 약 70% 단축했다. 85개 이상 언어와 지역 방언을 지원하며 사전 녹음 음성에서는 최대 3명 화자 구분과 발화 시간 표시도 가능하다. 안드로이드 지보드, 구글 AI 스튜디오, 맥OS 제미나이 앱 등에 이미 적용됐으며 향후 크롬에도 확대될 예정이다.
- •구글, 26일 실시간 음성인식 모델 '제미나이 3.5 트랜스크라이브' 공개
- •단어 오류율(WER) 스트리밍 4.0%, 비스트리밍 2.6%, 처프3 대비 완성시간 약 70% 단축
- •85개 이상 언어·방언 지원, 최대 3명 화자 구분 및 발화 시간 표시
- •지보드 '램블러', AI 스튜디오, 맥OS 제미나이 앱 등에 적용, 크롬 확대 예정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
구글, 음성 AI 실용성 극대화... '제미나이 3.5 트랜스크라이브'로 생태계 확장
- 1.구글, 실시간 음성인식 특화 모델 '제미나이 3.5 트랜스크라이브' 공개, 말실수·자체수정까지 자동 정리
- 2.단어오류율 스트리밍 4.0%·비스트리밍 2.6%, 이전 모델 '처프3' 대비 텍스트 완성 시간 약 70% 단축
- 3.85개 이상 언어 지원, 사용자 지정 어휘 및 최대 3명 화자 구분·발화시간 표시 기능 제공
- 4.지보드 램블러, 제미나이 라이브의 에이전트 '스파크', '데일리 브리프' 등 구글 서비스 전반에 통합
왜 중요한가?
소음·전문용어·반복 자체수정 등 기존 음성인식의 약점을 보완하면서 지연시간까지 대폭 줄여, 음성 기반 에이전트·실시간 자막 등 실사용 제품에 즉시 적용 가능한 인프라 업그레이드라는 의미가 크다.
언급 프로젝트
본문 미리보기
구글이 음성 기반 AI의 실용성을 한 단계 끌어올린다. 새로운 음성 인식 모델을 통해 소음과 전문용어가 섞인 환경에서도 정확도를 높이는 동시에, 사용자의 말실수와 자체 수정까지 이해해 자연스럽게 정리된 텍스트로 변환하는 기능을 선보였다. 구글은 26일(현지시간) 실시간 음성 인식과 지능형 음성 상호작용에 특화된 AI 모델 ‘제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)’를 공개했다.단순히 음성을 텍스트로 변환하는 것을 넘어 사용자의 자연스러운 말투와 문맥을 이해하고, 말실수와 자기수정, 추임새까지 자동으로
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
