구글이 실시간 음성-텍스트 변환 모델 '제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)'를 출시했다. 85개 이상 언어를 자동 인식하며 "음"과 같은 간투사를 제거하고 말실수를 교정하며 텍스트 서식도 자동으로 정리한다. 스트리밍 방식 단어 오류율은 4.0%, 녹음 음성은 2.6%를 기록했으며, 이전 모델인 Chirp 3 대비 지연 시간을 70% 줄였다. 함수 호출(function calling) 기능을 통해 이미지 생성이나 웹 검색 같은 작업을 다른 제미나이 모델에 위임할 수 있다. 실시간 스트리밍용 라이브 API와 화자 구분·타임스탬프를 지원하는 인터랙션 API 두 가지 인터페이스로 제공되며, 이미 안드로이드 지보드와 macOS 제미나이 앱에 탑재됐고 크롬 지원도 예정돼 있다.
- •85개 이상 언어 자동 인식, 간투사 제거·말실수 교정 기능 킑재
- •단어 오류율 스트리밍 4.0%, 녹음 2.6%, 지연시간 전작 대비 70% 감소
- •라이브 API(실시간 스트리밍)와 인터랙션 API(화자구분·타임스탬프) 이원화 제공
- •함수 호출로 이미지 생성·웹 검색 등 다른 제미나이 모델에 작업 위임 가능
- •안드로이드 지보드·macOS 제미나이 앱에 이미 킑재, 크롬 지원 예정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Google's Gemini 3.5 Transcribe turns speech to text in 85 languages while auto-correcting your verbal stumbles
- 1.구글이 실시간 음성인식 모델 Gemini 3.5 Transcribe 출시, 85개 이상 언어 지원
- 2.필러 단어 제거·말실수 교정·자동 서식 적용까지 처리
- 3.스트리밍 오류율 4.0%, 녹음 오류율 2.6%, 지연시간은 전작 대비 70% 감소
- 4.Live API와 Interactions API 두 가지로 제공, Gboard·Gemini 앱에 이미 탑재
왜 중요한가?
받아쓰기 정확도와 지연시간을 동시에 개선하면서 기능 호출로 다른 제미나이 모델과 연동까지 지원해, 실시간 음성 인터페이스 제품에 바로 적용할 수 있는 인프라로 자리잡을 수 있다.
본문 미리보기
Google's new Gemini 3.5 Transcribe recognizes over 85 languages, strips filler words, and corrects slips of the tongue in real time. It hits a 4.0 percent word error rate in streaming mode, with 70 percent lower latency than its predecessor, Chirp 3. Through function calling, the model can hand off tasks to other Gemini models. The article Google's Gemini 3.5 Transcribe turns speech to text in 85 languages while auto-correcting your verbal stumbles appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
