IBM이 8월 25일 압축형 영어 음성인식 모델 두 종 '그래니트 스피치 5.0 터보CTC'를 공개하며 초당 3.5시간 분량의 음성을 처리하는 오픈 모델 최고 처리량을 주장했다. 각 4억7000만 파라미터의 두 모델은 단일 엔비디아 H200 GPU에서 합산 12,600 RTFx 이상의 처리 속도를 기록했으며, OpenASR 리더보드 영어 단문 테스트에서 비상업용 모델은 4.85%, 아파치 2.0 라이선스 모델은 5.00%의 단어 오류율을 기록했다(자체 발표치). 두 모델은 기존 그래니트 스피치의 언어모델을 제거하고 16계층 컨포머 인코더와 CTC 디코딩만으로 동작해 속도를 20배 이상 높였으며, 대신 음성 번역 등 일부 기능은 잃었다. 원거리·잡음 환경을 평가하는 FFASR 리더보드에서는 정확도 순위가 각각 5위·9위에 그쳤지만 처리 속도는 두 모델 모두 1·2위를 차지했다. 지연시간과 처리량이 중요한 노트북·엣지 기기용 기업 음성인식 시장을 겨냥한 모델로, 현재 허깅페이스에서 공개돼 있다.
- •그래니트 스피치 5.0 터보CTC, 초당 3.5시간 음성 처리(H200 GPU 기준 12,600+ RTFx)
- •4억7000만 파라미터, OpenASR 리더보드 단어오류율 4.85~5.00%(자체 발표)
- •언어모델 제거하고 CTC 기반 비자기회귀 디코딩으로 처리속도 20배 이상 향상
- •FFASR(원거리·잡음) 리더보드 정확도는 5·9위지만 속도는 1·2위
- •H100 8장으로 10일 학습, 허깅페이스 공개 및 브라우저 스트리밍 데모 제공
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
IBM Says Granite Speech 5.0 Transcribes 3.5 Hours of Speech in One Second

- 1.IBM, 초경량 영어 음성인식 모델 '그래니트 스피치 5.0' 공개 — H200 GPU 1장에서 1초만에 음성 3.5시간 처리
- 2.각 4얷4700만 파라미터, 오픈ASR 리더보드 단문 기준 WER 4.85~5.00%(벤더 자체 측정치)
- 3.언어모델을 아예 제거하고 16레이어 컸포머 인코더+CTC 디코딩만으로 구성, 이전 버전 대비 처리속도 20배
- 4.아파치 라이선스 모델은 학습데이터 약 6만시간, 비상업용 모델은 7.5만시간(CC-BY-NC-SA-4.0)
왜 중요한가?
언어모델을 떼고 순수 인코더+CTC 구조로 회귀해 속도를 극대화한 설계로, 정확도보다 지연시간·처리량이 중요한 엔터프라이즈 음성전사·엣지 환경에 최적화된 트레이드오프를 보여준다. 다만 수치는 IBM 자체 측정으로 공식 리더보드 반영 전이다.
본문 미리보기
IBM released two compact English speech recognition models on August 25, 2026, claiming transcription throughput no open model has posted before: more than 3.5 hours of speech processed in a single second. The pair, Granite Speech 5.0 TurboCTC and a noncommercial counterpart, each carry just 470 million parameters, and the company reports aggregate throughput above 12,600 RTFx on a single NVIDIA H200 GPU, meaning audio flows through the models more than twelve thousand times faster than real…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:53AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
