NVIDIA가 단일 체크포인트로 40개 언어-로케일을 실시간 전사하는 600M 파라미터 스트리밍 음성인식 모델 'Nemotron 3.5 ASR'을 공개하고 파인튜닝 방법을 소개했다. Cache-Aware FastConformer-RNNT 구조로 오디오 프레임을 한 번씩만 처리해 저지연과 고정확도를 동시에 달성하며, 구두점·대소문자 처리와 언어 자동 감지를 모델 자체에 내장했다. 그리스어·불가리아어를 약 2,000시간 데이터로 파인튜닝한 결과 80ms 스트리밍 조건에서 WER이 각각 32%, 31% 개선됐다(그리스어 35→24, 불가리아어 22→15). att_context_size로 80ms~1.12s 지연-정확도 지점을 추론 시 선택할 수 있어, 저자원 언어나 특정 도메인·악센트에 맞춰 적은 데이터로 큰 성능 향상을 얻을 수 있음을 보였다.
- •600M 파라미터 단일 체크포인트로 40개 언어-로케일을 실시간 스트리밍 전사, 구두점·대소문자·언어감지 내장
- •Cache-Aware FastConformer-RNNT로 오디오 프레임을 중복 없이 한 번만 처리해 저지연과 고정확도 동시 달성
- •그리스어·불가리아어 약 2,000시간 파인튜닝으로 80ms 스트리밍 WER 32%·31% 개선(그리스어 35→24)
- •att_context_size로 80ms~1.12s 지연-정확도 지점을 재학습 없이 추론 시점에 선택 가능
- •다국어 모델 특화 시 다른 언어 일부를 리플레이로 섞어 성능 저하 방지, 저자원 언어에서 효과 최대
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
How to Fine-Tune Nemotron 3.5 ASR for Your Language, Domain, or Accent
- 1.NVIDIA, 단일 체크포인트로 40개 언어-로케일 실시간 전사하는 Nemotron 3.5 ASR 공개 (600M)
- 2.Cache-Aware FastConformer-RNNT로 프레임당 1회 처리, 구두점·대소문자 내장
- 3.그리스어·불가리아어 파인튜닝으로 WER 각각 32%·31% 개선 사례 제시
- 4.오픈 웨이트로 공개, att_context_size로 80ms~1.12s 지연 조절
왜 중요한가?
40개 언어를 모델 하나로 실시간 처리해 언어별 모델·API를 짜깁기하던 '다언어 세금'을 없앤다. 오픈 웨이트라 자체 인프라에서 파인튜닝·배포가 가능하고, 저자원 언어는 수 시간 데이터로도 WER이 크게 떨어져 음성 에이전트·실시간 자막의 실용 문턱을 낮춘다.
네모트론 3.5 ASR을 특정 언어, 도메인, 억양에 맞춰 미세 조정하는 방법은 한국어 음성 인식 기술 발전에 큰 의미를 가집니다. 국내 기업들이 AI 기반 음성 비서, 콜센터 솔루션 등을 개발할 때, 한국어의 복잡한 억양과 특정 산업 도메인에 최적화된 ASR 모델 구축이 필수적이므로 이 기술은 국내 시장 경쟁력을 높이는 데 핵심적인 역할을 할 것입니다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 23:39AI 초안

