Hugging Face와 Cerebras가 Google DeepMind의 Gemma 4 31B를 활용한 실시간 음성 대화(speech-to-speech) 데모를 공개했다. 파이프라인은 Nvidia Parakeet 음성인식 → Cerebras에서 Gemma 4 VLM 추론 → Alibaba Qwen3TTS 음성합성으로 이어지는 완전 개방형 캐스케이드 구조로, 각 구성 요소를 개발자가 자유롭게 교체·확장할 수 있다. Cerebras의 고속 추론이 음성 AI의 최대 병목인 LLM 응답 지연, 특히 P95 롱테일 지연을 줄여 사람 간 대화 수준의 반응성을 구현했다는 설명이다. 이 파이프라인은 이미 9,000대 이상 보급된 Reachy Mini 로봇에도 탑재돼 있다. 오픈소스 모델과 고속 추론 인프라의 결합이 실시간 대화형 AI의 실용화를 앞당기고 있음을 보여준다.
- •Parakeet(음성인식) → Gemma 4 31B(Cerebras 추론) → Qwen3TTS(음성합성)의 완전 개방형 모듈러 스택
- •Cerebras 고속 추론으로 LLM 응답 지연, 특히 P95 롱테일 지연 해소
- •동일 파이프라인이 9,000대 이상 보급된 Reachy Mini 로봇에 이미 탑재
- •데모와 코드를 Hugging Face Space와 GitHub에 공개해 개발자 실험 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Hugging Face and Cerebras bring Gemma 4 to real-time voice AI
- 1.Hugging Face·Cerebras가 Gemma 4 31B 기반 실시간 음성 대화 데모 공개
- 2.Parakeet 음성인식→Cerebras 추론→Qwen3TTS로 이어지는 오픈 모듈형 파이프라인
- 3.Cerebras 추론으로 P95 꼬리 지연까지 안정화해 자연스러운 대화 응답성 확보
- 4.동일 파이프라인이 이미 9,000대 이상의 Reachy Mini 로봇에 탑재돼 운영 중
왜 중요한가?
음성 AI의 병목이 모델 품질에서 지연시간으로 옮겨간 가운데, 모든 구성요소를 교체·검사할 수 있는 오픈 스택으로 인간 수준의 대화 응답성을 시연했다. 폐쇄형 음성 비서와 달리 로봇·제품·연구에 바로 이식 가능한 개방형 대안이라는 점이 차별점이다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 01:53AI 초안

