YazSes는 클라우드 음성 인식 서비스의 프라이버시 문제를 해결하기 위해 완전히 온디바이스에서 동작하는 오픈소스(Apache-2.0) 홀드투토크 음성 받아쓰기 데몬이다. 프로토콜 기반 플랫폼 추상화를 통해 단일 코드베이스로 리눅스, macOS, 윈도우를 모두 지원하며, faster-whisper(CPU, int8)로 음성을 로컬에서 텍스트로 변환한 뒤 정규식 명령 문법과 선택적 소형 언어모델 라우터를 통해 에디터·터미널 동작에 매핑한다. 항상 듣는 방식이 아닌 푸시투토크 방식으로 녹음하고 텔레메트리가 전혀 없으며, 옵트인 개인화 루프의 데이터도 기기 내에서 암호화돼 외부로 전송되지 않는다. LibriSpeech test-clean 200개 발화, 40명 화자 기준 단어 오류율 2.59~4.82%, 실시간 대비 처리 계수 0.520을 달성했고, 명령 문법은 오탐률 0%에 100%의 동작 정확도를 기록해 GPU 없이 CPU만으로 실시간보다 빠른 처리가 가능함을 보였다.
- •완전 온디바이스 동작, 텔레메트리 없는 오픈소스 홀드투토크 음성 받아쓰기 시스템
- •리눅스·macOS·윈도우를 단일 코드베이스로 지원하는 프로토콜 기반 플랫폼 추상화
- •faster-whisper(CPU, int8) 기반 로컬 전사와 정규식+소형 언어모델 라우터의 명령 매핑
- •LibriSpeech 200개 발화 기준 단어 오류율 2.59~4.82%, 실시간 대비 계수 0.520 달성
- •명령 문법 100% 동작 정확도, 0% 오탐률, GPU 없이 CPU만으로 실시간보다 빠른 처리
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
YazSes: An Offline, Privacy-First, Cross-Platform Hold-to-Talk Voice-Dictation System
본문 미리보기
arXiv:2607.28878v1 Announce Type: new Abstract: Cloud voice-dictation services deliver strong accuracy but require streaming a user's speech to a remote provider, an unacceptable trade-off in privacy-sensitive professions and offline or air-gapped settings; the leading on-device alternatives are either platform-locked or aimed at expert scripting rather than plug-and-play dictation. We present YazSes, an open-source (Apache-2.0) hold-to-talk voice dictation daemon that runs entirely on-device,
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



