AnovaX는 클라우드로 음성을 보내지 않고 사용자 컴퓨터에서 전부 실행되는 로컬 우선 데스크톱 음성 비서다. 단일 Python 프로세스에 웨이크워드 게이트, 음성 파이프라인, JSON 도구 호출 계획을 생성하는 LLM 플래너(Gemini), 화이트리스트·거부리스트 안전 계층, 타입이 지정된 자식 에이전트로 계획을 실행하는 멀티에이전트 오케스트레이터, 핵심 단계 실패 시 개입하는 적응형 복구 루프를 결합했다. AppAgent·TypingAgent·BrowserAgent 등 9개 전문 에이전트가 각자 타임아웃·재시도 정책을 갖고, 재귀적 MetaAgent는 2단계 중첩까지 하위 목표를 위임한다. 복구 루프는 읽기 전용 도구의 투기적 실행으로 Gemini 지연을 숨기고, Flask 서버로 폰에서 원격 조작과 MJPEG 화면 스트리밍도 지원한다. 수천 줄 규모의 읽기 쉬운 코드로도 앱 실행·타이핑·검색·동시 작업·실패 복구가 가능함을 보인 사례다.
- •원시 오디오를 외부로 보내지 않는 완전 로컬 실행 데스크톱 음성 비서
- •LLM 플래너가 JSON 도구 호출 계획을 생성하고 9개 타입 지정 에이전트가 실행
- •적응형 복구 루프가 ReAct 스타일 프롬프트와 읽기 전용 도구 투기적 실행으로 지연 은폐
- •Flask 서버로 폰 원격 조작과 MJPEG 화면 스트리밍 지원
- •수천 줄 규모의 가독한 코드로 실용적 데스크톱 자동화 가능성 입증
AnovaX: A Local, Multi-Agent Voice Assistant with LLM Planning, Typed Executors, and Adaptive Recovery
- 1.로컬 우선 데스크톱 음성 비서 AnovaX 공개, 데스크톱 자체를 행동 표면으로 활용
- 2.Gemini 플래너가 JSON 도구 계획 생성, 화이트리스트 안전층과 타입드 자식 에이전트로 실행
- 3.핵심 단계 실패 시 ReAct식 적응형 복구 루프 가동, 읽기 전용 도구 투기 실행으로 지연 은폐
- 4.Flask 서버로 폰 원격 제어와 MJPEG 화면 스트리밍 지원, 수천 줄 규모의 가독성 있는 구현
왜 중요한가?
원시 오디오를 클라우드로 보내는 기존 음성 비서와 달리 수천 줄짜리 단일 프로세스만으로 앱 실행·타이핑·동시 작업·실패 복구가 가능함을 보여, 프라이버시 중시 개인 비서 구현의 실용적 참고 사례가 된다.
본문 미리보기
arXiv:2607.15367v1 Announce Type: new Abstract: Desktop voice assistants are still dominated by cloud pipelines that ship raw audio off the machine and expose a fixed set of skills. We describe AnovaX, a small local-first assistant that runs entirely on the user's computer and treats the desktop itself as its action surface. A single Python process wires together a wake-word gate, a speech pipeline, an LLM planner (Gemini) that emits a JSON plan of tool calls, a whitelist-and-denylist safety la
전체 내용이 궁금하다면?
원문을 직접 읽어보세요