확산(diffusion) 언어모델을 개발해온 인셉션이 음성 에이전트 전용 모델 '머큐리 보이스(Mercury Voice)'를 기업 고객 대상으로 정식 출시했다. 전체 문맥과 토큰을 병렬 처리하는 확산 구조를 적용해 복잡한 도구 호출이나 긴 프롬프트에서도 첫 응답 토큰 생성 시간(TTFAT) 중앙값 320밀리초 미만을 기록했으며, 상위 5% 지연시간도 750ms에 그쳐 지연 변동폭이 작다는 평가다. 통신·소매·항공 분야 벤치마크인 τ³-벤치 등에서 GPT-6 루나, 제미나이 3.5 플래시-라이트 등 경쟁 모델과 비슷하거나 더 나은 품질을 유지하면서 응답 속도는 2배 이상 빨랐다. 가격은 출시 프로모션 기준 대화 1분당 약 0.009달러로 GPT-4.1 대비 약 5배 저렴하며, 오디오비 AI의 드라이브스루 자동화 등 실제 도입 사례도 나오고 있다.
- •인셉션, 확산 모델 기반 음성 에이전트 전용 모델 '머큐리 보이스' 기업용 정식 출시
- •첫 응답 토큰 생성 320ms 미만, 95백분위수도 750ms로 지연 변동폭 작음
- •τ³-벤치 등에서 GPT-6 루나·제미나이 대비 대등 이상 품질, 속도는 2배 이상
- •가격은 분당 약 0.009달러로 GPT-4.1 대비 약 5배 저렴(프로모션 적용)
- •오디오비 AI 드라이브스루, 알터 금융 에이전트 등 실제 도입 사례 확보
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
인셉션, 음성 에이전트 ‘머큐리 보이스’ 출시…'확산 모델'로 지연시간 한계 깼다
- 1.인셉션, 확산모델 기반 음성 에이전트 전용 LLM '머큐리 보이스' 기업용 정식 출시
- 2.TTFAT 중앙값 320ms 미만, GPT-6 루나 등 경쟁모델 대비 2배 이상 빠른 응답속도 확보
- 3.τ³-벤치·IF벤치·BFCL v4 등에서 경쟁모델과 대등하거나 상회하는 품질 유지
- 4.가격은 입력 100만토큰당 0.40달러·출력 1.50달러, GPT-4.1 대비 대화 1분당 약 5배 저렴
왜 중요한가?
순차적 토큰 생성 방식의 지연시간 문제를 확산 모델의 병렬 처리로 해결해, 음성 에이전트 시장에서 속도와 품질을 동시에 확보한 사례로 확산 LLM의 상용화 가능성을 보여준다.
확산 모델 기반의 음성 에이전트 '머큐리 보이스' 출시는 AI 음성 기술의 고질적인 문제였던 지연 시간을 획기적으로 개선할 잠재력을 보여줍니다. 이는 국내 스마트 기기, 고객 서비스, 자율주행 등 다양한 산업 분야에서 음성 AI의 활용도를 높이고 사용자 경험을 향상시키는 중요한 전환점이 될 수 있습니다.
본문 미리보기
AI 음성 에이전트 시장에서 반응 속도와 지능을 동시에 확보하려는 시도가 이어지는 가운데, 확산(Diffusion) 기반 언어모델(dLLM)을 개발해 온 인셉션(Inception)이 음성 전용 모델을 내놓았다. 기존 자율주행·이미지 생성 등에 주로 쓰이던 확산 방식을 언어와 음성 영역으로 확장해 기존 모델의 한계를 극복하겠다는 취지다.인셉션은 2026년 9월 29일(현지시간) 음성 에이전트에 특화된 확산 언어모델 ‘머큐리 보이스(Mercury Voice)’를 기업 고객을 대상으로 정식 출시했다.기존 순차적 토큰 생성 방식(Autor
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

