오픈AI가 전이중(Full-Duplex) 음성 AI 'GPT-라이브'의 초저지연 아키텍처를 공개했다. 턴 디텍터와 STT-LLM-TTS 순차 처리 구조를 버리고, 음성 모델이 대화를 직접 관리하다가 복잡한 추론이 필요할 때만 GPT-5.5를 비동기 호출하는 2개 모델 구조를 채택했다. 미디어 처리를 파이썬에서 Go 기반으로 바꾸고 저지연 WebRTC, 단일 UDP 패킷으로 세션을 여는 인스턴트 커넥트, 개방형 WARP 프로토콜로 접속·응답 지연을 크게 줄였다. GPT-라이브는 현재 챗GPT 음성 모드와 데스크톱 앱 컴퓨터 제어에 적용 중이며 개발자용 API로도 제공될 예정이다.
- •턴 디텍터 제거: 전이중 음성 모델이 대화를 직접 관리해 응답 지연과 흐름 단절 해소
- •음성과 추론 분리: 필요할 때만 GPT-5.5를 백그라운드 비동기 호출하는 2개 모델 구조
- •Go 기반 미디어 처리·저지연 WebRTC·단일 UDP 패킷 인스턴트 커넥트로 지연 최소화, WARP 프로토콜은 개방형 규격으로 공개
- •세션 교체·백그라운드 요약·프롬프트 캐싱으로 장시간 통화에서도 응답 속도 유지
- •챗GPT 음성 모드와 데스크톱 앱에 적용 중, 개발자 API 제공 예정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
턴 디텍터 없애고 추론 분리... 오픈AI가 밝힌 'GPT-라이브' 초저지연 비밀
- 1.오픈AI, 전이중 음성 AI 'GPT-라이브' 아키텍처 공개…턴 디텍터 없이 동시에 듣고 말함
- 2.복잡한 추론 시에만 GPT-5.5를 비동기 호출하는 2모델 분리 구조로 저지연·고지능 양립
- 3.Go 기반 미디어 처리, WARP 프로토콜, UDP 1패킷 인스턴트 커넥트로 지연 대폭 감소
- 4.챗GPT 음성 모드·데스크톱 에이전트 기능에 적용 중, 개발자용 API 제공 예정
왜 중요한가?
STT-LLM-TTS 순차 구조와 턴 디텍터에 의존하던 기존 음성 AI의 지연·단절 문제를 아키텍처 차원에서 해소한 사례로, WARP 규격 개방으로 실시간 음성 에이전트 개발 방식 전반에 영향을 줄 수 있다.
오픈AI가 공개한 GPT-라이브는 사람과 거의 구분되지 않는 초저지연 음성 대화를 가능케 하는 기술로, 국내 AI 서비스 개발사들에게 주목할 만한 혁신을 제시합니다. 기존 음성 AI의 한계를 뛰어넘어 전이중 대화를 구현함으로써, 한국 시장의 다양한 음성 비서 및 고객 서비스 AI 솔루션에 적용될 때 사용자 경험을 크게 향상시킬 잠재력을 가졌습니다.
본문 미리보기
오픈AI가 사람과 거의 구분되지 않는 자연스러운 음성 대화를 구현하기 위한 차세대 음성 AI 아키텍처를 공개했다. 오픈AI는 3일(현지시간) 기존 음성 AI의 가장 큰 한계였던 ‘차례를 기다리는 대화’ 구조를 버리고, 사람처럼 동시에 듣고 말하는 전이중(Full-Duplex) 음성 AI 시스템 'GPT-라이브(GPT-Live)'의 핵심 기술을 공개했다.GPT-라이브는 대화 도중에도 실시간으로 음성을 주고받으면서 필요할 때만 GPT-5.5와 같은 최상위 추론 모델을 비동기적으로 호출하는 새로운 구조를 채택해 자연스러운 대화와 높은 지
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:34AI 초안

