바이트댄스가 음성·영상·텍스트를 하나의 모델에서 동시에 처리하는 전이중(Full-Duplex) 멀티모달 LLM '시드리얼타임(SeedRealtime)'을 출시했다. 기존 ASR-VLM-TTS 캐스케이드 방식과 달리 단일 엔드투엔드 모델이 인식·이해·추론·응답을 병렬 처리해 지연시간과 정보 손실을 줄였으며, 공동 멀티모달 인식·능동형 상호작용·사람과 유사한 대화 타이밍 제어가 핵심 기술이다. 사용자 요청 없이도 카메라 화면을 지속 관찰해 특정 대상 등장 시 알림을 주거나 에스프레소 추출 실수를 실시간으로 교정하는 등 능동적 개입이 가능하다. 바이트댄스는 인간 평가에서 캐스케이드 모델 대비 대화 타이밍 문제를 절반 수준으로 줄였다고 밝혔으며, 이미 자체 서비스에 전면 적용해 업계 최초로 시청각 기반 전이중 AI를 대규모 상용 배포했다고 강조했다.
- •단일 엔드투엔드 모델이 음성·영상·텍스트를 동시에 처리해 캐스케이드 방식 대비 지연시간을 줄였다.
- •사용자 요청 없이도 상황 변화를 스스로 감지해 먼저 개입하는 능동형 상호작용을 구현했다.
- •외부 음성 감지 없이 모델이 직접 대화 시작·종료 시점을 판단해 배경 소음에 오반응하지 않는다.
- •인간 평가에서 캐스케이드 모델 대비 대화 타이밍 문제를 절반 수준으로 줄였다.
- •이미 자체 서비스에 전면 적용해 업계 최초로 대규모 상용 배포된 시청각 전이중 AI라고 밝혔다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
바이트댄스, 전이중 AI '시드리얼타임' 출시..."실시간 멀티모달 모델"
본문 미리보기
바이트댄스가 음성과 영상, 텍스트를 하나의 모델에서 동시에 처리하는 전이중(Full-Duplex) 멀티모달 대형언어모델(LLM) '시드리얼타임(SeedRealtime)'을 출시했다. 기존 음성 AI가 질문과 답변을 차례로 처리하는 방식에 머물렀다면, 시드리얼타임은 주변 환경을 실시간으로 이해하고 적절한 시점에 먼저 말을 거는 능동형 AI를 구현한 것이 특징이다.바이트댄스는 5일(현지시간) 시드리얼타임이 통합 아키텍처를 기반으로 음성·영상·텍스트를 동시에 처리해 '보고, 듣고, 말하는' 자연스러운 상호작용을 제공한다고 밝혔다.음성인식
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안
