완전 이중(풀덕스) 음성 에이전트는 언제 듣고 백채널하고 끼어들고 발화 중첩을 처리하며 발언권을 잡거나 넘길지 지속적으로 판단해야 한다. 기존 벤치마크는 대부분 명시적인 턴 관리 지시로 이런 행동을 테스트하지만, 실제 배치된 에이전트는 역할이나 페르소나에서 적절한 대화 행동을 추론해야 하는 경우가 많다. 연구진은 암묵적 지시 이행을 평가하는 DuplexSpeechBench-IFEval(DSB-IFEval)을 도입, 8개 어시스턴트 역할에 걸친 1038개 테스트 사례와 5가지 조건화 방식을 평가했다. 6개 실시간 음성 시스템 실험 결과 F-Actor와 PersonaPlex 같은 풀덕스 모델은 페르소나만으로 조건화될 때 준수도가 각각 9.7%, 4.5% 하락했고, GPT-Realtime·MiniCPM-o·Fun-Audio-Chat은 페르소나 일관성은 강하지만 발언권 관리 행동이 조건에 따라 적응하지 못했으며, 모든 시스템이 안전 충돌 상황에서 페르소나 지시를 우선시하는 데 어려움을 겪었다.
- •풀덱스 음성 에이전트의 암묵적 지시 이행을 평가하는 벤치마크 DSB-IFEval 도입, 8개 역할·1038개 테스트 사례
- •기본·명시적 지시·페르소나 암시·결합·지시 충돌 등 5가지 조건화 프로토콜로 평가
- •F-Actor·PersonaPlex는 페르소나만 주어질 때 지시 준수도가 각각 9.7%, 4.5% 하락
- •GPT-Realtime 등은 페르소나 일관성은 강하나 발언권 관리 행동은 조건에 따라 적응하지 못함
- •모든 시스템이 안전 충돌 상황에서 지시 우선순위를 제대로 재조정하는 데 어려움을 격음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents
- 1.DSB-IFEval은 실시간 음성 에이전트의 암묵적 지시 이행 능력을 평가하는 1038개 테스트 벤치마크
- 2.8개 역할, 5가지 조건(기본/명시적 지시/페르소나 암시/결합/충돌)으로 발화 전환 능력 측정
- 3.F-Actor·PersonaPlex는 페르소나만 주어졌을 때 지시 이행도가 각각 9.7%, 4.5% 하락
- 4.GPT-Realtime·MiniCPM-o·Fun-Audio-Chat은 페르소나 일관성은 강하나 실시간 발화 전환 적응력은 제한적
왜 중요한가?
실시간 음성 에이전트가 명시적 규칙 없이 역할만으로 대화 흐름을 얼마나 잘 추론하는지 정량 평가할 기준을 처음 제시해, 음성 AI 제품의 자연스러운 턴테이킹 설계에 참고할 근거를 제공한다.
본문 미리보기
arXiv:2609.03423v1 Announce Type: new Abstract: Full-duplex voice agents must continuously decide when to listen, backchannel, interrupt, handle speech overlaps, take the floor, and yield. Existing benchmarks largely test these behaviors through explicit turn-management instructions, while deployed agents are often configured through roles or personas from which the appropriate conversational behavior must be inferred. We introduce DuplexSpeechBench-IFEval (DSB-IFEval) for evaluating implicit i
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
