텍스트-오디오 검색에서 추론 능력을 평가하는 최초의 추론 집중 벤치마크 ReasonAudio를 소개한다. 부정 이해, 시간적 순서, 동시 이벤트 인식, 지속 시간 구분 등 5가지 추론 과제를 포함한 1,000개 쿼리와 10,000개 복합 오디오 클립으로 구성된다. 10개의 최신 모델 평가 결과 모든 모델이 추론 집중 오디오 검색에서 어려움을 겪으며, 멀티모달 LLM 기반 임베딩 모델은 대조적 파인튜닝을 통해 추론 능력을 검색 설정에 전달하는 데 실패했다.
- •ReasonAudio는 부정, 순서, 중첩, 지속 시간, 혼합 5가지 추론 과제를 포함한 최초의 추론 집중 텍스트-오디오 검색 벤치마크다.
- •1,000개 쿼리와 10,000개 복합 오디오 클립으로 구성되며, 현재 최신 모델에게 상당한 도전 과제를 제시한다.
- •모든 모델이 부정 및 지속 시간 과제에서 특히 취약하며, 중첩 및 순서 과제에서는 상대적으로 나은 결과를 보였다.
- •멀티모달 LLM 기반 임베딩 모델은 대조적 파인튜닝을 통해 추론 능력을 검색 설정에 전달하는 데 실패했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval
- 1.텍스트-오디오 검색에서 단순 매칭을 넘는 추론 능력 평가용 벤치마크 ReasonAudio 소개
- 2.부정·순서·중첩·지속시간·복합 등 5가지 추론 유형, 1000개 쿼리·1만 개 클립 구성
- 3.최신 10개 모델 모두 부정·지속시간 작업에서 심각한 성능 저하 확인
왜 중요한가?
현행 멀티모달 LLM이 오디오 검색에서 기초적 추론조차 제대로 수행하지 못함을 드러내며, 단순 의미 매칭을 넘어 추론 중심의 오디오 AI 연구 방향을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2605.03361v2 Announce Type: new Abstract: As multimodal content continues to expand at a rapid pace, audio retrieval has emerged as a key enabling technology for media search, content organization, and intelligent assistants. However, most existing benchmarks concentrate on semantic matching and fail to capture the fact that real-world queries often demand advanced reasoning abilities, including negation understanding, temporal ordering, concurrent event recognition, and duration discrimi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

