OmniMem은 오디오-비주얼 LLM의 장편 영상 추론에서 비디오 토큰과 KV 캐시가 선형적으로 증가하는 한계를 해소하는 메모리 효율적 스트리밍 프레임워크다. 모든 토큰을 균일하게 다루는 기존 압축과 달리, 시각·오디오 컨텍스트를 분리 관리하는 모달리티 인지 메모리 할당으로 두 모달리티 간 토큰 불균형을 해결한다. 또한 섭동 인지(perturbation-aware) 메모리 선택으로 정보량이 많고 중복이 적은 KV 상태를 보존해 장기 이해를 해치지 않으면서 메모리를 압축한다. 예산 인지 파인튜닝까지 적용한 결과, VideoMME Long·LVBench·LVOmniBench에서 video-SALMONN 2+와 Qwen-2.5-Omni 기반으로 동일 메모리 예산 대비 강력한 학습 불필요 기준선보다 2~4%p 정확도를 높였고, 파인튜닝으로 1~2%p를 추가 확보했다.
- •오디오-비주얼 LLM의 장편 영상 추론에서 토큰·KV 캐시 선형 증가 한계를 겨냥한 메모리 효율 스트리밍 프레임워크
- •시각·오디오를 분리 관리하는 모달리티 인지 메모리 할당으로 모달리티 간 토큰 불균형 해소
- •섭동 인지 메모리 선택으로 정보적·비중복 KV 상태를 보존해 장기 이해 유지하며 압축
- •예산 인지 파인튜닝으로 보존 메모리에 유용 정보 통합 유도
- •VideoMME Long·LVBench·LVOmniBench에서 동일 예산 대비 +2~4%p, 파인튜닝 후 추가 +1~2%p
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs
- 1.오디오-비주얼 LLM의 장편 영상 추론서 토큰·KV 캐시 선형 증가 문제를 푸는 메모리 효율 스트리밍 OmniMem 제안
- 2.모든 토큰을 균등 처리하던 기존과 달리 시각·오디오 컨텍스트를 분리 관리하는 모달리티 인식 메모리 할당
- 3.섭동 인식 메모리 선택으로 유익·비중복 KV 상태 보존, 예산 인식 파인튜닝도 탐구
- 4.video-SALMONN 2+·Qwen-2.5-Omni서 동일 예산 대비 2~4%p 정확도 향상
왜 중요한가?
장편 영상 이해의 핵심 병목인 메모리 선형 증가를 모달리티별 할당으로 해결해 동일 메모리에서 정확도를 높였다는 점에서, 자원 제약 하 오디오-비주얼 LLM 배포에 실질적 개선이다.
장시간 오디오-비디오 콘텐츠 처리에 특화된 LLM 메모리 압축 기술 'OmniMem'은 한국의 미디어 및 스트리밍 산업에 중요한 기술적 돌파구를 제시합니다. 대용량 멀티모달 데이터 처리의 한계를 극복하여 스마트 감시, 콘텐츠 분석, 실감형 미디어 등 차세대 서비스 개발에 필수적인 기술이 될 것입니다.
본문 미리보기
arXiv:2606.07577v1 Announce Type: new Abstract: Audio-visual large language models (LLMs) hold strong promise for long-form video understanding, yet their long-video inference is fundamentally limited by the linear growth of video tokens and key-value (KV) caches. We present OmniMem, a memory-efficient streaming framework designed specifically for audio-visual LLMs. Unlike existing compression methods that treat all tokens uniformly, OmniMem introduces a modality-aware memory allocation strateg
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:12AI 초안

