ViSAGE는 장시간 영상을 이해하는 멀티모달 에이전트를 위한 자기교정형 메모리 프레임워크로, 기존 방식이 공격적 압축과 구간별 처리 과정에서 세밀한 개체 식별 단서를 소실하고 벡터 유사도 검색에 과도하게 의존해 개체 혼동과 환각 답변을 유발하는 문제를 해결한다. 긴 시간 범위에 걸쳐 개체 정체성을 교차 모달 결합으로 고정(anchoring)하고, 지연된 식별 증거를 전파해 과거 기록을 소급 통합하는 양방향 메모리 정제를 적용한다. 또한 검색된 증거를 개체-증거 정합 제약 아래 다중 에이전트로 교차 검증해, 증거가 불충분할 때는 근거 없는 답변 대신 응답을 보류할 수 있게 했다. 실험 결과 ViSAGE는 가장 강력한 기존 기준선 대비 정확도를 5.9% 높이는 성능을 지속적으로 보였다.
- •장시간 영상 이해를 위한 자기교정형 개체 중심 메모리 프레임워크 ViSAGE를 제안했다.
- •교차 모달 결합으로 개체 정체성을 고정하고 지연된 증거를 소급반영하는 양방향 메모리 정제를 적용했다.
- •다중 에이전트 교차검증으로 증거 불충분 시 응답을 보류할 수 있게 했다.
- •가장 강력한 기존 기준선 대비 정확도를 5.9% 향상시켰다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding
본문 미리보기
arXiv:2607.28678v1 Announce Type: new Abstract: Multimodal agents operating in long-horizon environments must build and continually update multimedia memories to support entity-consistent, temporally grounded reasoning. However, existing agentic memory approaches often discard fine-grained dentity cues under aggressive compression and segment-wise processing. They also rely heavily on vector similarity retrieval, which can surface semantically related yet identity-mismatched evidence, leading t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:10AI 초안

