이 논문은 저작권 문제로 안정적인 벤치마크 구축이 어려웠던 할리우드 영화 서사 이해 연구를 위해 새로운 데이터셋을 구축했다. 1922~1979년 버라이어티지 발표 주간 박스오피스 수익을 최초로 대규모 공개하고, 저작권 등록·갱신 기록을 조사해 퍼블릭도메인일 가능성이 높은 영화들을 선별하는 두 가지 기준으로 컬렉션을 구성했다. 이를 기반으로 영화 서사 요소를 평가하는 멀티모달 객관식 벤치마크를 만든 결과, 다수의 비전-언어 모델이 거의 무작위 수준의 낮은 정확도를 보였고, 오디오까지 활용하는 오디오-비주얼 모델도 최고 61.1%에 그쳐 인간 수준에는 크게 못 미쳤다. 이는 현재 멀티모달 모델의 영화 서사 이해 능력이 여전히 제한적임을 보여준다.
- •저작권 문제 회피 위해 박스오피스 흥행·퍼블릭도메인 가능성 기준으로 영화 컴렉션 구축
- •1922~1979년 버라이연티지 주간 박스오피스 데이터 최초 대규모 공개
- •다수 비전-언어 모델이 서사 이해 벤치마크에서 거의 무작위 수준 정확도
- •오디오-비주얼 모델 최고 정확도 61.1%로 인간 수준에 크게 못 미침
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Evaluating Multimodal Narrative Understanding of Popular Hollywood Films
- 1.1922~1979년 버라이어티지 주간 박스오피스 데이터 첫 대규모 공개, 저작권 만료 가능성 높은 영화로 벤치마크 구축
- 2.영화 서사 요소를 평가하는 새 멀티모달 객관식 벤치마크 제시
- 3.다수 비전-언어 모델이 거의 무작위 수준 정확도, 음성-영상 결합 모델도 최고 61.1%로 인간 수준에 못 미침
왜 중요한가?
저작권 문제로 대규모 영화 데이터 확보가 어려웠던 서사 이해 연구에 공개 가능한 벤치마크를 제공하면서, 현재 멀티모달 모델이 영화 서사 이해에서 여전히 크게 뒤처져 있음을 정량적으로 보여준다.
본문 미리보기
arXiv:2608.21430v1 Announce Type: new Abstract: Multimodal language models increasingly show promise for enabling the large-scale computational analysis of film, opening up new avenues for learning about film history and the evolution of narrative techniques. But the creation of stable benchmarks built around Hollywood films is complicated by copyright protections. In this work, we address these concerns directly, by building a new collection of Hollywood films defined by two criteria: box offi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
