구글이 제미나이 3.7 플래시, 3.6 플래시, 3.5 플래시-라이트 모델에 고정 프레임 방식 대신 모델이 스스로 영상에서 필요한 구간을 찾아 분석하는 에이전트 기반 비디오 분석 기능을 도입했다. 이 방식은 1H-VideoQA와 LVBench 벤치마크에서 토큰 사용량을 최대 88% 줄이고 비용을 66% 절감하면서 정확도는 오히려 소폭 향상시켰다. 기존에는 초당 1프레임의 고정 속도로 영상을 샘플링했지만, 새 기능은 모델이 프레임·오디오·자막 중 어떤 모달리티를 어떤 속도로 살펴볼지 스스로 판단하며 1초 미만의 짧은 장면 전환이나 상태 변화도 포착한다. 특히 10분짜리 튜토리얼부터 수 시간 분량의 녹화 영상까지 긴 영상에서 효율이 두드러진다. 이 기능은 현재 제미나이 API를 통해 추가 비용 없이 이용 가능하며, 향후 제미나이 앱과 유튜브의 'Ask YouTube' 기능에도 순차 적용될 예정이다.
- •제미나이 3.7·3.6 플래시·3.5 플래시-라이트에 에이전트 기반 비디오 분석 기능 도입
- •1H-VideoQA·LVBench에서 토큰 사용량 88% 감소, 비용 66% 절감, 정확도는 소폭 향상
- •모델이 프레임·오디오·자막 중 어떤 양식을 어떤 속도로 볼지 스스로 결정, 1초 미만 장면 전환도 포착
- •1월 출시된 '에이전트적 비전(agentic vision)' 이미지 기능을 영상으로 확장한 후속작
- •현재 제미나이 API에서 추가 비용 없이 제공, 향후 제미나이 앱·유튜브 'Ask YouTube'에도 적용 예정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Google Gemini's new agent-based video analysis cuts token usage by up to 88 percent
본문 미리보기
Google is adding agent-based video analysis to Gemini 3.7 Flash, 3.6 Flash, and 3.5 Flash-Lite. Instead of scanning videos frame by frame at a fixed rate, the model decides on its own which segments to examine and at what resolution. Google says this cuts token usage by up to 88 percent while improving accuracy, especially for multi-hour footage. The article Google Gemini's new agent-based video analysis cuts token usage by up to 88 percent appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
